본문 바로가기
← 메인으로
법령 해설

제15조 정확성, 견고성 및 사이버보안

게시 2025-10-08

제15조 정확성, 견고성 및 사이버보안(Accuracy, Robustness and Cybersecurity)은 고위험 AI 시스템이 운용 전반에 걸쳐 신뢰성 있게 기술 성능을 유지하기 위한 기술 요건을 규정하고 있다. 즉, 시스템이 오류, 고장, 외부 위협까지 고려하여 정확성, 견고성, 사이버보안을 갖추어야 하는 것이다.

그런데 정확성과 견고성의 적정 수준에 대한 측정 기준은 확정하기 어렵다. AI의 활용 분야가 다양하고 기술 발전 속도도 빠르기 때문에 하나의 기준을 적용하기 어렵기 때문이다.

이러한 이유로 AIA는 집행위원회가 계량 및 벤치마킹 기관, 표준화 단체, 산업계 등 이해관계자와 협력하여 성능 지표와 측정 방법론을 마련하도록 요구하고 있다. 현실적으로 검증 가능한 도구와 방법을 모색하기 위해 다양한 주체의 전문성과 경험을 반영하려는 의도로 볼 수 있다.

고위험 AI 시스템의 정확성 수준과 관련 지표는 반드시 사용 지침서에 명시되어야 한다. 아직 측정 기준이 마련되지 않은 상황이지만 제공자가 자체적으로 시험한 결과와 성능 지표를 공개하는 것이다. 이를 통해 배포자는 시스템의 성능과 한계를 객관적으로 파악할 수 있으며, 향후 집행위원회와 이해관계자가 마련할 측정 기준이 확정되면 그에 맞춰 일관성 있게 반영되도록 하는 것이다.

AIA는 견고성을 더 강조된다. 시스템은 내부 오류나 외부 영향에도 안정적으로 작동해야 한다. 이를 위해 제공자는 기술·조직적인 조치를 마련해야 하며, 필요할 경우 백업이나 페일세이프 같은 이중화 장치를 도입해야 한다. 시장 출시 이후에도 편향된 출력이 입력으로 되돌아와 편향이 누적되는 피드백 루프를 방지해야 한다. 이를 위해 독립적인 검증 데이터셋 활용, 주기적인 리셋, 인간 감독자의 정기 평가 등 적절한 완화 장치가 필요하다.

독립적인 검증 데이터셋은 훈련 데이터 외 별도로 마련된 데이터셋으로 모델이 이미 학습한 데이터에만 맞춰져 있지 않고 새로운 상황에서도 제대로 작동하는지를 확인하는 데 쓰인다. 예를 들어 자율주행차가 특정 지역의 도로 데이터로만 학습했다면, 다른 환경에서 테스트해야 실제 성능과 편향 여부를 검증할 수 있다.

주기적인 리셋은 모델이 자기 피드백으로 편향된 데이터를 계속 축적하지 않도록 주기적으로 학습 상태를 초기화하거나 점검하는 과정이다. 이는 추천 알고리즘이 특정 콘텐츠만 반복적으로 노출하여 왜곡된 결과를 만들어내는 현상을 방지하는 데 효과적이다.

인간 감독자의 정기 평가는 시스템의 생성 결과를 전문가가 직접 확인하고 필요 시 교정하는 절차를 말한다. 예를 들어 채용 과정에서 특정 성별이나 인종을 불리하게 평가하는 문제, 추천 알고리즘이 사회적 양극화를 심화시키는 결과 등은 단순 성능 지표만으로는 포착되지 않는다. 이처럼 인간 감독은 기술적 안전장치만으로는 드러나지 않는 오류나 사회적 영향을 검토하기 위해 필요하다.

사이버보안 요건도 고위험 AI 시스템에 필수적으로 적용된다. 제3자가 시스템의 취약점을 악용해 사용 방식, 출력, 성능을 바꾸지 못하도록 해야 한다. 특히 AI 특유의 공격 유형에 대응하는 기술 방안을 포함해야 한다. 대표적으로 데이터 중독, 모델 중독, 적대적 예제, 회피 공격, 기밀성 공격 등이 있다.

  • 데이터 중독 (Data poisoning) : 훈련 데이터셋에 악의적인 데이터를 섞어 모델이 잘못된 규칙을 학습하도록 유도하는 공격이다. 예를 들어 채용 AI의 훈련 데이터에 특정 대학 출신을 과도하게 긍정적으로 라벨링한 이력서를 대량 주입하면, 모델은 실제 역량과 무관하게 해당 대학 출신 지원자를 우선적으로 선호하는 편향된 판단을 학습하게 된다.
  • 모델 중독 (Model poisoning) : 학습 과정에서 활용되는 사전 학습된 구성 요소나 외부 라이브러리를 변조하여 전체 시스템 성능을 훼손하는 공격이다. 공급망 공격과 유사하게, 제공자가 의존하는 외부 자원이 변질되면 최종 모델도 오염된다.
  • 적대적 예제 (Adversarial examples) : 입력 데이터를 아주 미세하게 변형하여 사람이 보기에는 같아 보이지만, 모델은 전혀 다른 결과를 내도록 하는 방식이다. 예컨대 고양이 사진의 픽셀을 교묘히 바꾸어 모델이 늑대로 오인하게 만들 수 있다.
  • 회피 공격 (Model evasion) : 탐지 시스템을 속여 우회하는 기법으로 보안 검색 시스템이 위험 물체를 정상으로 인식하게 하거나 스팸 필터를 피하도록 이메일을 조작하는 사례가 해당한다.
  • 기밀성 공격 (Confidentiality attacks) : 모델 파라미터나 학습 데이터에 포함된 민감 정보를 역추출하는 시도로 반복 질의를 통해 의료 데이터나 개인정보가 유출될 수 있다. 이는 단순한 성능 문제를 넘어 기본권과 직결되는 심각한 위협으로 평가된다.

제15조는 고위험 AI 시스템이 정확성과 견고성으로 내부적인 신뢰성을 확보하고, 사이버보안으로 외부적인 위협에 대응할 수 있는 이중적인 안전망을 갖추도록 요구한다. 즉, 시스템이 기술적인 차원과 운영적인 차원 모두에서 안정성을 유지하도록 하는 것이다.