본문 바로가기
← 메인으로
데이터

데이터 품질

게시 2024-05-15

잘못된 데이터 하나가 연쇄적인 오작동을 일으킬 수 있다. AI의 자동화 특성상 입력값이 전달되면 판단과 실행이 연속적으로 이어지며, 오류가 있어도 중간에 멈추지 않고 결과로 이어진다.

이상값, 오류, 중복, 결측값은 모든 데이터에 존재한다. 수작업 입력, 단위 불일치, 시스템 간 연동 오류, 사용자 실수 등 발생 원인과 경로는 다양하고 예측하기 어렵다. 잘못된 데이터가 사전 검증 없이 AI 학습에 사용되면 모델이 잘못된 판단 기준을 익히게 된다.

예를 들어 매출 데이터는 정확하지만 할인이나 프로모션 조건이 누락되면 AI는 할인 기간의 높은 매출을 정상 매출로 학습한다. 이렇게 학습된 AI는 비정상적으로 높은 매출을 예상하거나 할인 없이도 같은 매출을 올릴 수 있다고 잘못 판단할 수 있다.

이런 문제는 단순한 입력 오류가 아니라 AI의 판단 구조를 왜곡시키는 설계 결함이다. 겉으로는 정상 작동하는 것처럼 보이지만 내부적으로는 신뢰할 수 없는 결과를 생산한다.

따라서 품질 검증은 필수다. 필수 필드 검증, 이상값 탐지, 품질 허용 수준 관리를 통해 문제 데이터를 사전 차단하고 자동 처리를 통제해야 한다.