본문 바로가기
← 메인으로
데이터

데이터 준비

게시 2024-03-09

데이터 준비

AI 전환에서 가장 먼저 해야 할 일은 기존 데이터를 AI가 활용할 수 있는 형태로 만드는 것이다. 데이터를 구조화하고 정제하는 과정은 데이터 모델링, 스키마 정의, 전처리를 통해 이루어진다.

모델링, 스키마, 전처리

  • 데이터 모델링(Data Modeling) : 데이터 간의 관계를 정의하는 과정이다. 예를 들어 유통업에서 고객 ID를 기준으로 매장 방문, 구매 이력, 프로모션 데이터를 연결해야 AI가 유의미한 분석을 수행할 수 있다.
  • 스키마 정의(Schema Definition) : 각 데이터의 특성과 형태(숫자, 날짜 등)를 설정하는 것이다. AI에게 데이터를 읽는 구체적인 지침을 제공하는 역할을 한다.
  • 전처리(Preprocessing) : 불완전한 데이터를 정제하는 규칙이다. 결측치를 채우거나 중복을 제거하고, 이상치를 조정하여 데이터의 품질을 확보한다.

데이터 구조와 유형

AI가 학습하거나 예측하려면 일관된 데이터 구조가 필요하다. 데이터는 그 형태에 따라 세 가지 유형으로 구분된다.

  • 정형 데이터(Structured Data) : 표 형태로 구조화되어 있으며 숫자, 날짜 등 형식이 정해져 있어 처리가 비교적 단순하다.
  • 비정형 데이터(Unstructured Data) : 텍스트, 이미지, 음성 등 고정된 구조가 없는 데이터다. 토큰화, 벡터화 등 복잡한 변환 과정이 필요하며 처리 비용이 높다.
  • 반정형 데이터(Semi-structured Data) : JSON, XML, 로그 파일처럼 일정 패턴은 있지만 구조가 완전히 고정되지 않은 유연한 형태다.

데이터 가공 및 클렌징

AI는 숫자를 인식할 뿐 그 의미를 스스로 이해하지 못하므로, 사람이 데이터에 일관된 의미를 부여하고 표준화된 구조로 정리해야 한다.

  • 데이터 클렌징(Data Cleansing) : 데이터의 정확성, 일관성, 완전성, 유효성을 보장하기 위해 오류를 수정하고 불필요한 부분을 제거하는 정제 과정이다.
  • 데이터 변환(Data Transformation) : AI가 처리할 수 있도록 데이터를 바꾸는 과정으로, 인코딩과 스케일링이 대표적이다.

정규화와 표준화

데이터의 수치 단위가 다를 경우 AI가 특정 변수에 과도한 가중치를 두지 않도록 수치 범위를 조정해야 한다.

  • 정규화(Normalization) : 서로 다른 크기의 데이터를 0~1 사이로 조정하여 같은 기준에서 비교할 수 있게 한다. (예: 나이와 연봉의 단위 차이 극복)
  • 표준화(Standardization) : 평균을 0, 표준편차를 1로 만들어 데이터가 전체 분포에서 차지하는 상대적 위치를 기준으로 공정하게 비교한다.

인코딩 (Encoding)

글자로 된 범주형 데이터를 AI가 계산할 수 있는 숫자로 변환하는 과정이다.

  • 원-핫 인코딩(One-Hot Encoding) : 각 범주를 독립적인 차원으로 분리하여 순서나 크기 차이 없이 서로 다른 값임을 인식하게 한다.
  • 라벨 인코딩(Label Encoding) : 각 범주에 숫자를 부여하는 방식으로, 숫자의 크기가 왜곡을 줄 수 있으므로 순서가 의미 있는 데이터에 주로 사용한다.
  • 텍스트 데이터 변환 : 토큰화(Tokenization)를 통해 단어 단위로 분할한 후, 벡터화(Vectorization)를 거쳐 숫자 형태로 변환한다.

라벨링 (Labeling)

지도학습에서 AI에게 정답이 무엇인지 알려주는 기준을 설정하는 과정이다.

  • 지도학습 라벨링 : 특정 특징(이탈 고객 등)에 정답지(1 또는 0)를 붙여 AI가 판단 기준을 학습하게 한다.
  • 비지도학습 : 라벨 없이 데이터 내의 숨겨진 패턴이나 그룹을 발견한다.
  • 강화학습 보상 설계 : 라벨 대신 행동 결과에 따른 점수(보상)를 부여하여 AI가 스스로 최적의 행동 패턴을 학습하도록 유도한다.

마무리

데이터 준비의 모든 선택은 AI가 어떤 변수에 더 큰 가중치를 부여하고 어떤 패턴을 학습할지를 결정한다. 이 과정을 거쳐야만 데이터는 비로소 AI가 이해 가능한 자산이 되며 모델 학습이 가능해진다.