
- 고객 분석의 출발점. 고객이 누구인지, 어떤 특성을 갖고 있는지를 데이터로 정리하는 작업
- 이탈 예측, 세분화, 추천, 개인화 마케팅 등 모든 고객 분석은 정확한 프로파일이 전제되어야 가능
- 프로세스는 고객 데이터 수집 → 특성 엔지니어링 → 고객 벡터화 → 벡터 활용 순으로 이어지며, 데이터 파이프라인으로 프로파일을 자동 갱신
고객 데이터 수집 : 인구통계(회원가입), 거래 이력(구매·결제), 행동 정보(로그 데이터), CRM 데이터, 외부 데이터(소셜 미디어, 날씨, 위치)까지 다양한 소스에서 수집. Google Analytics·Firebase로 웹/앱 행동을 수집하고, CRM·CDP로 통합 관리
특성 엔지니어링 : 방대한 로그 데이터를 고객 단위로 요약하는 작업. SQL로 방문 횟수, 평균 구매금액 등을 계산하고, Python pandas로 구매 주기 같은 특성을 만들어냄. featuretools로 특성을 자동 생성하는 방식도 활용
고객 벡터화 : 고객의 특성을 수학적 벡터로 표현해 유사도 계산이나 추천에 활용. Word2Vec을 응용한 방식에서 시작해서 BERT·Transformer 기반 모델로 행동의 맥락과 순서를 더 정교하게 반영. Item2Vec·SBERT는 고객-상품 관계 포착에 특화되어 있고, GNN 기반 임베딩은 고객, 상품, 행동을 그래프 구조로 연결해 더 풍부한 벡터를 생성
고객 벡터 활용 : 유사 고객 그룹화(코사인 유사도 계산), 개인화 추천(고객-상품 벡터 비교) 등에 활용