본문 바로가기
← 메인으로
추천

온보딩 개인화

게시 2023-05-01

온보딩 개인화 프로세스를 단계별로 나타낸 흐름도. 데이터 수집 및 텍스트 전처리(상품명/설명/속성/브랜드/카테고리 텍스트 수집, 토큰화/개체명 인식/품사 태깅/불용어 제거 등), 키워드 임베딩 및 중요도 계산 TF-IDF 적용(희소하지만 중요한 단어에 높은 가중치 부여, 텍스트를 다차원 벡터 공간으로 변환), 키워드 클러스터링 및 분류 K-Means 클러스터링(유사한 의미의 키워드를 K개 그룹으로 자동 분류, 클러스터 핵심 키워드를 관심사 카테고리로 매핑), 관심사 카테고리 분류(스타일, 디자인, 소재, 핏 등) 및 개인화된 추천 제공(사용자가 선택한 관심사 기반 상품 추천) 순으로 이어지는 구조.

  • 신규 사용자가 관심사를 선택하면 그에 맞는 콘텐츠/상품을 첫 화면부터 추천하는 방식
  • 서비스 이탈률을 줄이고 초기 참여도를 높이는 데 효과적
  • 주의할 점: 가입 직후 관심사 선택을 강요하면 거부감이 생길 수 있어 최소한의 맥락 제공과 이후 수정 가능한 유연한 설계가 중요
  • 프로세스는 데이터 수집 및 텍스트 전처리 → 키워드 임베딩 및 중요도 계산(TF-IDF) → 키워드 클러스터링 및 분류(K-Means) → 개인화된 추천 제공 순으로 이어짐

데이터 수집 및 텍스트 전처리 : 상품명, 설명, 속성, 브랜드, 카테고리 등 상품 상세 정보 텍스트를 수집. spaCy로 토큰화, 개체명 인식(NER), 품사 태깅(POS Tagging), 불용어 제거, 소문자 변환 순으로 정제. 브랜드(ORG), 상품(PRODUCT), 소재(MATERIAL), 디자인(DESIGN) 등으로 엔터티를 분류

키워드 임베딩 및 중요도 계산(TF-IDF) : TF(단어 빈도)가 높을수록, IDF(역문서 빈도)가 높을수록 중요한 단어로 판단. TF-IDF = TF × IDF. "dress"처럼 전체 상품에 흔히 등장하는 단어는 IDF가 낮아 중요도가 감소하고, "embroidery"처럼 희귀한 단어는 IDF가 높아 중요도 증가. scikit-learn의 TfidfVectorizer로 구현. 이 과정으로 상품을 수치 벡터로 변환해 머신러닝 적용 가능

키워드 클러스터링 및 분류 : scikit-learn의 K-Means로 유사한 의미의 키워드를 K개 그룹으로 자동 분류. 예를 들어 Cluster 0: 핏 관련(“fit”, “flare”, “fitted”), Cluster 1: 의류 종류, Cluster 2: 브랜드/일반 설명, Cluster 3: 디자인 요소. 클러스터별 핵심 키워드를 스타일, 디자인, 소재, 핏 같은 관심사 카테고리로 매핑

개인화된 추천 제공 : 사용자가 선택한 관심사 카테고리를 기반으로 해당 속성이 높은 상품을 추천