
- 신규 사용자가 관심사를 선택하면 그에 맞는 콘텐츠/상품을 첫 화면부터 추천하는 방식
- 서비스 이탈률을 줄이고 초기 참여도를 높이는 데 효과적
- 주의할 점: 가입 직후 관심사 선택을 강요하면 거부감이 생길 수 있어 최소한의 맥락 제공과 이후 수정 가능한 유연한 설계가 중요
- 프로세스는 데이터 수집 및 텍스트 전처리 → 키워드 임베딩 및 중요도 계산(TF-IDF) → 키워드 클러스터링 및 분류(K-Means) → 개인화된 추천 제공 순으로 이어짐
데이터 수집 및 텍스트 전처리 : 상품명, 설명, 속성, 브랜드, 카테고리 등 상품 상세 정보 텍스트를 수집. spaCy로 토큰화, 개체명 인식(NER), 품사 태깅(POS Tagging), 불용어 제거, 소문자 변환 순으로 정제. 브랜드(ORG), 상품(PRODUCT), 소재(MATERIAL), 디자인(DESIGN) 등으로 엔터티를 분류
키워드 임베딩 및 중요도 계산(TF-IDF) : TF(단어 빈도)가 높을수록, IDF(역문서 빈도)가 높을수록 중요한 단어로 판단. TF-IDF = TF × IDF. "dress"처럼 전체 상품에 흔히 등장하는 단어는 IDF가 낮아 중요도가 감소하고, "embroidery"처럼 희귀한 단어는 IDF가 높아 중요도 증가. scikit-learn의 TfidfVectorizer로 구현. 이 과정으로 상품을 수치 벡터로 변환해 머신러닝 적용 가능
키워드 클러스터링 및 분류 : scikit-learn의 K-Means로 유사한 의미의 키워드를 K개 그룹으로 자동 분류. 예를 들어 Cluster 0: 핏 관련(“fit”, “flare”, “fitted”), Cluster 1: 의류 종류, Cluster 2: 브랜드/일반 설명, Cluster 3: 디자인 요소. 클러스터별 핵심 키워드를 스타일, 디자인, 소재, 핏 같은 관심사 카테고리로 매핑
개인화된 추천 제공 : 사용자가 선택한 관심사 카테고리를 기반으로 해당 속성이 높은 상품을 추천