
- 텍스트뿐만 아니라 이미지, 음성, 동영상, 위치 정보 등 다양한 입력 방식을 지원하는 챗봇
- 단일 모델로 모든 입력을 처리하는 것이 아니라, 입력 유형별로 서로 다른 모델이 처리한 뒤 공통된 대화 흐름으로 통합하는 구조
- 이커머스, 헬스케어, 여행 등 시각/음성 정보가 중요한 분야에서 효과적
- 프로세스는 다양한 입력 형식 수신 → 모달별 처리 파이프라인 → 의미 정보 통합 → 응답 생성 순으로 이어짐
텍스트 처리 : sentence-transformers로 임베딩 후 FAISS로 유사 정보 검색. 기존 챗봇과 동일한 방식
이미지 처리 : CLIP 모델로 이미지를 텍스트와 같은 임베딩 공간으로 변환. 이미지 내 텍스트는 Tesseract OCR로 추출. 사용자가 상품 사진을 올리면 챗봇이 모델명을 추출하고 재고/매장 정보를 안내하는 식으로 활용
음성 처리 : Whisper로 음성을 텍스트로 변환. 변환 이후에는 텍스트 입력과 동일하게 처리하므로 대화 흐름이 끊기지 않음. 다양한 언어 지원
위치 정보 처리 : Google Maps API/OpenStreetMap과 연동. 좌표/주소를 해석해 매장 안내, 길찾기, 지역 맞춤형 정보 제공에 활용
동영상 처리 : ffmpeg로 영상에서 오디오 또는 프레임 분리 → Whisper(음성 텍스트 변환) 또는 CLIP(프레임 이미지 분석)으로 처리. 실시간 전체 영상 분석보다 부분 분석 방식이 일반적
예외 처리 설계 : 이미지 품질 저하, 음성 인식 오류 등에 대비한 보완적 흐름 필수. 인식 결과가 불확실하면 추가 질문 유도 또는 선택지 제시. 모바일 환경에서는 카메라 접근 권한, 마이크 사용, 업로드 속도 등 실사용 환경도 고려 필요