본문 바로가기
← 메인으로
챗봇

멀티모달 챗봇

게시 2024-12-20

멀티모달 챗봇 프로세스를 나타낸 흐름도. 다양한 입력 형식(텍스트 질문/명령, 이미지 사진/스크린샷, 음성 녹음, 위치 좌표/주소, 동영상 영상 클립)이 모달별 처리 파이프라인으로 분기됨. 텍스트는 sentence-transformers 임베딩, 이미지는 CLIP 분석/OCR Tesseract, 음성은 Whisper 텍스트 변환, 위치는 Maps API, 동영상은 ffmpeg 프레임 추출/오디오 추출 후 Whisper로 처리. 각 처리 결과는 공통 의미 표현으로 변환되어 통합된 후, 대화 모델이 맥락에 맞는 일관된 응답을 생성하는 구조. 인식 불확실 시 예외 처리로 사용자에게 추가 확인 요청.

  • 텍스트뿐만 아니라 이미지, 음성, 동영상, 위치 정보 등 다양한 입력 방식을 지원하는 챗봇
  • 단일 모델로 모든 입력을 처리하는 것이 아니라, 입력 유형별로 서로 다른 모델이 처리한 뒤 공통된 대화 흐름으로 통합하는 구조
  • 이커머스, 헬스케어, 여행 등 시각/음성 정보가 중요한 분야에서 효과적
  • 프로세스는 다양한 입력 형식 수신 → 모달별 처리 파이프라인 → 의미 정보 통합 → 응답 생성 순으로 이어짐

텍스트 처리 : sentence-transformers로 임베딩 후 FAISS로 유사 정보 검색. 기존 챗봇과 동일한 방식

이미지 처리 : CLIP 모델로 이미지를 텍스트와 같은 임베딩 공간으로 변환. 이미지 내 텍스트는 Tesseract OCR로 추출. 사용자가 상품 사진을 올리면 챗봇이 모델명을 추출하고 재고/매장 정보를 안내하는 식으로 활용

음성 처리 : Whisper로 음성을 텍스트로 변환. 변환 이후에는 텍스트 입력과 동일하게 처리하므로 대화 흐름이 끊기지 않음. 다양한 언어 지원

위치 정보 처리 : Google Maps API/OpenStreetMap과 연동. 좌표/주소를 해석해 매장 안내, 길찾기, 지역 맞춤형 정보 제공에 활용

동영상 처리 : ffmpeg로 영상에서 오디오 또는 프레임 분리 → Whisper(음성 텍스트 변환) 또는 CLIP(프레임 이미지 분석)으로 처리. 실시간 전체 영상 분석보다 부분 분석 방식이 일반적

예외 처리 설계 : 이미지 품질 저하, 음성 인식 오류 등에 대비한 보완적 흐름 필수. 인식 결과가 불확실하면 추가 질문 유도 또는 선택지 제시. 모바일 환경에서는 카메라 접근 권한, 마이크 사용, 업로드 속도 등 실사용 환경도 고려 필요