
- STT, TTS, NLU, 추천 시스템 등 다양한 AI 기술을 결합해 고객 응대 품질과 운영 효율을 동시에 향상시키는 시스템
- 기존 번호 입력 방식 대신 자연어로 말하면 시스템이 의미를 이해하고 음성으로 응답
- 구현 방식은 두 가지로 나뉨 : AI가 직접 고객과 대화하는 자동화된 보이스봇, 상담사 통화를 AI가 실시간으로 보조하는 상담보조 시스템
- 프로세스는 음성 인식(STT) → 의도 분석 → 검색/추천 → 음성 합성(TTS) 순으로 이어짐
음성 인식(STT) : Whisper가 가장 널리 쓰이는 오픈소스 엔진. 다양한 언어와 잡음 환경을 지원. 실시간 콜센터에 적용하려면 추가 최적화 필요 : 모델 크기 축소(tiny/small), 양자화(모델 크기 최대 4배 감소), 청킹 기법(1~3초 단위로 분할 처리), faster-whisper 활용(원본 대비 최대 4배 빠른 처리). 실무에서는 Whisper small + 양자화 + faster-whisper 조합이 대부분의 실시간 요구사항을 충족
의도 분석 : 텍스트로 변환된 고객 음성에서 의도를 분류. “배송 문의”, “환불 요청” 등으로 라벨링된 상담 데이터로 BERT 기반 모델을 파인튜닝하거나 Scikit-learn으로 텍스트 분류 모델 구성
검색 및 추천 연계 : 의도 파악 후 FAQ 범위라면 규칙 기반 응답 생성. 상담 기록/제품 정보 등 복합 정보가 필요하면 BERT/Universal Sentence Encoder로 과거 상담 사례를 벡터화하고 FAISS로 유사 사례 매칭
음성 합성(TTS) : Tacotron2(억양/높낮이/길이 자연스럽게 구현)와 FastSpeech2(빠른 속도, 실시간 서비스에 적합)가 대표 엔진. 텍스트 → 스펙트로그램 → 실제 음성 순으로 변환. Mozilla TTS(설정 쉬움), ESPnet(커스터마이징에 적합) 등 오픈소스 활용 가능
실시간 스트리밍 구조 : 웹소켓으로 음성 실시간 수신. 발화 감지(VAD)로 실제 말하는 구간만 선별 처리. OpenTelemetry로 실시간 모니터링. 메시지 큐 시스템으로 전체 처리 흐름 관리