어떤 형태의 데이터를 입력받느냐 또는 어떤 목적으로 사용하느냐에 따라 모델의 구조와 기능이 결정된다. 따라서 AI를 도입할 때는 먼저 분류 체계를 이해한 후 모델 유형을 선택해야 한다.
모델의 분류 체계 AI 모델은 데이터 형태 → 수행할 작업 → 시스템 구성 → 특화 수준 순서를 기준으로 다음과 같은 기준으로 분류할 수 있다.
- 입력 데이터 형태 : 모델의 기본 구조를 결정한다. 텍스트를 처리하는 모델과 이미지를 처리하는 모델은 완전히 다른 아키텍처를 가지기 때문이다.
- 작업 목적 : 모델이 어떤 종류의 결과를 출력할지 결정한다. 같은 텍스트 모델이라도 분류와 생성은 전혀 다른 방식으로 동작한다.
- 구성 방식 : 복잡한 업무를 처리할 때 모델을 어떻게 조합할지 결정한다.
- 특화 정도 : 도메인 최적화와 범용성 사이의 균형점을 결정한다.
입력 데이터별 분류 판단 목적이 같더라도 텍스트, 이미지, 음성, 수치 데이터는 전혀 다른 방식으로 처리되어 모델 설계와 처리 방식도 달라진다.
- 텍스트 기반 모델 : 문장, 문서, 메시지 등 언어로 표현된 정보를 자연어 처리 기술로 의미를 해석하고 결과를 출력하는 모델이다. 고객 문의 자동 분류, 계약서 요약, 마케팅 문구 생성, 챗봇 응답 등 언어와 관련된 모든 업무에 적용할 수 있다. 특히 사무직 업무의 상당 부분이 텍스트 처리와 관련되어 있어 도입 효과가 크다.
- 이미지 기반 모델 : 사진, 그림, 의료영상, 위성사진 등 시각적인 정보를 입력받아 내용을 분석하고 판단하는 모델이다. 컴퓨터 비전(Computer Vision) 기술을 활용하여 제조업, 의료, 보안, 유통업에서 폭넓게 활용된다. 제품 불량 검사, 의료 영상 진단, CCTV 모니터링, 상품 이미지 분류 등에 사용되며, 사람의 눈으로 판단하던 작업을 자동화할 수 있다. 정확도가 높고 처리 속도가 빨라 실시간 품질 관리에 적합하다.
- 음성 기반 모델 : 사람의 목소리나 오디오 신호를 입력받아 내용을 이해하거나 새로운 음성을 생성하는 모델이다. 음성 인식(Speech Recognition)과 음성 합성(Speech Synthesis) 기술을 활용하여, 콜센터 상담 내용 분석, 회의록 자동 작성, AI 스피커 음성 명령 처리, 고객 응대 시스템 등에 활용된다. 특히 서비스업에서 고객 접점 자동화와 업무 효율성 향상을 위해 도입이 증가하고 있다.
- 수치 데이터 기반 모델 : 매출, 재고, 온도, 압력, 클릭률 등 숫자로 표현되는 정보를 입력받아 패턴을 분석하고 예측하는 모델이다. 통계적인 모델링, 머신러닝, 딥러닝 등 다양한 기법을 활용하여 구현된다. 매출 예측, 재고 최적화, 고객 이탈 분석, 설비 고장 예측, 마케팅 효과 측정 등에 사용된다.
- 멀티모달 모델 : 텍스트, 이미지, 음성 등 여러 형태의 데이터를 동시에 입력받아 처리하는 모델이다. 단일 형태 데이터로는 해결하기 어려운 복잡한 업무에 활용된다. 제품 이미지와 설명 텍스트를 분석한 상품 추천, 동영상의 영상과 음성을 결합한 콘텐츠 요약, 의료 차트와 영상을 통합한 진단 지원 등에 사용된다. 아직 발전 단계이지만 향후 AI의 주요 발전 방향으로 주목받고 있다.
작업 목적별 분류 분류, 예측, 요약, 생성, 대화, 추출 등 AI 모델이 수행하는 작업의 종류는 매우 다양하다. 각 모델이 어떤 작업을 잘 하는지 파악한 후 업무에 적합한 모델을 선택하는 것이 중요하다.
- 분류(Classification) : 가장 널리 사용되는 모델 유형이다. 주어진 입력이 어떤 범주에 속하는지를 판단한다. 고객 민원의 유형을 구분하거나, 의료 데이터에서 질병 코드를 예측하거나, 문서가 어떤 주제에 해당하는지를 식별하는 작업 등처럼. 분류 모델은 명확한 기준이 있을 때 적합하여, 이메일 스팸 필터링, 상품 카테고리 자동 분류, 고객 세그먼트 구분 등에서 널리 활용된다.
- 예측(Prediction) : 미래의 상태를 추정하거나 수치 값을 계산하는 데 사용된다. 이탈 가능성이나 다음 달의 매출처럼 과거 데이터로 앞으로의 상황을 판단할 때 적합하다. 예측 모델은 수치형 결과를 다루므로 시간 축이나 연속적인 특성을 고려하는 경우가 많아, 재고 관리, 수요 예측, 예방 정비 등에서 주로 활용된다.
- 요약(Summarization) : 긴 텍스트나 복잡한 정보를 정리하여 핵심을 전달하는 모델이다. 회의록, 보고서처럼 한눈에 보기 어려운 정보를 간결하게 정리해준다. 단순한 문장 압축을 넘어 핵심 메시지를 유지하면서 가독성을 높이는 것이 중요하다.
- 생성(Generation) : 기존 데이터를 재조합하거나 새로운 결과물을 만드는 모델이다. 광고 문구 작성, 상품 설명 생성, 코드 자동 완성 같은 영역에서 사용된다. 생성 모델은 입력된 정보를 참고하되 원본과는 다른 새로운 콘텐츠를 만들어낸다. 새로운 콘텐츠를 만들어야 하거나 일정한 스타일을 유지해야 하는 작업에 적합하다.
- 대화(Conversation) : 질문과 응답이 이어지는 대화를 처리하는 모델이다. 고객 상담, 헬프데스크, AI 코치 등 맥락을 유지하며 상호작용해야 하는 구조가 필요할 때 사용된다. 대화형 모델은 단순한 답변 생성보다 훨씬 복잡하다. 이전 대화 내용을 기억하고 상황에 맞는 적절한 답변을 해야 하기 때문이다. 그래서 사용자의 의도를 파악하고 적절한 응답을 선택하는 능력이 핵심이다.
- 추출(Extraction) : 문서나 텍스트에서 필요한 정보만 선별적으로 뽑아내는 모델이다. 계약서에서 이름, 금액, 날짜를 추출하거나 민원에서 핵심 키워드를 추출하는 방식처럼 특정 정보를 식별하는 데 사용된다.
구성 방식별 분류 단순한 업무는 하나의 판단만으로 해결되지만, 복잡한 업무는 여러 판단을 연속적으로 수행해야 한다. 이에 따라 단일 모델로 처리할지 여러 모델을 조합할지에 따른 구성 방식으로 모델을 분류할 수 있다.
- 단일 모델 : 하나의 모델이 판단을 수행하는 방식이다. 입력부터 출력까지 모든 처리를 단일 시스템에서 완료한다. 고객 문의 분류, 제품 이미지 불량 판별, 문서 감정 분석 등 목적이 명확하고 단순한 업무에 적합하다. 구조가 간단하여 개발과 운영이 용이하고, 처리 속도가 빠르며, 장애 발생 시 원인 파악도 쉽다. 다만 복잡한 업무나 단계별 처리가 필요한 경우에는 한계가 있다.
- 멀티 모델 : 여러 모델이 순차적 또는 병렬적으로 연결되어 복합적인 판단을 수행하는 방식이다. 각 모델이 전문화된 역할을 담당하며, 하나의 출력이 다음 모델의 입력이 되는 파이프라인 구조를 가진다. 고객 상담 시스템에서 문의 분류 → 정보 추출 → 응답 생성 → 만족도 예측 과정이나 의료 진단에서 영상 분석 → 소견 추출 → 진단 추천 과정처럼. 각 단계별로 최적화된 모델을 사용할 수 있어 정확도가 높지만 설계와 운영이 복잡하고 안정성 관리도 까다롭다.
특화 정도별 분류 모델은 활용 범위에 따라 범용성과 특화성으로 구분된다. 범용 모델은 다양한 업무에 손쉽게 적용할 수 있고, 도메인 특화 모델은 특정 분야에서 높은 전문성을 제공한다.
- 범용 모델 : 다양한 분야에서 광범위하게 사용할 수 있는 모델이다. GPT, Claude 같은 대형 언어 모델이 대표적이며, 별도 학습 없이 다양한 업무에 즉시 적용할 수 있다. 초기 도입 비용이 낮고 빠른 적용이 가능하지만, 상대적으로 전문성이 떨어질 수 있다.
- 도메인 특화 모델 : 금융, 의료, 법률 등 특정 분야에 최적화된 모델이다. 해당 분야의 전문 용어와 맥락을 정확히 이해하며 더 신뢰할 수 있는 결과를 제공한다. 전문성은 높지만 개발에 많은 비용이 들고 다른 분야로의 활용에는 제약이 있다.
모델의 유형 모델은 입력 데이터의 형태와 기능에 따라 유형을 나눌 수 있다. 텍스트, 이미지, 음성, 수치 데이터마다 서로 다른 모델이 필요하며, 같은 데이터 형태라도 생성, 분류, 대화 등 기능에 따라 구조와 성능 기준이 다르다.
텍스트 기반 모델 유형 언어로 된 정보를 입력받아 의미를 해석하고 결과를 출력하는 모델이다. 문서 분류, 텍스트 생성, 요약, 번역, 질의응답 등 다양한 언어 작업을 수행할 수 있어 가장 널리 활용된다. GPT, Claude, BERT, T5 등은 모델별 강점이 다르므로 업무 목적에 따라 적절한 모델을 선택해야 한다.
- GPT 계열 : 프롬프트에 맞춘 자연스러운 텍스트 생성이 강점이다. OpenAI의 GPT-4, GPT-3.5가 대표적이며, 창작, 번역, 요약, 대화 등 다양한 작업을 수행할 수 있다. 즉시 활용 가능하지만 데이터가 외부 서버를 거치므로 보안 이슈가 있다.
- Claude 계열 : Anthropic에서 개발한 대화형 AI로 안전성과 정확성에 중점을 둔다. 긴 문서 분석과 복잡한 추론에 뛰어나며, ‘헌법적 AI’(Constitutional AI) 기법으로 윤리적인 원칙을 따라 답변하여 유해하거나 편향된 결과를 방지한다. 기업 환경에서 법적인 리스크를 줄이고 싶을 때 적합하다.
- BERT 계열 : 텍스트의 의미 이해에 특화된 모델이다. 양방향으로 문맥을 파악하여 문서 분류, 감정 분석, 질의응답에 뛰어나다. 생성 능력은 제한적이지만 이해 작업은 매우 정확하다. 한국어 특화 버전인 KoBERT, KR-BERT 등도 제공된다.
- T5 계열 : Google이 개발한 텍스트 변환 기반 모델로 번역, 분류, 질의응답 등 서로 다른 작업을 모두 텍스트 입력과 출력이라는 동일 형식으로 변환하여 하나의 프레임워크에서 통합 처리한다. 작업마다 별도 모델을 만들 필요 없이 문장만 바꿔 입력하면 하나의 모델로 여러 업무를 수행할 수 있다는 점이 특징이다.
- 오픈소스 계열 : Meta의 LLaMA, Mistral, Microsoft의 Phi, 알리바바의 Qwen, DeepSeek 등이 있다. 기업 내부에서 커스터마이징할 수 있고 데이터 보안을 유지할 수 있다는 장점이 있다. 다만 운영을 위한 인프라와 전문 인력이 필요하다.
이미지 기반 모델 유형 이미지 기반 모델은 시각 정보를 인식하고 해석하는 모델이다. 사진, 의료영상, 위성 이미지 등을 입력받아 객체 분류, 이상 감지, 영역 탐지 등을 수행한다. CNN, ResNet, YOLO 등은 정확도와 속도 면에서 각기 다른 강점을 가지며, 제조, 보안, 의료 등 정밀성과 실시간 처리가 요구되는 분야에서 핵심 기술로 활용된다.
- CNN(Convolutional Neural Network) : 이미지 처리의 기본 모델이다. 이미지 특징을 단계적으로 추출하여 분류나 탐지 작업을 수행한다. 제품 품질 검사, 의료 영상 분석 등에 널리 사용되며, 비교적 적은 데이터로도 좋은 성능을 낸다.
- ResNet : 신경망이 깊어도 성능 저하 없이 학습 가능한 모델이다. 복잡한 이미지 분류 작업에서 높은 정확도를 보이며, 의료 진단이나 자율주행차의 객체 인식 등 정밀도가 중요한 분야에서 활용된다.
- YOLO : 실시간 객체 탐지에 특화된 모델이다. 이미지에서 여러 객체를 빠르게 찾아낼 수 있어 보안 시스템, 자율주행, 스마트 팩토리 등에서 사용된다. 속도가 빠르지만 정확도 면에서는 다른 모델에 비해 떨어질 수 있다.
- Vision Transformer : 텍스트 처리에 사용되던 Transformer 구조를 이미지에 적용한 모델이다. 대용량 데이터에서 뛰어난 성능을 보이며, 복잡한 이미지 해석에 적합하다.
- 생성형 이미지 모델 : DALL-E, Midjourney, Stable Diffusion 등이 있다. 텍스트 설명을 통해 새로운 이미지를 생성할 수 있어 디자인, 마케팅 분야에서 활용도가 높다.
음성 기반 모델 유형 음성 기반 모델은 사람의 목소리나 음향 신호를 처리하여 의미를 해석하거나 새로운 음성을 생성하는 모델이다. 음성 인식, 음성 합성, 화자 식별, 감정 분석 등을 수행하며, 텍스트 입력 없이 음성으로 제어할 수 있게 해준다. 고객 상담 자동화, 회의록 작성, 음성 명령 인터페이스 등 사람과 기계 간 상호작용이 필요한 영역에서 활용도가 높다.
- Whisper : OpenAI에서 개발한 음성 인식 모델로 다양한 언어와 억양을 인식한다. 회의록 자동 작성, 고객 상담 내용 기록, 음성 명령 처리 등에 사용되며, 오픈소스로 제공되어 기업 내부에서 활용하기 용이하다.
- WaveNet : Google에서 개발한 음성 합성 모델로 사람과 구별하기 어려울 정도로 자연스러운 음성을 생성한다. 고객 안내 시스템, 오디오북 제작 등에 활용된다.
- Tacotron : 텍스트를 음성으로 변환하는 TTS 모델이다. 다양한 목소리와 감정을 표현할 수 있어 개인화된 음성 서비스나 엔터테인먼트 콘텐츠 제작에 사용된다.
- 음성 분류 모델 : 화자 인식, 감정 분석, 언어 식별 등에 사용된다. 콜센터에서 고객 만족도를 모니터링하거나 보안 시스템에서 신원 확인에 활용된다.
수치 데이터 기반 모델 유형 수치 데이터 기반 모델은 매출, 재고, 사용자 행동 로그 등 정형화된 수치 데이터를 입력받아 예측, 분류, 이상 탐지, 최적화 등을 수행하는 모델이다. 통계적인 기법과 머신러닝 모델로 구현되며, 시계열 예측, 리스크 분석, 고객 세분화 등 분석 업무에서 높은 정확도를 보인다.
- Random Forest : 여러 의사결정나무를 조합한 앙상블 모델로 높은 정확도와 안정성을 보인다. 고객 세분화, 신용 평가, 마케팅 효과 분석 등에 널리 사용되며, 결과 해석이 비교적 용이하다.
- XGBoost : 그래디언트 부스팅 기법을 사용한 고성능 모델이다. 정형 데이터 분석에서 뛰어난 성능을 보이며, 매출 예측, 재고 최적화, 리스크 분석 등에 활용된다.
- LSTM(Long Short-Term Memory) : 시계열 데이터 처리에 특화된 딥러닝 모델이다. 주가 예측, 수요 예측, 센서 데이터 분석 등 시간 흐름이 중요한 업무에 사용된다.
- Prophet : Meta(Facebook)에서 개발한 시계열 예측 모델로 비즈니스 데이터를 활용하여 계절성, 추세 등을 자동으로 감지하고 분석한다. 매출 예측, 사용자 증가 예측 등 비즈니스 데이터 분석에 유용하다.
- 이상 탐지 모델 : 정상 패턴에서 벗어난 데이터를 찾아낸다. 금융 사기 탐지, 설비 고장 예측, 네트워크 보안 등에 사용되며, 리스크 관리에 필수적이다.
이처럼 AI 모델은 입력 데이터의 형태, 판단 목적, 구성 방식, 특화 범위 등 다양한 기준에 따라 분류된다. 이 책에서는 언어 모델을 중심으로 전개하고자 하는데, 그 이유는 모든 모델 유형을 동일한 깊이로 다루면 내용이 중복되고 분량이 과도해져 핵심 메시지가 희석될 수 있기 때문이다. 따라서 이후 설명에서는 언어 모델을 중심으로 모델의 분류, 선택, 활용 방식을 구체적으로 다루되, 필요에 따라 다른 모델도 언급하려고 한다.