모델 선택 가이드
작업에 맞는 모델을 고르는 게 품질·비용·지연을 좌우합니다. 실제 가용 목록은 GET /v1/models로 확인하고,
아래는 작업별 대표 모델 유형입니다.
작업별 추천
| 작업 | 모델 유형 | 대표 예 |
|---|---|---|
| 일반 채팅·작성 | 중대형 채팅 LLM | qwen2.5-72b |
| 한국어 특화 | 한국어 강한 LLM | exaone-3.5-32b |
| 코드 생성 | 코드 특화 | qwen2.5-coder-32b |
| 복합 추론 | 추론(reasoning) 모델 | deepseek-r1-distill-* |
| 경량·빠른 응답 | 소형 LLM | phi-4 · mistral-7b |
| 임베딩(RAG 벡터화) | 임베딩 | bge-m3 (다국어) |
| 리랭킹 | 리랭커 | bge-reranker-v2-m3 |
| 이미지·문서(OCR) | 비전 | qwen2.5-vl-* |
| 음성→텍스트(STT) | ASR | whisper-large-v3 |
| 안전 판정 | 모더레이션 | granite-guardian-* |
모델 id·가용성은 배포마다 다릅니다. 코드에 하드코딩하지 말고
spec.models(AppSpec)나 환경변수로 주입하세요.
크기 vs 비용·지연
- 소형: 분류·추출·짧은 요약 — 싸고 빠름.
- 중형: 일반 대화·작성.
- 대형/추론: 복합 추론·긴 문서 — 필요할 때만. 비용·지연.
"큰 모델 하나로 다"보다 단계별로 맞는 크기를 조합하는 게 유리합니다.
컨텍스트 길이
- 긴 문서·대화는 컨텍스트 상한을 확인하세요. RAG로 관련 부분만 넣으면 컨텍스트·비용을 아낄 수 있습니다.
다국어
- 한국어는 한국어 특화 모델 + 다국어 임베딩(
bge-m3)이 유리. 추론 모델의 사고 언어 함정은 다국어 가이드 참고.