콘텐츠로 이동

모델 선택 가이드

작업에 맞는 모델을 고르는 게 품질·비용·지연을 좌우합니다. 실제 가용 목록은 GET /v1/models로 확인하고, 아래는 작업별 대표 모델 유형입니다.

작업별 추천

작업 모델 유형 대표 예
일반 채팅·작성 중대형 채팅 LLM qwen2.5-72b
한국어 특화 한국어 강한 LLM exaone-3.5-32b
코드 생성 코드 특화 qwen2.5-coder-32b
복합 추론 추론(reasoning) 모델 deepseek-r1-distill-*
경량·빠른 응답 소형 LLM phi-4 · mistral-7b
임베딩(RAG 벡터화) 임베딩 bge-m3 (다국어)
리랭킹 리랭커 bge-reranker-v2-m3
이미지·문서(OCR) 비전 qwen2.5-vl-*
음성→텍스트(STT) ASR whisper-large-v3
안전 판정 모더레이션 granite-guardian-*

모델 id·가용성은 배포마다 다릅니다. 코드에 하드코딩하지 말고 spec.models(AppSpec)나 환경변수로 주입하세요.

크기 vs 비용·지연

  • 소형: 분류·추출·짧은 요약 — 싸고 빠름.
  • 중형: 일반 대화·작성.
  • 대형/추론: 복합 추론·긴 문서 — 필요할 때만. 비용·지연.

"큰 모델 하나로 다"보다 단계별로 맞는 크기를 조합하는 게 유리합니다.

컨텍스트 길이

  • 긴 문서·대화는 컨텍스트 상한을 확인하세요. RAG로 관련 부분만 넣으면 컨텍스트·비용을 아낄 수 있습니다.

다국어

  • 한국어는 한국어 특화 모델 + 다국어 임베딩(bge-m3)이 유리. 추론 모델의 사고 언어 함정은 다국어 가이드 참고.

관련: 템플릿 카탈로그 · API 레퍼런스