비용 & 지연 다루기
AI 서비스의 운영 비용은 대부분 토큰과 모델 크기에서 나옵니다. 몇 가지 원칙으로 크게 줄일 수 있습니다.
모델을 작업에 맞게
| 작업 | 권장 |
|---|---|
| 분류·추출·짧은 요약 | 소형 모델 (빠르고 쌈) |
| 일반 대화·작성 | 중형 |
| 복합 추론·코드 | 대형/추론 모델 (필요할 때만) |
"큰 모델 하나로 다"보다, 단계별로 맞는 크기를 쓰는 게 싸고 빠릅니다.
토큰 줄이기
- 프롬프트 다이어트: 불필요한 예시·중복 지시 제거.
- RAG 컨텍스트 상한: 검색 top-k를 필요한 만큼만(리랭킹 후 3~5개).
- max_tokens 적정화: 잘림 방지 최소값으로.
- 대화 이력 압축: 오래된 턴은 요약해서 전달.
지연 줄이기
- 스트리밍으로 체감 지연↓ (스트리밍 가이드).
- 병렬화: 독립 단계(예: 여러 문서 임베딩)는 동시에.
- 캐시: 동일 입력 반복은 결과 캐시(가능하면).
- 프리필터: 무거운 리랭커 전에 임베딩으로 후보를 좁히기.
측정 · 예산
- 응답의
usage(prompt/completion/total tokens)를 로깅·집계. - 기능별 예상 토큰·지연·비용을 미리 산정해 사용자에게 표시.
- 키/프로젝트별 한도(TPM) 로 폭주 비용 차단.
비동기 (긴 작업)
- OCR·대용량 RAG 등 오래 걸리는 작업은 비동기 잡(제출 → 폴링/웹훅)으로. 요청 타임아웃 회피.
관련: 프로덕션 체크리스트 · RAG