코딩 에이전트와 API를 실제로 쓰는 개발자라면, 2026년 7월 현재 가성비 최우선 모델은 Gemini 3.1 Pro와 Claude Sonnet 5, 장시간 실행 에이전트에는 Anthropic의 플래그십 Fable 5, 복잡한 코딩에는 Opus 4.8 또는 GPT-5.6 Sol, 대량 처리에는 DeepSeek V4다. 모델 성능 격차는 줄어들었지만, 같은 사용량의 월 비용은 최대 약 89배 차이가 난다. 이 글은 4개사 최신 라인업의 공식 가격표와 스펙을 기준으로, 코딩 에이전트 사용 시 실제 토큰 소비량과 월간 비용을 계산해 어떤 모델을 언제 써야 하는지 정리한다.
핵심 요약
- Anthropic 최상위 모델은 Fable 5다: 장시간 실행 에이전트용 플래그십으로 $10/$50이다. Opus 4.8($5/$25)은 복잡한 에이전트 코딩·엔터프라이즈 작업용 주력 모델이다.
- 상위 모델 가격 차이가 크다: Fable 5($10/$50), GPT-5.6 Sol($5/$30), Opus 4.8($5/$25), Gemini 3.1 Pro($2/$12). 모델 선택에 따라 월 비용이 수십 배 달라진다.
- 주요 최신 모델의 컨텍스트는 1M급: GPT-5.6 약 1.05M, Fable 5·Opus 4.8·Sonnet 5 1M, Gemini 3.1 Pro 약 1.05M, DeepSeek V4 1M이다. 단, 큰 컨텍스트를 매번 채우면 비용도 함께 커진다.
- 프롬프트 캐싱이 핵심 비용 절감 수단: OpenAI는 캐시된 입력 단가가 기본 입력보다 90% 낮고, DeepSeek V4-Pro는 cache hit 입력 단가가 cache miss보다 약 99.2% 낮다. 전체 청구액 절감률은 output 비중과 cache hit 비율에 따라 달라진다.
- 코딩 에이전트 하루 50회 요청 기준: GPT-5.6 Sol은 월 $240, DeepSeek V4-Pro는 월 $15.66. 15배 차이.
- 선택 기준: 일일 코딩 → Sonnet 5 / Gemini 3.1 Pro, 복잡한 에이전트 코딩 → Opus 4.8 / GPT-5.6 Sol, 장시간 자율 실행 → Fable 5, 비용 극소화 → DeepSeek V4 + 캐싱.
2026년 7월 LLM 라인업: 공식 가격표
아래는 OpenAI, Anthropic, Google, DeepSeek 공식 pricing 페이지에서 직접 확인한 2026년 7월 21일 기준 Standard 티어 가격이다. 단위는 1M(100만) 토큰당 USD다.
| 모델 | Input $/1M | Output $/1M | Cached Input $/1M | 컨텍스트 | 최대 출력 |
|---|---|---|---|---|---|
| GPT-5.6 Sol | $5.00 (Long $10) | $30.00 (Long $45) | $0.50 (Long $1) | 1.05M | 128K |
| GPT-5.6 Terra | $2.50 (Long $5) | $15.00 (Long $22.50) | $0.25 (Long $0.50) | 1.05M | 128K |
| GPT-5.6 Luna | $1.00 (Long $2) | $6.00 (Long $9) | $0.10 (Long $0.20) | 1.05M | 128K |
| Claude Fable 5 | $10.00 | $50.00 | $1.00 (cache read) | 1M | 128K |
| Claude Opus 4.8 | $5.00 | $25.00 | $0.50 | 1M | 128K |
| Claude Sonnet 5 | $2.00 (할인가, 8/31까지) | $10.00 (할인가) | $0.20 | 1M | 128K |
| Claude Haiku 4.5 | $1.00 | $5.00 | $0.10 | 200K | 64K |
| Gemini 3.1 Pro | $2.00 (200K 초과 시 $4) | $12.00 (200K 초과 시 $18) | $0.20 (200K 초과 시 $0.40) | 1.05M | 65K |
| Gemini 3.5 Flash | $1.50 | $9.00 | $0.15 | 1.05M | 65K |
| Gemini 3.1 Flash-Lite | $0.25 | $1.50 | — | 1M | — |
| DeepSeek V4-Pro | $0.435 | $0.87 | $0.003625 (cache hit) | 1M | 384K |
| DeepSeek V4-Flash | $0.14 | $0.28 | $0.0028 (cache hit) | 1M | — |
Sonnet 5의 $2/$10 및 cache read $0.20 가격은 2026년 8월 31일까지 적용되는 도입기 할인가다. 9월부터는 $3/$15, cache read $0.30 표준 가격이 적용된다. GPT-5.6 비용표의 기본값은 Short context 기준이며, OpenAI는 Long context에 별도 고가 요율을 적용한다.
같은 작업을 하면 비용이 얼마나 다를까
코딩 에이전트를 하루 50회 호출한다고 가정하자. 평균 input 30K 토큰(시스템 프롬프트 + 파일 컨텍스트), output 3K 토큰(코드 + 설명)으로 잡는다. GPT-5.6 계산은 Short context 요율을 적용했다.

출처: OpenAI·Anthropic·Google·DeepSeek 공식 가격표 기반 계산
계산 결과, 월 20일 근무 기준:
| 모델 | 일일 비용 | 월간 비용 (20일) | GPT-5.6 Sol 대비 |
|---|---|---|---|
| Claude Fable 5 | $22.50 | $450 | 188% |
| GPT-5.6 Sol | $12.00 | $240 | 100% |
| Opus 4.8 | $11.25 | $225 | 94% |
| GPT-5.6 Terra | $6.00 | $120 | 50% |
| Sonnet 5 (할인가) | $4.50 | $90 | 38% |
| Gemini 3.1 Pro | $4.80 | $96 | 40% |
| Gemini 3.5 Flash | $3.60 | $72 | 30% |
| DeepSeek V4-Pro | $0.78 | $16 | 7% |
| DeepSeek V4-Flash | $0.25 | $5 | 2% |
같은 사용량에서도 Fable 5와 DeepSeek V4-Flash는 약 89배, GPT-5.6 Sol과 DeepSeek V4-Flash는 약 48배 비용 차이가 난다. 성능이 “충분히” 좋다면 저가 모델로 바꾸는 것만으로 월 수십~수백 달러를 아낄 수 있다.
토큰량의 이해: 컨텍스트 윈도우 vs 실제 소비량
사용자가 “받는” 토큰량: 컨텍스트 윈도우
컨텍스트 윈도우는 한 번에 모델에 넣을 수 있는 최대 토큰 수다. 2026년 7월 기준 주요 모델의 윈도우는:
- GPT-5.6 전 라인업: 약 105만 토큰 — 최대 출력 128K. Long context에는 별도 요율이 적용된다.
- Claude Fable 5 / Opus 4.8 / Sonnet 5: 100만 토큰 — 최대 출력 128K.
- Gemini 3.1 Pro / 3.5 Flash: 1,048,576 토큰 — 최대 출력 65,536. Gemini 3.1 Pro는 200K 초과 프롬프트에 고가 요율이 적용된다.
- DeepSeek V4: 100만 토큰 — 최대 출력 384K.
100만 토큰은 영어 기준으로 흔히 약 75만 단어로 환산하지만, 한국어·소스코드·JSON은 토크나이저에 따라 비율이 크게 달라진다. 따라서 “파일 몇 개”나 “책 몇 권”으로 환산하기보다, API 응답의 실제 input/output usage를 확인하는 편이 정확하다.
하지만 컨텍스트 윈도우가 크다고 무조건 좋은 것은 아니다. Gemini 3.1 Pro는 프롬프트가 200K를 넘으면 input이 $2→$4로 2배, output은 $12→$18로 1.5배가 된다. GPT-5.6도 공식 가격표에서 Long context 요율을 별도로 제시한다.
사용자가 “소비하는” 토큰량: 실제 사용 패턴
코딩 에이전트(Codex, Claude Code, Gemini CLI)를 실제로 쓸 때 토큰은 어떻게 소비될까. 아래 수치는 제품사가 보장하는 평균값이나 벤치마크가 아니라, 비용 예산을 잡기 위한 예시 범위다. 실제 값은 에이전트가 읽는 파일 수, 대화 누적 길이, 도구 결과 크기에 따라 달라진다.
1회 요청당 토큰 소비 예시:
| 작업 유형 | Input 토큰 | Output 토큰 | 비고 |
|---|---|---|---|
| 단순 함수 수정 | 5K~10K | 500~1K | 시스템 프롬프트 + 해당 파일 |
| 다중 파일 리팩토링 | 30K~80K | 2K~5K | 관련 파일 전체 + diff |
| 전체 코드베이스 분석 | 100K~500K | 5K~10K | 코드베이스 전체 컨텍스트 |
| 디버깅 세션 (연속) | 50K~150K | 3K~8K | 이전 대화 누적 |
코딩 에이전트를 오래 쓰면 input 토큰이 빠르게 누적될 수 있다. 매 요청에 시스템 프롬프트 + 이전 대화 기록 + 파일 컨텍스트가 다시 포함될 수 있기 때문이다. 실제 소비량은 도구마다 다르므로 대시보드나 API 응답의 input_tokens, output_tokens, cached_tokens를 기준으로 확인해야 한다.
구독제에서 사용자가 받는 토큰량
API가 아닌 구독(ChatGPT Plus, Claude Pro 등)을 쓰는 경우, 정확한 토큰량은 공개되지 않지만 사용량 한도가 존재한다.
- ChatGPT Plus: 모델별 고정 토큰 묶음을 주는 방식이 아니다. 메시지·기능 사용 한도는 모델과 서비스 상황에 따라 달라질 수 있으므로 앱에 표시되는 현재 한도를 확인해야 한다.
- Claude Pro ($17~$20/월): Free보다 더 많은 사용량을 제공하지만 정확한 토큰 수는 공개하지 않는다.
- Claude Max ($100~/월): 공식 안내상 Pro 대비 5x 또는 20x 사용량을 5시간 세션 단위로 제공하며, 출력 한도도 더 높다.
구독제는 토큰당 과금이 아니므로 예측 가능한 비용이 장점이지만, 한도에 도달하면 일정 시간 사용이 제한되거나 모델·기능 이용 가능 범위가 달라질 수 있다. API는 사용량에 비례해 과금되며, 계정별 rate limit과 지출 한도를 함께 고려해야 한다.
프롬프트 캐싱: 비용 절감의 핵심
코딩 에이전트에서 input 토큰의 대부분은 매번 반복되는 컨텍스트(시스템 프롬프트, 코드베이스, 이전 대화)다. 프롬프트 캐싱은 이 반복 부분을 서버에 저장해 두고, 다음 요청에서 캐시된 토큰을 저렴하게 재사용하는 기능이다.
캐싱 적용 시 비용 절감 효과
input 토큰의 70%가 캐시 hit된다고 가정하면:

출처: 각사 공식 API 가격표 기반 계산
| 모델 | 캐시 미사용 (일일) | 캐시 적용 (일일) | 절감율 |
|---|---|---|---|
| Fable 5 | $22.50 | $13.05 | 42% |
| GPT-5.6 Sol | $12.00 | $7.28 | 39% |
| Opus 4.8 | $11.25 | $6.53 | 42% |
| Sonnet 5 | $4.50 | $2.61 | 42% |
| DeepSeek V4-Pro | $0.78 | $0.33 | 58% |
이 글의 70% cache hit 가정에서는 일일 비용이 약 39~58% 줄어든다. 특히 DeepSeek V4-Pro의 cache hit 입력 단가는 $0.003625/1M로, cache miss($0.435)보다 약 99.2% 저렴하다. 이는 전체 청구액이 99.2% 줄어든다는 뜻이 아니라, 캐시에 적중한 입력 토큰 부분의 단가 차이다.
캐싱을 극대화하는 방법
- 시스템 프롬프트를 고정한다: 도구 정의, 코딩 규칙, 프로젝트 컨텍스트를 매 요청마다 바꾸지 않는다.
- 코드베이스 컨텍스트를 캐시 블록으로 묶는다: 관련 파일을 한 번에 크게 전송하고, 이후 요청에서는 변경분만 추가한다.
- 5분 TTL을 의식한다: Anthropic의 기본 캐시 TTL은 5분. 연속 작업 세션 안에서 캐시를 유지하려면 요청 간격을 5분 이내로 유지하거나 확장 캐싱(extended prompt caching) 옵션을 확인한다.
- 캐시 가능한 프롬프트 구조를 설계한다: 동적 내용(사용자 질문)은 프롬프트 끝에 배치하고, 정적 내용(컨텍스트)은 앞에 배치한다.
모델별 선택 기준: 어떤 모델을 언제 쓸까
Claude Fable 5 — Anthropic의 플래그십, 장시간 실행 에이전트용
Fable 5는 Anthropic 공식 가격표에서 “Next generation intelligence for long-running agents”로 소개되는 최상위 모델이다. input $10, output $50로 Opus 4.8의 정확히 2배이며, 장시간 자율 실행·복잡한 계획 유지·다단계 에이전트 오케스트레이션처럼 실패 비용이 큰 작업에 맞는다. 일반적인 코드 수정에 기본 모델로 쓰기에는 과도하게 비싸므로, 장시간 실행 에이전트의 계획 수립과 최종 검증 단계에 제한적으로 배치하는 편이 현실적이다.
Claude Opus 4.8 — 복잡한 에이전트 코딩의 주력 모델
Opus 4.8은 Anthropic이 “complex agentic coding and enterprise work”에 적합하다고 명시한 모델이다. Fable 5보다 한 단계 아래지만, 복잡한 코딩과 엔터프라이즈 에이전트 작업을 비용과 성능의 균형으로 처리하는 주력 모델이다. Claude Code로 대규모 리팩토링, 버그 추적, 멀티 에이전트 조정을 해야 한다면 1순위다. 단가는 $5/$25로 GPT-5.6 Sol과 비슷하지만, output이 $5 저렴해 장기 세션에서 비용이 적게 나온다.
GPT-5.6 Sol — 최고 성능이 필요할 때
GPT-5.6 Sol은 OpenAI 플래그십 모델로, reasoning effort를 none부터 max까지 6단계로 조절할 수 있다. 컨텍스트 1.05M, 최대 출력 128K로 긴 코드베이스와 대용량 출력이 필요한 작업에 적합하다. 다만 output 단가가 $30로 비교 대상 4개사 가운데 가장 높아, 비용 민감도가 높으면 Terra($2.50/$15)나 Luna($1/$6)로 하향하는 것이 현명하다. Terra는 “intelligence and cost의 균형”, Luna는 “cost-sensitive workloads 최적화”라는 공식 포지셔닝이다.
Gemini 3.1 Pro — 가성비와 멀티모달의 교차점
Gemini 3.1 Pro는 input $2, output $12로 고성능 에이전트·멀티모달 모델 중 단가가 낮은 편이다. 200K 토큰까지는 $2/$12가 유지된다. 텍스트·이미지·영상·오디오·PDF 입력을 지원해 스크린샷 기반 디버깅이나 UI 분석에 활용할 수 있다. 단, 200K 초과 시 input은 2배, output은 1.5배 요율이 적용된다.
Sonnet 5 — 일일 코딩의 기본값
Claude Sonnet 5는 현재 $2/$10 도입기 할인가로 운영 중이다. 9월부터 $3/$15로 올라도 여전히 Gemini 3.1 Pro와 비슷한 가격대다. Opus 4.8과 동일한 생태계(MCP, Claude Code)를 저렴하게 쓸 수 있다는 것이 가장 큰 장점이다. 일상적인 코딩, 코드 리뷰, 단순 디버깅은 Sonnet 5로 충분하고, 복잡한 작업만 Opus 4.8으로 라우팅하는 전략이 비용 효율적이다.
DeepSeek V4 — 비용 극소화, 대량 처리
DeepSeek V4-Pro의 input $0.435, output $0.87는 Opus 4.8보다 크게 낮다. 공식 문서상 1M 컨텍스트, 최대 384K 출력, tool calling을 지원하고 context caching이 기본 활성화된다. 따라서 대량 배치 분석과 정형화된 처리의 비용 후보로 검토할 수 있다. 다만 가격표만으로 결과 품질과 운영 안정성을 판단할 수 없으므로, 실제 한국어 입력·도구 스키마·오류 복구 패턴으로 자체 평가한 뒤 적용해야 한다.
모델 선택 체크리스트
- ☐ 일일 사용량이 적은가 (< 20회)? → Sonnet 5 또는 Gemini 3.1 Pro. 실제 월 비용은 요청당 컨텍스트 크기로 계산한다.
- ☐ 몇 시간 이상 자율 실행하는 에이전트인가? → Fable 5. 장기 계획 유지와 오케스트레이션.
- ☐ 복잡한 에이전트 코딩인가? → Opus 4.8. 다단계 도구 호출과 대규모 리팩토링.
- ☐ 최고 성능이 필수인가? → GPT-5.6 Sol. reasoning max + 128K 출력.
- ☐ 비용을 극소화해야 하는가? → DeepSeek V4-Pro + 프롬프트 캐싱. 월 $10~$20 가능.
- ☐ 멀티모달(이미지/영상)이 필요한가? → Gemini 3.1 Pro. 텍스트·이미지·영상·오디오·PDF 입력을 지원하지만 각 입력은 내부 토큰으로 환산되어 과금된다.
- ☐ 200K 토큰 이상 컨텍스트가 필요한가? → 모델별 장문 요율까지 비교한다. Gemini 3.1 Pro는 200K 초과 요율이 있으며, GPT-5.6도 공식 가격표에서 Long context 요율을 별도로 제시한다. DeepSeek V4는 공식 가격표상 1M 단일 요율이다.
- ☐ 구독으로 충분한가? → Claude Pro/Max 또는 ChatGPT Plus. 예측 가능한 고정 비용, 세션 기반 제한.
비용 최적화 3단계
- 모델 라우팅: 단순 작업은 저가 모델(Sonnet 5, Gemini Flash-Lite), 복잡한 코딩은 Opus 4.8·GPT-5.6 Sol, 장시간 실행 에이전트의 핵심 단계만 Fable 5로 보낸다. AI Gateway(LiteLLM, Cloudflare AI Gateway)로 라우팅 규칙을 설정하면 자동화된다.
- 프롬프트 캐싱: 시스템 프롬프트 + 코드베이스 컨텍스트의 정적 prefix를 재사용한다. 캐시된 입력 단가는 크게 낮아지지만, 이 글의 70% hit 시나리오에서 전체 비용 절감률은 약 39~58%다.
- Batch 처리: 동기 처리가 필요 없는 작업(코드 리뷰, 문서 생성, 테스트 케이스 작성)은 Batch API를 써서 50% 할인을 받는다. Anthropic, OpenAI 모두 Batch 처리 시 50% 할인을 제공한다.
FAQ
Q. Fable 5와 Opus 4.8은 무엇이 다른가?
Fable 5는 Anthropic의 장시간 실행 에이전트용 최상위 모델이고, Opus 4.8은 복잡한 에이전트 코딩과 엔터프라이즈 작업을 위한 주력 모델이다. Fable 5의 API 가격은 $10/$50로 Opus 4.8($5/$25)의 2배다. 일반 코딩은 Opus 4.8을 쓰고, 장시간 자율 실행과 실패 비용이 큰 계획·검증 단계에만 Fable 5를 제한적으로 배치하는 편이 경제적이다.
Q. 코딩 에이전트에서 가장 비용 효율적인 조합은?
Sonnet 5를 기본으로 쓰고, 복잡한 디버깅이나 대규모 리팩토링만 Opus 4.8으로 라우팅하는 방식이 현실적이다. 다만 실제 비용은 요청 횟수와 컨텍스트 크기에 따라 달라지므로, 고정 금액보다 API usage를 기준으로 판단해야 한다.
Q. Gemini 3.1 Pro의 200K 초과 요율은 언제 문제가 되나?
전체 코드베이스나 매우 긴 대화 기록을 한 요청에 넣어 프롬프트가 200K를 넘을 때 적용된다. 이 구간에서는 input이 $2→$4, output이 $12→$18로 오른다. 파일 개수만으로 토큰 수를 예측하지 말고 API usage나 tokenizer로 확인해야 한다.
Q. DeepSeek V4는 프로덕션 에이전트에 써도 되나?
DeepSeek 공식 문서상 V4는 tool calling과 1M 컨텍스트를 지원한다. 다만 프로덕션 적합성은 각 서비스의 실제 한국어 입력, 도구 스키마, 오류 복구 패턴으로 자체 평가(Eval)를 거쳐 판단하는 것이 안전하다.
Q. 프롬프트 캐싱은 어떻게 켜나?
제공자마다 방식이 다르다. Anthropic API는 캐시할 블록에 {"cache_control": {"type": "ephemeral"}}을 지정하며, 공식 가격표의 기본 prompt cache read 요율은 5분 TTL 기준이다. OpenAI는 조건을 충족하는 동일 prefix에 프롬프트 캐싱을 자동 적용한다. DeepSeek context caching은 모든 사용자에게 기본 활성화되며, 이후 요청이 이전 요청의 prefix와 겹치고 캐시 규칙을 충족할 때 hit로 계산된다.
Q. 구독(ChatGPT Plus / Claude Pro)과 API 중 뭘 써야 하나?
월 사용량이 예측 가능하고 한도 내에서 충분하다면 구독이 싸다. 하지만 코딩 에이전트를 하루 종일 쓰거나, 여러 모델을 동시에 쓰거나, 자동화 파이프라인에 통합해야 한다면 API가 유연하다. 구독 한도에 자주 도달한다면 API 전환이 더 경제적일 수 있다.
참고 자료
- OpenAI API Pricing — GPT-5.6 Sol/Terra/Luna 가격 및 스펙 (2026년 7월 확인)
- Anthropic Pricing — Fable 5, Opus 4.8, Sonnet 5, Haiku 4.5 API 가격과 공식 포지셔닝 (2026년 7월 확인)
- Google AI Gemini API Pricing — Gemini 3.1 Pro, 3.5 Flash 가격 (2026년 7월 확인)
- DeepSeek API Models & Pricing — V4-Pro, V4-Flash 가격 및 캐싱 (2026년 7월 확인)
- OpenAI Models — GPT-5.6 컨텍스트 윈도우, 최대 출력, reasoning effort