코딩 에이전트 요금 폭주, 실행 전에 막는 법 — Claude Code·Codex·Gemini CLI 예산 설정 총정리

  • Post last modified:2026년 09월 29일
  • Post category:기술

코딩 에이전트는 한 번의 요청이 수십~수백 번의 모델 호출로 늘어나면서, 예상 못한 요금을 만들 수 있다. 답은 단순하다. 작업을 맡기기 전에 “지출이 멈추는 지점”을 먼저 설정한다. Claude Code는 워크스페이스 지출 한도, Codex/API는 하드 스탑 한도, Gemini CLI는 무료 한도(1,000회/일)를 각각 제공하며, 이 글은 이 세 가지를 실행 전 10분 안에 설정하는 순서와 금액 기준을 정리한다. 개인 개발자·소규모 팀이 오늘 바로 적용할 수 있는 값만 담았다.

30초 요약

  • 하드 스탑(429 오류로 트래픽 중단)은 OpenAI API 계정에서 Settings → Organization limits → Enforce a hard limit 켜기로 즉시 적용된다. 알림(alert)만으로는 지출이 멈추지 않는다.
  • Claude API(Console)는 워크스페이스별 월 지출 한도가 있고, Claude Code 구독(Pro/Max)은 claude.ai 설정에서 월 지출 한도를 설정한다. 사용량 크레딧을 켜지 않으면 한도가 무제한(Unlimited)으로 표시된다.
  • Gemini CLI는 무료로 시작할 수 있지만 Google 계정 로그인 기준 1,000회/일, API 키 무료 티어는 250회/일·Flash 모델 전용이다. 무료 한도를 넘는 순간 과금 또는 차단이 발생한다.
  • 예산 상한은 “실행 후 확인”이 아니라 “실행 전 설정”이 원칙이다. 실제 사건들(Codex 826개 하위 태스크 병렬 실행 등)은 상한 부재 상태에서 발생했다.
  • 비용 절감은 상한 설정 이후에 적용한다: /clear, /compact(컨텍스트 관리), MAX_THINKING_TOKENS 환경변수(추론 예산 하한), CLI 도구 우선(MCP 서버 최소화) 순서가 공식 문서 권장 순서다.

코딩 에이전트 요금은 왜 순식간에 커지나

챗봇은 질문 1번에 응답 1번이다. 코딩 에이전트는 다르다. 목표를 달성하기 위해 계획을 세우고, 도구를 호출하고, 결과를 검토한 뒤 다시 판단하는 루프를 돈다. 이 과정이 몇 번 반복될지는 미리 알기 어렵고, 하위 에이전트가 파생되면 호출 수는 곱셈으로 늘어난다.

2026년 9월 26일 공개된 한 사례는 이 구조의 극단을 보여준다. VS Code에서 시작한 단순한 UI/UX 검토 요청이 Codex 계정에서 826개의 하위 태스크로 병렐 실행됐고, 요청자는 승인한 적 없는 약 7만 8천 달러 규모 사용량과 기록 삭제를 발견했다. OpenAI에 2주 넘게 티켓을 열어도 인간 응답을 받지 못했다는 게 이 사례의 두 번째 문제다. 이 사용자 계정에 하드 스탑 지출 한도가 설정돼 있었다면, 첫 429 오류 시점에 실행이 멈췄을 것이다.

같은 시기 국내에서도 유사한 이슈가 보도됐다. 국내 대학생 Claude 이용자의 카드에 약 25억 원, 이후 약 250억 원 결제 시도가 반복됐고, Anthropic은 “자동 충전 금액이 비정상적으로 높게 설정된 오류”라고 설명했지만 당사자는 자동 충전을 설정한 적이 없다고 밝혔다. 다행히 카드 한도로 실제 출금은 없었지만, 비정상 금액이 카드 승인 단계까지 전달됐다는 점이 사건의 무게를 달리 한다.

조직 차원에서는 Uber가 2026년 연간 AI 예산을 Claude Code 사용으로 4개월 만에 소진했다는 보도(Fortune, 2026년 5월), 이후 도구 사용량 상한을 두겠다는 후속 보도(Bloomberg, 2026년 6월)가 이어졌다. Anthropic 자체도 Claude Code의 엔터프라이즈 평균 비용으로 개발자당 활성 사용일 $13, 월 $150~250을 공식 제시하며 비용 관리 가이드를 운영 중이다. 즉 “에이전트가 비싸다”가 아니라 “경계 없는 자동 실행은 통제 불능이 된다”가 실제 문제다.

도구별 예산 상한 설정법 — 공식 문서 기준

OpenAI API / Codex: 하드 스탑이 핵심

OpenAI API 플랫폼은 두 가지 지출 통제를 제공한다.

통제설정 금액 도달 시용도
지출 알림(Spend alert)알림만 발송, 트래픽 계속지출 추적
하드 지출 한도(Hard spend limit)API 요청이 429 오류로 실패월 상한 강제

설정 순서는 다음과 같다.

  1. platform.openai.com/settings/organization/limits 접근 (또는 프로젝트별 Settings → Limits)
  2. Spend → Edit spend limit 클릭
  3. Monthly spend limit 금액 입력
  4. Enforce a hard limit 토글 켜기 — 이 토글이 핵심이다. 꺼져 있으면 한도는 알림 역할만 한다.
  5. 저장

주의할 점 두 가지. 첫째, 하드 한도 적용은 즉각적이지 않아서 기록된 지출이 설정 금액을 소액 초과할 수 있다(공식 문서 명시). 둘째, 한도 도달 시 오류 코드가 organization_spend_limit_exceeded(조직 전체) 또는 project_spend_limit_exceeded(프로젝트별)로 구분되므로, 에이전트의 재시도 로직이 이 오류를 “일시 오류”로 분류해 재시도 폭주를 일으키지 않도록 처리해야 한다.

Codex가 ChatGPT 구독 크레딧으로 과금되는 조직이라면 관리 콘솔의 사용량 한도(Usage limits)를 별도로 설정한다. 워크스페이스 기본값 → 그룹 기본값 → 사용자 예외 순서로 적용되며, 사용자 한도는 공유 크레딧 풀이 남아 있어도 개인 사용을 먼저 멈춘다. 토큰 기반 과금 조직은 워크스페이스 월 예산(USD)이 별도 상한이다.

Claude Code: 어디서 과금되는지 먼저 확인

Claude Code 비용은 인증 방식에 따라 상한 설정 위치가 완전히 달라진다.

사용 방식지출 확인지출 상한
Pro/Max 구독 + 사용량 크레딧/usage 화면, claude.ai/settings/usageclaude.ai 사용량 설정의 월 지출 한도
Claude Console(API)Console 사용량 페이지워크스페이스 지출 한도
Teams/Enterprise조직 분석 지출 보고서관리자 설정의 지출 한도
Bedrock/Vertex 등 클라우드클라우드 청구 콘솔클라우드 예산 제어

개인 Pro/Max 사용자가 가장 흔히 빠뜨리는 단계가 사용량 크레딧(usage credits) 활성화다. 이 기능을 켜야 월 지출 한도 설정이 노출되고, /usage 화면의 사용량 크레딧 행에서 현재 월 지출을 한도 대비로 볼 수 있다. 켜져 있지 않으면 행이 Unlimited로 표시된다. Claude Code 내부에서 /usage를 실행하면 세션 토큰 사용량, 모델별 귀속, MCP 서버별 점유율, 동작 플래그(긴 컨텍스트·캐시 미스 등)를 로컬에서 바로 확인할 수 있다.

Console(API) 사용자는 워크스페이스 단위로 월 지출 한도와 요청/분, 입력·출력 토큰/분 제한을 함께 걸 수 있다. 주의점: 기본 워크스페이스에는 한도를 설정할 수 없고, 워크스페이스 한도는 조직 한도보다 낮게만 설정 가능하다.

Gemini CLI: 무료 한도의 정확한 경계

Gemini CLI는 인증 방식별로 일일 요청 한도가 갈린다.

인증 방식티어최대 요청 수/사용자/일
Google 계정 로그인Gemini Code Assist(개인, 무료)1,000회
Gemini API 키무료 티어250회 (Flash 모델 전용)
Gemini API 키종량제변동 (과금)
Google AI Pro 구독개인 유료1,500회
Vertex AIExpress 모드(무료)변동

핵심은 API 키 무료 티어는 Flash 모델만 호출 가능하고 250회/일이라는 점이다. 코딩 에이전트를 무료 API 키로 돌리면 하루 몇 시간 만에 한도에 닿고, 이후 429 오류 또는 과금 전환이 발생한다. 개인 Google 계정 로그인(1,000회/일)이 무료로 쓸 수 있는 상한이 가장 높다. 무료 한도를 넘어 장시간 작업이 필요하면 종량제 전환 또는 Google AI Pro 구독이 공식 권장 경로다.

예산이 이미 폭주했을 때: 확인 → 차단 → 원인 순서

요금 폭주를 발견한 직후의 대응은 다음 순서로 한다.

  1. 현재 지출 확인: OpenAI는 platform.openai.com/settings/organization/usage, Claude는 /usage(Claude Code) 또는 Console 사용량 페이지에서 확인한다.
  2. 즉시 차단: 하드 한도가 꺼져 있으면 즉시 설정(또는 프로젝트별 한도를 소액으로 조정)해 다음 요청부터 429로 멈춘다. 구독 크레딧 사용 중이면 사용량 크레딧을 끄거나 한도를 낮춘다.
  3. 원인 파악: 재시도 루프(429를 일시 오류로 오분류한 에이전트), 하위 에이전트 폭주, MCP 서버 오버헤드, 컨텍스트 누적 중 무엇인지 /usage의 귀속 표와 동작 플래그로 식별한다.
  4. 재발 방지: 429 *_spend_limit_exceeded 오류를 재시도 대상에서 제외하고, 장기 작업은 세션 예산 단위로 분할한다.

비용 절감은 상한 설정 이후에 — 공식 권장 순서

상한은 사고를 막는 장치고, 절감은 평소 운영 기술이다. Anthropic 공식 문서가 권장하는 절감 순서를 요약하면 다음과 같다.

  • 컨텍스트 관리 먼저: 작업 전환 시 /clear, 장기 세션은 /compact(보존할 내용 지정 가능)로 컨텍스트를 줄인다. 오래된 컨텍스트는 이후 모든 요청에 토큰 낭비를 반복한다.
  • 모델 선택: 단순 작업은 경량 모델로. 고정 추론 예산 모델은 MAX_THINKING_TOKENS=8000 같은 환경변수로 사고 예산을 낮출 수 있다(적응형 추론 모델은 예산 대신 노력 수준 사용).
  • MCP 서버 최소화: gh, aws 등 CLI 도구가 MCP 서버보다 컨텍스트 효율적이다. /mcp로 사용하지 않는 서버를 비활성화한다.
  • 세션 단위 위임: 문서 처리·테스트 실행 같은 무거운 작업은 하위 에이전트(subagent)로 위임해 메인 컨텍스트를 보호한다.

실전 체크리스트 — 오늘 10분에 끝내는 예산 설정

코딩 에이전트 예산 상한 설정 위치 한 장 요약
도구별 예산 상한 설정 위치와 핵심 값 요약
출처: 각사 공식 문서 (2026-09-29 확인)
  • ☐ OpenAI API: Organization limits에서 Enforce a hard limit 켰는가
  • ☐ OpenAI API: 지출 알림을 하드 한도보다 낮은 임계(예: 80%)로 설정했는가
  • ☐ Codex(구독 크레딧): 관리 콘솔 사용량 한도에서 워크스페이스 기본값·그룹·사용자 예외를 점검했는가
  • ☐ Claude Code 구독: 사용량 크레딧을 켜고 월 지출 한도를 설정했는가 (Unlimited가 아니어야 한다)
  • ☐ Claude API(Console): 워크스페이스 지출 한도 + 분당 요청/토큰 한도를 같이 걸었는가
  • ☐ Gemini CLI: 무료 API 키(250회/일·Flash 전용)로 코딩 에이전트를 돌리지 않는가 — 개인 계정 로그인(1,000회/일)으로 시작하는가
  • ☐ 에이전트 재시도 로직이 429 spend_limit_exceeded를 재시도 대상에서 제외하는가
  • ☐ 장기 작업에 세션/태스크 단위 예산(Anthropic Managed Agents 세션 예산 등)을 적용했는가

자주 묻는 질문

하드 지출 한도를 걸면 진행 중인 작업은 어떻게 되나?

OpenAI는 “적용이 즉각적이지 않아 기록 지출이 설정 금액을 소액 초과할 수 있다”고 명시한다. 진행 중 요청은 마무리될 수 있고, 그만큼 한도를 살짝 넘을 수 있다. Anthropic Managed Agents의 세션 예산도 같은 구조다 — 상한 도달 시 새 모델 요청을 시작하지 않고 budget_reached로 일시 정지하며, 진행 중이던 요청은 끝까지 실행된다.

지출 알림만 설정해도 되나?

안 된다. OpenAI 공식 문서 기준 알림은 “트래픽을 중단하지 않는다”고 명시돼 있다. 알림은 하드 한도 이전의 경고용으로만 조합하라. 국내 250억 원 결제 시도 사례도 알림이 아니라 카드 한도가 유일한 방어선이었다.

무료 티어만 쓰면 폭주 위험이 없지 않나?

있다. Gemini API 무료 티어는 250회/일·Flash 전용이다. 코딩 에이전트의 루프 구조상 하루 한도는 몇 시간 만에 소진되고, 이후 429 차단으로 작업이 중단된다. “폭주 요금”은 아니지만 “작업 중단”이라는 다른 형태의 실패가 발생한다. 종량제 키를 무료 티어 키로 착각해 설정하면 과금 폭주로 이어진다.

Claude Code 구독(Pro/Max)은 정액제 아닌가?

정액제 안에서도 사용량 기반 제한이 있다. 사용량 크레딧을 켜면 정가 기준 토큰 비용이 측정되고 월 지출 한도를 초과하면 사용이 멈춘다. 구독 요금 외 추가 과금을 막으려면 이 한도를 명시적으로 설정해야 한다. Anthropic이 제시하는 엔터프라이즈 평균(활성일 $13, 월 $150~250)은 팀 규모 산정의 기준선이 된다.

세션 예산과 지출 한도는 어떻게 다르게 쓰나?

지출 한도는 계정/워크스페이스 단위의 월 상한이고, 세션 예산은 개별 장기 작업 단위의 상한이다. 장시간 실행되는 에이전트 작업이 많다면 세션 예산으로 작업별 손실 한계를 정하고, 계정 전체는 지출 한도로 최종 방어선을 만드는 이중 구조가 안전하다. Anthropic Managed Agents는 세션 생성 시 budget 필드로 공개 정가 기준 상한(max_list_cost)을 지정하며, 상한 도달 시 일시 정지 후 사람이 상한을 올리거나 제거하면 재개된다.

결론: 설정은 실행 전에, 점검은 주 단위로

에이전트 요금 폭주는 모델이 아니라 설정 부재에서 온다. OpenAI의 하드 한도 토글 하나, Claude의 월 지출 한도 하나, Gemini의 올바른 인증 방식 선택이면 개인 개발자도 오늘 10분 안에 방어선을 만들 수 있다. 이미 여러 사건이 보여줬듯, 사후 대응(지원 티켓, 카드사 문의)은 느리고 불확실하다. 지출이 멈추는 지점을 먼저 정하는 것 — 그것이 코딩 에이전트를 “맡겨도 되는 도구”로 만드는 유일한 방법이다.

참고자료

  • Anthropic, “비용을 효과적으로 관리하기” (Claude Code 공식 문서, 2026-09-29 확인) — https://code.claude.com/docs/ko/costs
  • OpenAI, “Spend limits” (API 공식 문서) — https://developers.openai.com/api/docs/guides/spend-limits
  • OpenAI Help Center, “Manage usage limits and overages in ChatGPT Enterprise and Edu” — https://help.openai.com/en/articles/20001001
  • Google, “Gemini CLI: Quotas and pricing” (공식 문서) — https://raw.githubusercontent.com/google-gemini/gemini-cli/main/docs/resources/quota-and-pricing.md
  • Anthropic, “Session budgets” (Managed Agents 공식 문서) — https://platform.claude.com/docs/en/managed-agents/budgets
  • Anthropic, “Workspace limits” — https://platform.claude.com/docs/en/build-with-claude/workspaces
  • Hacker News, “OpenAI Codex agents go rogue and consumes USD 78,000 without authorization” (2026-09-26) — https://news.ycombinator.com/item?id=49861047
  • Fortune, “Uber blows through its AI budget in 1 quarter” (2026-05-26) — https://fortune.com/2026/05/26/uber-coo-ai-spending-tokens-claude-code/
  • Bloomberg, “Uber Caps Usage of AI Tools Like Claude Code to Cut Costs” (2026-06-02) — https://www.bloomberg.com/news/articles/2026-06-02/uber-caps-usage-of-ai-tools-like-claude-code-to-cut-costs
  • 디지털투데이, “클로드 코드 비용 ‘2배 폭등’…개인 개발자, 감당할 수 있나” — https://www.digitaltoday.co.kr/news/articleView.html?idxno=661191
  • 내부 링크: 코딩 AI 구독, API로 바꾸면 진짜 쌀까? — 조합별 월 비용 손익분기 계산법 — https://blog.kwt.co.kr/coding-ai-subscription-vs-api-cost-breakeven-2026/
  • 내부 링크: AI 코딩 에이전트 비교 — https://blog.kwt.co.kr/ai-%EC%BD%94%EB%94%A9-%EC%97%90%EC%9D%B4%EC%A0%84%ED%8A%B8-%EB%B9%84%EA%B5%90-claude-code-vs-codex-vs-gemini-cli-%EB%AD%90%EA%B0%80-%EB%8B%A4%EB%A5%B8%EA%B9%8C/

답글 남기기