2026년 8월 기준 세 도구의 차이는 모델 점수보다 작업 경계에서 더 선명하다. 복잡한 저장소를 오래 탐색하고 여러 에이전트를 조율하려면 Claude Code, 로컬·클라우드·IDE를 오가며 자동화하려면 Codex, 비용 없이 시작해 Google Search와 1M 컨텍스트를 활용하려면 Gemini CLI가 맞다. 셋 모두 파일 수정·명령 실행·MCP를 지원하므로 “무엇이 최고인가”보다 권한, 요금, 실행 위치, 검토 방식으로 골라야 한다.
빠른 결론
- Claude Code: 복잡한 기능 구현, 장기 작업, 서브에이전트·훅·스킬 중심 워크플로에 적합하다.
- Codex: 로컬 CLI와 클라우드 작업을 연결하고, 권한·샌드박스·코드 리뷰를 명시적으로 통제할 때 유리하다.
- Gemini CLI: 개인 무료 한도, Google Search grounding, 오픈소스 확장성이 우선일 때 가장 쉽게 시작할 수 있다.
- 공통 원칙: 벤치마크 한 줄보다 실제 저장소의 테스트 통과율, 수정 범위, 재시도 횟수, 비용을 짧게 측정해 선택해야 한다.
확인 기준일은 2026년 8월 29일이다. 이 글은 세 제품의 공식 문서와 공개 저장소를 기준으로 다시 검증했다. 기존 글에 있던 “수개월간 실무에서 돌려봤다”는 확인되지 않은 경험 표현, 오래된 모델명, 고정 사용량처럼 보이는 설명은 제거했다.

Claude Code vs Codex vs Gemini CLI 한눈에 비교
| 항목 | Claude Code | Codex | Gemini CLI |
|---|---|---|---|
| 제품 성격 | 터미널·IDE·데스크톱·웹을 공유하는 에이전틱 코딩 도구 | 로컬 CLI·IDE·웹·클라우드를 연결하는 코딩 에이전트 | Google Gemini를 터미널에서 쓰는 Apache 2.0 오픈소스 에이전트 |
| 2026년 8월 공식 모델 표기 | Claude Opus 5·Sonnet 5 등 현재 Claude 계열 | GPT-5.6 Sol·Terra·Luna 계열 | 자동 갱신되는 Gemini 3 계열, 1M 컨텍스트 |
| 개인 진입 비용 | Claude Code 주요 화면은 Pro 월 $20부터, Max는 월 $100부터 | Free $0, Go $8, Plus $20부터 | 개인 Google 계정 무료 한도 제공 |
| 무료 한도 | Claude Code 주요 화면은 유료 구독 또는 API 계정 중심 | Free 플랜에서 빠른 코딩 작업 체험 가능 | 공식 README 기준 분당 60회·하루 1,000회 |
| 대표 확장 방식 | CLAUDE.md, MCP, skills, hooks, subagents | AGENTS.md 계열 지침, MCP, skills, plugins, subagents | GEMINI.md, MCP, extensions, GitHub Action |
| 자동화 | 파이프·CI, GitHub/GitLab, 웹·데스크톱 예약 작업 | codex exec, CI, 로컬↔클라우드 작업 전달 | 비대화형 실행, JSON 출력, GitHub Action |
| 데이터 경계 확인 | 구독·API·서드파티 제공자별 정책을 구분해야 함 | ChatGPT 로그인과 API 키 사용의 기능·과금 경계가 다름 | Google 로그인·AI Studio API·Vertex AI 경계가 다름 |
표의 “현재 모델”은 소비자 구독의 고정 토큰 보장량을 뜻하지 않는다. 세 제품 모두 작업 크기, 선택 모델, 컨텍스트, 도구 호출, 캐시와 실행 위치에 따라 실제 사용량이 달라진다. 특히 Codex 공식 문서는 비슷한 작업도 모델·추론·도구·검색에 따라 한도 소모가 달라진다고 명시한다.
가장 중요한 차이 1: 어디서 실행하고 어떻게 이어가나
세 도구 모두 터미널에서 저장소를 읽고 파일을 수정하며 명령을 실행한다. 차이는 작업을 다른 화면과 환경으로 넘기는 방식이다.
- Claude Code는 터미널, VS Code·JetBrains, 데스크톱, 웹에서 같은 엔진과 프로젝트 지침·MCP 설정을 활용한다. 웹에서 장기 작업을 돌리고 터미널로 가져오는 흐름도 공식 지원한다.
- Codex는 로컬 CLI의 대화형 작업과
codex exec자동화, Codex cloud를 분리해 제공한다. CLI에서 클라우드 작업을 제출하고 결과를 로컬 저장소에 적용할 수 있다. - Gemini CLI는 터미널 중심의 가벼운 오픈소스 도구다. 비대화형 실행과 JSON 출력, 공식 GitHub Action으로 자동화 파이프라인을 만들 수 있다.
로컬 저장소 안에서 사람과 에이전트가 빠르게 주고받는다면 셋 모두 가능하다. 컴퓨터를 떠나 여러 장기 작업을 관리해야 한다면 Claude Code와 Codex의 웹·클라우드 화면이 더 직접적이다. 조직이 소스와 실행 경로를 직접 감사해야 한다면 Apache 2.0으로 공개된 Codex CLI와 Gemini CLI 저장소가 검토에 유리하다.
가장 중요한 차이 2: 권한과 샌드박스
“에이전트가 알아서 한다”는 말만 보고 도구를 고르면 위험하다. 실제 운영에서는 어떤 파일을 쓰고 어떤 명령을 실행하며 네트워크에 접근하는지가 더 중요하다.
| 확인 항목 | Claude Code | Codex | Gemini CLI |
|---|---|---|---|
| 변경 승인 | 권한 설정과 훅으로 도구 실행 경계를 제어 | /permissions에서 편집·명령 승인과 writable root 확인 | 도구 호출 승인·샌드박스 설정을 구성 |
| 격리 관점 | 실행 환경과 설정 정책을 함께 설계 | 로컬 샌드박스와 클라우드 격리 환경을 구분 | 로컬 실행이 기본이며 샌드박스 옵션을 별도 검토 |
| 자동화 전 필수 | 훅, 허용 도구, 비밀값, 비용 한도 | 승인 정책, writable root, 네트워크, Git 체크포인트 | 도구 승인, 인증 방식, 프로젝트 범위, 출력 형식 |
프로덕션 자격증명, 배포 키, 결제·삭제 권한이 있는 환경에서는 어느 제품도 기본 설정 그대로 무인 실행하면 안 된다. 별도 브랜치나 worktree, 최소 권한 자격증명, 테스트와 린트, diff 검토를 공통 안전장치로 둬야 한다.
Claude Code: 장기 작업과 조율이 중요한 경우

Anthropic 공식 문서에서 Claude Code는 코드베이스를 읽고, 여러 파일을 수정하고, 명령을 실행하며 개발 도구와 연결하는 에이전틱 코딩 도구로 설명된다. 2026년 8월 현재 모델 문서는 복잡한 에이전틱 코딩에 Claude Opus 5를 우선 제시하고, 속도와 지능의 균형에는 Sonnet 5를 제시한다. 이전 글의 Opus 4.6·Sonnet 4.6 표기는 현재 세대와 맞지 않아 교체했다.
Claude Code가 맞는 조건
- 기능 구현과 리팩터링을 여러 파일·도구에 걸쳐 오래 이어가야 한다.
- CLAUDE.md, skills, hooks, MCP를 팀 표준 워크플로로 묶고 싶다.
- 서브에이전트가 조사·구현·검증을 나눠 처리하는 구조가 필요하다.
- 웹·데스크톱·모바일에서 장기 작업을 시작하거나 이어가야 한다.
비용은 “시간당 얼마”처럼 고정할 수 없다. Anthropic은 API 기반 기업 배포의 평균을 활성 개발자 1일 약 $13, 월 $150~250으로 제시하지만, 이는 개인 Pro·Max 구독 청구액이 아니라 조직 API 사용의 관측치다. 구독자는 /usage에서 플랜 한도와 활동 내역을 보고, API 사용자는 토큰·캐시·모델별 비용을 따로 추적해야 한다.
Codex: 로컬·클라우드 연결과 명시적 통제가 중요한 경우

Codex CLI는 로컬 컴퓨터에서 실행되며 저장소를 검사하고 편집하고 명령을 실행한다. 이전 글은 Codex를 “모든 작업을 원격 샌드박스에서만 실행하는 도구”처럼 설명했지만 정확하지 않다. 로컬 CLI와 격리된 Codex cloud는 서로 다른 실행 표면이다. CLI에서는 모델, 추론 강도, 권한, 명령을 사용자가 고르고 codex exec로 CI 작업을 반복할 수 있다.
Codex가 맞는 조건
- 터미널 작업을 스크립트·CI와 같은 명령형 흐름으로 연결하고 싶다.
- 코드 리뷰 전용 실행, 이미지 입력, 웹 검색, MCP, 서브에이전트를 한 CLI에서 쓰고 싶다.
- 로컬에서 시작한 조사와 수정 일부를 클라우드 작업으로 넘기고 싶다.
- ChatGPT Free·Go·Plus·Pro 또는 API 키 중 팀 과금 방식에 맞춰 진입하고 싶다.
2026년 8월 29일 공식 모델 문서의 권장 계열은 GPT-5.6 Sol·Terra·Luna다. 가장 어려운 코딩·연구에는 Sol, 일상적인 생산 작업에는 Terra, 빠른 대량 작업에는 Luna라는 구분이 제시된다. 소비자 플랜은 고정 메시지 수를 보장하지 않으므로 “Plus면 하루 몇 회”처럼 단정하면 안 된다.
Gemini CLI: 무료 진입과 검색·오픈소스가 중요한 경우

Gemini CLI 공식 README는 개인 Google 계정에 분당 60회·하루 1,000회 무료 한도와 Gemini 3 계열의 1M 토큰 컨텍스트를 제시한다. 이 숫자는 한 번의 개발 작업 수가 아니라 요청 한도다. 에이전트가 한 작업 안에서 여러 도구와 모델 요청을 사용할 수 있으므로 “하루 1,000개 작업”으로 해석하면 안 된다.
Gemini CLI가 맞는 조건
- 신용카드 없이 개인 Google 계정으로 코딩 에이전트를 시작하고 싶다.
- 최신 라이브러리나 API 문서를 Google Search grounding으로 확인해야 한다.
- Apache 2.0 저장소를 감사·포크하거나 자체 확장을 만들고 싶다.
- GEMINI.md, MCP, 확장, GitHub Action으로 비교적 가벼운 자동화를 구성하고 싶다.
인증은 개인 Google 로그인, AI Studio API 키, Vertex AI로 나뉜다. 개인 계정은 일반적으로 Google Cloud 프로젝트가 필요 없지만, 회사·학교·Workspace 계정과 조직용 Code Assist 라이선스는 프로젝트 설정이 필요할 수 있다. 조직 데이터 경계가 중요하다면 “Gemini CLI를 쓴다”가 아니라 어떤 인증 경로와 약관을 쓰는지까지 기록해야 한다.
설치 명령과 첫 실행
| 도구 | 공식 설치 예시 | 첫 실행 |
|---|---|---|
| Claude Code | curl -fsSL https://claude.ai/install.sh | bash | claude |
| Codex | curl -fsSL https://chatgpt.com/codex/install.sh | sh | codex |
| Gemini CLI | npm install -g @google/gemini-cli | gemini |
회사 환경에서는 설치 스크립트를 바로 실행하기 전에 다운로드 경로, 패키지 서명, 자동 업데이트 정책을 검토해야 한다. Claude Code는 native install의 백그라운드 업데이트와 Homebrew stable·latest 채널이 다르고, Gemini CLI는 stable·preview·nightly 채널을 구분한다.
실무 선택표: 하나만 고른다면
| 상황 | 우선 선택 | 이유 |
|---|---|---|
| 복잡한 모노레포 기능 구현과 장기 리팩터링 | Claude Code | 프로젝트 지침, 훅, 스킬, 서브에이전트와 여러 실행 표면을 한 흐름으로 묶기 좋다. |
| 로컬 수정·코드 리뷰·CI·클라우드 위임을 연결 | Codex | 대화형 CLI와 codex exec, cloud, 권한 제어가 직접 연결된다. |
| 무료 입문과 최신 문서 조사 | Gemini CLI | 개인 무료 한도, Google Search grounding, 1M 컨텍스트가 공개돼 있다. |
| 조직이 CLI 소스를 직접 감사 | Codex 또는 Gemini CLI | 두 CLI 저장소가 Apache 2.0으로 공개돼 있다. |
| 모델 공급자를 분산해 장애·한도 위험을 줄임 | 둘 이상 병행 | 같은 테스트 세트와 Git diff 기준으로 작업을 나눌 수 있다. |
셋을 함께 쓸 때의 현실적인 역할 분담
세 도구를 무조건 모두 구독할 필요는 없다. 다만 이미 여러 플랜을 쓰거나 팀에서 공급자 분산이 필요하다면 역할을 다음처럼 나눌 수 있다.
- 탐색: Gemini CLI의 Search grounding 또는 Codex의 웹 검색으로 최신 문서와 변경 사항을 찾는다.
- 구현: Claude Code나 Codex 중 실제 저장소 테스트에서 성공률이 높은 도구에 기능 구현을 맡긴다.
- 독립 검토: 구현에 쓰지 않은 다른 모델로 diff 리뷰를 수행해 같은 모델의 맹점을 줄인다.
- 자동화: 비대화형 명령과 CI에서는 고정 모델, 권한, 예산, 출력 형식을 명시한다.
비용과 품질은 분리해 기록해야 한다. 작업별 입력·출력 토큰, 캐시, 도구 호출, 재시도, 테스트 성공 여부를 함께 남겨야 “싸지만 실패가 많은 도구”와 “비싸지만 한 번에 끝나는 도구”를 구분할 수 있다. 측정 설계는 AI 에이전트 비용 추적 가이드와 AI 에이전트 OpenTelemetry 추적 가이드를 참고할 수 있다.
도입 전 30분 비교 테스트
- 실제 저장소에서 30분 안에 끝낼 수 있는 버그 수정 하나를 고른다.
- 세 도구에 같은 요구사항, 허용 파일, 금지 작업, 테스트 명령을 준다.
- 완료 시간보다 테스트 통과, 불필요한 변경, 재시도, 사람 개입 횟수를 기록한다.
- 민감한 자격증명과 프로덕션 네트워크는 제외하고 별도 브랜치에서 실행한다.
- 결과 diff를 블라인드로 검토한 뒤 비용·한도 소모를 함께 비교한다.
이 작은 검증이 공개 벤치마크 순위보다 팀의 언어, 프레임워크, 테스트 품질, 저장소 규모를 더 잘 반영한다. 공개 벤치마크를 인용할 때도 제공사 자체 측정인지 독립 평가인지, 실행 설정과 날짜가 같은지 확인해야 한다.
자주 묻는 질문
Claude Code, Codex, Gemini CLI 중 성능이 가장 좋은 것은?
모든 작업에서 고정된 1위는 없다. 모델뿐 아니라 에이전트 하네스, 권한, 검색, 도구, 프로젝트 지침, 테스트가 결과를 바꾼다. 실제 저장소의 대표 작업 3~5개로 성공률과 수정 품질을 비교하는 편이 정확하다.
무료로 시작하려면 무엇이 좋은가?
Gemini CLI는 개인 Google 계정에 분당 60회·하루 1,000회 한도를 공식 공개한다. Codex도 Free 플랜을 제공한다. 다만 무료 한도의 모델, 기능, 지역, 프로모션은 바뀔 수 있으므로 첫 로그인 화면과 공식 플랜 문서를 다시 확인해야 한다.
1M 컨텍스트면 저장소 전체를 항상 정확히 이해하나?
아니다. 컨텍스트 상한이 크다고 관련 파일 선택과 추론이 자동으로 정확해지는 것은 아니다. 저장소 지도, 프로젝트 지침, 검색 전략, 테스트 피드백이 함께 필요하다. 큰 파일을 무작정 모두 넣으면 비용과 지연만 늘 수 있다.
구독 플랜의 메시지 수를 미리 계산할 수 있나?
고정 숫자로 계산하기 어렵다. 작업 크기, 모델, 컨텍스트, 추론 강도, 도구 호출, 캐시, 로컬·클라우드 실행이 한도 소모를 바꾼다. 각 제품의 사용량 화면에서 실제 팀 작업을 측정해야 한다.
참고 자료
- Anthropic Claude Code Overview
- Anthropic Models Overview
- Anthropic Claude Code Cost Management
- OpenAI Codex CLI
- OpenAI Codex Models
- OpenAI Codex Pricing
- Google Gemini CLI 공식 저장소
- Gemini CLI Authentication