작성일: 2026-09-12
출처 기반: 이승유(패스트캠퍼스) 강의클로드코드와 DeepSeek·Qwen·GLM 조합으로 토큰 비용 10배 줄이기+ 영어·중국어권 공개 자료
대상 도구: codex, claude-opus-4.7 기반 Claude Code (둘 다 커버)
1. 핵심 아이디어 (공통)
“가장 비싼 하나의 모델로 모든 작업을 처리하지 말고, 작업의 난이도와 토큰 특성에 따라 모델을 나누어 써라.”
- 반복/단순 코딩 루프, 대규모 코드 탐색, Tool Use/Agent 반복 작업은 토큰이 많이 쌓이지만 프론티어 모델이 꼭 필요한 구간은 아니다.
- 이 구간을 더 저렴한 오픈웨이트/오픈 모델(deepseek-v4, glm-5.2 등)로 분리하면 비용은 크게 줄이고, 품질 손실이 큰 구간은 프론티어(claude-opus-4.7 등)에 남기는 구조가 가능하다.
- 영어·중국어권에서도 2026년 현재 이 원칙이 사실상 표준 실무로 수렴하고 있다(Ruben Torney, Tech Insider, Fastino, Tyler Folkman, AtlasCloud, AimadeTools 등).
2. 작업 유형별 모델 배정 (Core Mapping)
| 층위 | 담당 작업 예시 | 추천 모델 (우선순위) | 근거 |
|---|---|---|---|
| A. 반복·단순 코딩 루프 | 보일러플레이트, 변수명 변경, docstrings, 포맷 변환, 단순 리팩토링, 파일 읽기 관찰 등 | deepseek-v4 Flash (또는 V3.2) | 배경/실행 태스크를 cheapest 모델로 보내는 것이 비용 절감의 가장 큰 축 (AtlasCloud, Ruben Torney, Fastino, Kingy AI) |
| B. 핵심 코드 생성·수정 (중간 복잡도) | 실제 기능 구현, 단일/소수 파일 패치, 스크립트, 1차 디버깅 | deepseek-v4 Pro 또는 Qwen 3.6 Plus / Qwen 3.7 Max | DeepSeek V4 Pro는 가격 대비 코딩 품질 우수, Qwen은 1M 컨텍스트 + 도구 호출 안정성 (Tech Insider, Ruben Torney, Fastino) |
| C. 대규모 코드베이스 분석·장문맥 탐색 | 레거시 분석, 프로젝트 전체 구조 파악, 여러 파일 관계 추적, 큰 컨텍스트 탐색 | Qwen 3.6 Plus / Qwen 3.7 Max (1M 컨텍스트) | “코드를 잘 읽는 것”보다 “필요한 것만 읽게 만드는 것”이 중요하며, Qwen의 긴 컨텍스트가 여기에 적합 (이승유 강의, BuildFastWithAI, Tech Insider) |
| D. Tool Use·Agent 반복·정보 수집 | 문서 검색, 데이터 조회, 정보 수집, 도구 호출이 반복되는 작업, 장시간 자율 엔지니어링 | glm-5.2 (또는 GLM-5.1) | GLM은 도구 호출 성공률·장시간 에이전트형 작업에 강점 (AimadeTools, BuildFastWithAI, MindStudio) |
| E. 프론티어 품질이 필요한 작업 | 아키텍처 결정, 까다로운 다단계 디버깅, 프로덕션 코드 리뷰, 실패 비용이 큰 작업 | claude-opus-4.7 또는 gpt-5.5 (Codex 생태계) | cheapest 모델로 대체할 수 없는 구간은 프론티어를 남긴다 (RouteLLM, Requesty, Fastino, Ruben Torney) |
원칙: 모든 작업을 한 모델에 넣지 않는다. 위 A~E로 나누고, 프론티어(E)는 “꼭 필요할 때만” 쓰는 쪽이 비용 효율이 좋다.
3. Claude Code 기준 구성 (강의와 직접 연결)
3.1 가장 단순한 슬롯 분리
Claude Code는 ANTHROPIC_DEFAULT_HAIKU_MODEL으로 배경 태스크용 모델을 지정할 수 있다.
~/.claude/settings.json
{
"env": {
"ANTHROPIC_BASE_URL": "https://api.deepseek.com/anthropic",
"ANTHROPIC_AUTH_TOKEN": "YOUR_DEEPSEEK_API_KEY",
"ANTHROPIC_MODEL": "deepseek-ai/deepseek-v4-pro",
"ANTHROPIC_DEFAULT_HAIKU_MODEL": "deepseek-ai/deepseek-v4-flash"
}
}- 주 프롬프트/응답 → DeepSeek V4 Pro
- Claude Code가 자동 실행하는 배경 태스크 → DeepSeek V4 Flash
장단점
- 장점: 추가 라우터 없이 설정만으로 배경 태스크 비용을 낮춤.
- 한계: 작업 복잡도를 보고 능동적으로 모델을 바꾸지는 못함(수동 구분만 가능).
3.2 라우터 프록시 사용 (자동 분배)
ANTHROPIC_BASE_URL을 로컬 프록시로 지정하고, 요청 유형·토큰량·태그에 따라 DeepSeek·Qwen·GLM·Ollama 등으로 분배.
예시 (Claude Code Router 계열):
{
"default": "deepseek,deepseek-v4-pro",
"background": "deepseek,deepseek-v4-flash",
"longContext": "qwen,qwen3.6-plus",
"agentic": "z-ai/glm-5.1",
"frontier": "anthropic,claude-opus-4-7"
}참고 프로젝트: musistudio/claude-code-router, MadAppGang/claudish, samestrin/llm-env.
3.3 openrouter 경유
openrouter 하나로 DeepSeek·Qwen·GLM·Kimi 등 접근. Claude Code의 ANTHROPIC_BASE_URL을 openrouter 엔드포인트로 설정 후 ANTHROPIC_MODEL을 전환.
장점: 제공자별 키 관리 부담이 적고 모델 비교/failover가 쉬움.
참고: Codersera, MindStudio OpenRouter 가이드, Kingy AI.
4. codex CLI 기준 구성
강의 실습은 Claude Code 중심이지만, Q3에서 직접 밝힌 대로 codex CLI도 같은 원리를 적용할 수 있다.
핵심 차이: codex는 OpenAI 호환 API를 쓰고, 모델 전환을 세션 단위 또는 외부 라우터로 구현해야 한다.
4.1 기본 접속 방식
-
제공자별 OpenAI 호환 엔드포인트 직접 연결
DeepSeek, Qwen, GLM, Kimi, MiniMax 등은 OpenAI 호환 엔드포인트를 제공(SiliconFlow, openrouter, 각사 대시보드 등). codex의~/.codex/config.toml에model_provider를 정의하고base_url을 해당 제공자 OpenAI 엔드포인트로 지정.AtlasCloud 예시 (codex):
model_provider = "atlas_coding_plan" model = "deepseek-ai/deepseek-v4-pro" [model_providers.atlas_coding_plan] name = "atlascloud" base_url = "https://api.atlascloud.ai/v1" wire_api = "chat" requires_openai_auth = true~/.codex/auth.json에OPENAI_API_KEY로 제공자 키를 넣는다. -
openrouter를 단일 게이트웨브로 사용
codex의 베이스 URL을https://openrouter.ai/api/v1로 두고,model을deepseek/deepseek-v4-pro,qwen/qwen3.6-plus,z-ai/glm-5.1등으로 지정. 가장 간단하게 “하나 키로 여러 모델”을 쓰는 방법. -
정액제 Coding Plan 이용
GLM Coding Plan, Alibaba Coding Plan, StepFun Step Plan, MiMo Token Plan 등은 OpenAI 호환 엔드포인트 + 단일 키로 여러 모델을 정액/할당 크레딧 내에서 쓰게 해줌(AtlasCloud, 文学城, CodingPlan.org).
4.2 codex에는 내장 슬롯 분리가 없다 → 라우팅은 어떻게?
-
세션 분리형 (수동)
작업 성격에 따라 codex를 띄울 때 환경/설정을 바꿔 다른 모델을 사용.- 탐색·요약·장문맥 분석 → Qwen 3.6 Plus / 3.7 Max
- 실제 코딩·리팩토링 → DeepSeek V4 Pro / Flash
- 도구 호출 많은 작업 → GLM 계열
설정 변경은config.toml의model또는 환경변수(openrouter 사용 시OPENAI_MODEL등) 변경 후 재시작.
-
라우터 프록시 사용 (자동)
LiteLLM, Portkey, 사용자 제작 프록시를 로컬에 두고, codex의base_url을 그 프록시로 향하게 한 뒤 프롬프트 내용·토큰량·태그 등에 따라 모델 분배. -
openrouter 자동 라우트 모델
openrouter/auto등으로 프롬프트 복잡도에 따라 cheap/expensive 자동 분배 가능(세밀한 작업별 제어는 어려움).
실무 조합: 세션 분리 + 필요 시 openrouter 게이트웨이가 가장 단순하고 빠르게 하이브리드 효과를 보는 길.
4.3 codex용 작업별 모델 배정 (권고안)
| 층위 | 작업 예시 | codex 추천 모델 | 참고 |
|---|---|---|---|
| A | 반복·단순 코딩 루프 | deepseek-v4 Flash (또는 V3.2) | AtlasCloud, Ruben Torney, Fastino |
| B | 핵심 코드 생성·수정 (중간 복잡도) | deepseek-v4 Pro 또는 Qwen 3.6 Plus / 3.7 Max | Tech Insider, Ruben Torney, Fastino |
| C | 대규모 코드베이스 분석·장문맥 탐색 | Qwen 3.6 Plus / Qwen 3.7 Max (1M 컨텍스트) | 이승유 강의, BuildFastWithAI, Tech Insider |
| D | 도구 호출·반복 탐색/수집 | glm-5.2 (OpenAI 호환 또는 게이트웨이 경유) | AimadeTools, BuildFastWithAI, MindStudio |
| E | 정밀 계획·리뷰·실패 비용이 큰 작업 | gpt-5.5 (codex 생태계) 또는 프론티어 모델을 게이트웨이로 | Fastino, Ruben Torney |
codex 조합 시작점 예시:
플래닝/리뷰: [[gpt-5.5]] ([[codex]] 기본 생태계)
코딩·실행: [[deepseek-v4]] Pro (주 작업) + [[deepseek-v4]] Flash (반복·단순 태스크)
장문맥 분석: Qwen 3.6 Plus / 3.7 Max
도구 호출·수집 반복: [[glm-5.2]]
5. 비용 절감의 현실적 범위와 조건
- “10배”는 상한값으로 보는 것이 맞으며, 실제 절감은 아래 요소에 달림.
- 반복/배경 태스크 비중이 클수록 절감폭 큼 (Tyler Folkman: 2,415턴 $76.77, Requesty: Opus 전체 → 70/20/10 라우팅 → 86% 절감 사례).
- 대용량 컨텍스트 작업이 많으면 Qwen 장착 효과가 큼.
- Tool Use/Agent 루프가 token 폭증의 주범이면 GLM 분리 이득.
- 품질 하락 리스크: DeepSeek Flash/Pro, Qwen, GLM이 모든 작업에서 Claude Opus/Sonnet과 동등하지 않음. 특히 아키텍처 결정·복잡한 디버깅·프로덕션 리뷰는 프론티어를 남기는 편이 안전(Fastino, Ruben Torney, AimadeTools).
- 벤치마크 비교 시 harness 조건 차이 주의: DeepSeek Terminal Bench 2.1과 GLM-5.3 Flash 점수는 서로 다른 harness로 측정된 것이라 직접 비교가 어려움(Local AI Zone).
- 비용 절감 정량 재료: Tech Insider 세션당 비용표, Tyler Folkman 2,415턴 실험, Fastino 4단계 비용 프레임워크, Requesty 70/20/10 분포, RouteLLM(14
26% 프론티어 라우팅으로 7585% 비용 절감).
6. 실전 워크플로우 (시작 순서)
- 현재 내 Claude Code/codex 사용에서 토큰 비용이 주로 어디서 발생하는지 측정 (사용 통계, 라우팅 로그).
- 가장 비중이 큰 낭비 구간을 cheap 모델로 옮긴다.
- 반복·단순 코딩 → DeepSeek Flash/Pro
- 장문맥 분석 → Qwen
- 도구 호출 반복 → GLM
- 품질 위험이 큰 구간(아키텍처·까다로운 디버깅·프로덕션 리뷰)만 프론티어(Claude/GPT)로 남긴다.
- 라우팅 규칙(또는 슬롯 설정)을 만들고 실제 작업으로 품질·비용을 비교한다.
- 새 모델이 나오거나 작업 구성이 바뀌면 판정 기준을 다시 조정한다.
7. 함께 보면 좋은 공개 자료
| 자료 | 핵심 내용 | 링크 |
|---|---|---|
| Alorse/cc-compatible-models | Claude Code에 DeepSeek·Qwen·MiniMax·Kimi·GLM·MiMo·StepFun 등 붙이는 전체 구성법 + 가격표 | https://github.com/Alorse/cc-compatible-models |
| AtlasCloud (중) | 2026년 DeepSeek·Kimi·GLM·MiniMax·Qwen 모델 비교 + Claude Code/codex 설정 + 라우팅 가이드 | https://www.atlascloud.ai/zh/blog/tips/coding-plan-best-open-source-coding-llm |
| 腾讯云开发者社区 (중) | Claude Code에 DeepSeek·Qwen·GLM·Kimi 직접 연동 가이드 | https://cloud.tencent.com/developer/article/2685784 |
| AimadeTools (영/중) | GLM-5.1 vs DeepSeek V3 vs Qwen 3.5 비교, 작업별 추천 | https://www.aimadetools.com/blog/glm-5-1-vs-deepseek-vs-qwen-coding |
| BuildFastWithAI (영) | Qwen 3.6 Plus vs GLM-5.1 vs Kimi 2.5 — 실사용 워크플로우 사례 | https://www.buildfastwithai.com/blogs/qwen-3-6-plus-vs-glm-5-1-vs-kimi-2-5-coding-2026 |
| Tech Insider (영) | Claude Opus 4.8 vs GPT-5.5 vs DeepSeek V4-Pro vs Qwen 3.6 — 세션당 비용·작업별 모델 선택 | https://tech-insider.org/best-ai-model-for-coding-2026 |
| Ruben Torney (영) | 2026 LLM Coding Comparison — Claude·DeepSeek·GPT·Gemini·Qwen, “프롬팅보다 라우팅이 진짜 스킬” | https://rubentorney.com/blog/en/comparatif-llm-coding-2026.html |
| Fastino AI (영) | 코딩 모델 4단계(Scoping→Planning→Execution→Refactoring)별 모델 추천 + 비용 최적화 프레임워크 | https://fastino.ai/blog/how-to-choose-the-best-coding-models-in-2026 |
| Tyler Folkman (영) | 2,415 에이전트 턴을 6개 모델에 라우팅한 실제 로그 기반 분석 | https://tylerfolkman.substack.com/p/i-tested-6-ai-models-across-3-providers |
| MindStudio (영) | 2026년 에이전트 코딩용 오픈웨이트 모델 랭킹, Qwen 3.6 Plus·DeepSeek·GLM·Kimi 포지셔닝 | https://www.mindstudio.ai/blog/best-open-source-llms-agentic-coding-2026 |
| Kingy AI (영) | Best Open-Weight AI Models 2026 shortlist + codex/Claude Code 워크플로우별 추천 | https://kingy.ai/news/best-open-weight-ai-models-in-2026-glm-5-2-vs-deepseek-v4-vs-kimi-k2-6-vs-qwen-vs-mistral |
| Claude Code Router (영) | Claude Code 요청을 작업 유형별 다른 모델로 라우팅하는 오픈소스 프록시 | https://www.morphllm.com/claude-code-router |
| Requesty (영) | AI Agent 비용 최적화: 70/20/10 분포로 60~80% 절감, 모델 라우팅 일반론 | https://www.requesty.ai/blog/ai-agent-cost-optimization-how-to-cut-llm-spend-by-80-percent-with-routing |
| 文学城 (중) | 2026 상반기 AI 업계 총정리 + Coding Plan·Anthropic 호환 생태계 분석 | https://www.wenxuecity.com/news/2026/06/11/126676390.html |
| 이승유 강의 (한) | 클로드코드 + DeepSeek·Qwen·GLM 조합, 토큰 비용 절감, 하이브리드 워크플로우 | https://fastcampus.co.kr/data_online_openrouter |
| 이승유 전작 (한) | 오픈소스 LLM으로 인프라 투자 없이 고성능 AI 모델 개발하기 (LLM 원리·구조·추론·Cost 최적화) | https://fastcampus.co.kr/data_online_llmai |