작성일: 2026-09-12
출처 기반: 이승유(패스트캠퍼스) 강의 클로드코드와 DeepSeek·Qwen·GLM 조합으로 토큰 비용 10배 줄이기 + 영어·중국어권 공개 자료
대상 도구: codex, claude-opus-4.7 기반 Claude Code (둘 다 커버)


1. 핵심 아이디어 (공통)

“가장 비싼 하나의 모델로 모든 작업을 처리하지 말고, 작업의 난이도와 토큰 특성에 따라 모델을 나누어 써라.”

  • 반복/단순 코딩 루프, 대규모 코드 탐색, Tool Use/Agent 반복 작업은 토큰이 많이 쌓이지만 프론티어 모델이 꼭 필요한 구간은 아니다.
  • 이 구간을 더 저렴한 오픈웨이트/오픈 모델(deepseek-v4, glm-5.2 등)로 분리하면 비용은 크게 줄이고, 품질 손실이 큰 구간은 프론티어(claude-opus-4.7 등)에 남기는 구조가 가능하다.
  • 영어·중국어권에서도 2026년 현재 이 원칙이 사실상 표준 실무로 수렴하고 있다(Ruben Torney, Tech Insider, Fastino, Tyler Folkman, AtlasCloud, AimadeTools 등).

2. 작업 유형별 모델 배정 (Core Mapping)

층위담당 작업 예시추천 모델 (우선순위)근거
A. 반복·단순 코딩 루프보일러플레이트, 변수명 변경, docstrings, 포맷 변환, 단순 리팩토링, 파일 읽기 관찰 등deepseek-v4 Flash (또는 V3.2)배경/실행 태스크를 cheapest 모델로 보내는 것이 비용 절감의 가장 큰 축 (AtlasCloud, Ruben Torney, Fastino, Kingy AI)
B. 핵심 코드 생성·수정 (중간 복잡도)실제 기능 구현, 단일/소수 파일 패치, 스크립트, 1차 디버깅deepseek-v4 Pro 또는 Qwen 3.6 Plus / Qwen 3.7 MaxDeepSeek V4 Pro는 가격 대비 코딩 품질 우수, Qwen은 1M 컨텍스트 + 도구 호출 안정성 (Tech Insider, Ruben Torney, Fastino)
C. 대규모 코드베이스 분석·장문맥 탐색레거시 분석, 프로젝트 전체 구조 파악, 여러 파일 관계 추적, 큰 컨텍스트 탐색Qwen 3.6 Plus / Qwen 3.7 Max (1M 컨텍스트)“코드를 잘 읽는 것”보다 “필요한 것만 읽게 만드는 것”이 중요하며, Qwen의 긴 컨텍스트가 여기에 적합 (이승유 강의, BuildFastWithAI, Tech Insider)
D. Tool Use·Agent 반복·정보 수집문서 검색, 데이터 조회, 정보 수집, 도구 호출이 반복되는 작업, 장시간 자율 엔지니어링glm-5.2 (또는 GLM-5.1)GLM은 도구 호출 성공률·장시간 에이전트형 작업에 강점 (AimadeTools, BuildFastWithAI, MindStudio)
E. 프론티어 품질이 필요한 작업아키텍처 결정, 까다로운 다단계 디버깅, 프로덕션 코드 리뷰, 실패 비용이 큰 작업claude-opus-4.7 또는 gpt-5.5 (Codex 생태계)cheapest 모델로 대체할 수 없는 구간은 프론티어를 남긴다 (RouteLLM, Requesty, Fastino, Ruben Torney)

원칙: 모든 작업을 한 모델에 넣지 않는다. 위 A~E로 나누고, 프론티어(E)는 “꼭 필요할 때만” 쓰는 쪽이 비용 효율이 좋다.


3. Claude Code 기준 구성 (강의와 직접 연결)

3.1 가장 단순한 슬롯 분리

Claude Code는 ANTHROPIC_DEFAULT_HAIKU_MODEL으로 배경 태스크용 모델을 지정할 수 있다.

~/.claude/settings.json
{
  "env": {
    "ANTHROPIC_BASE_URL": "https://api.deepseek.com/anthropic",
    "ANTHROPIC_AUTH_TOKEN": "YOUR_DEEPSEEK_API_KEY",
    "ANTHROPIC_MODEL": "deepseek-ai/deepseek-v4-pro",
    "ANTHROPIC_DEFAULT_HAIKU_MODEL": "deepseek-ai/deepseek-v4-flash"
  }
}
  • 주 프롬프트/응답 → DeepSeek V4 Pro
  • Claude Code가 자동 실행하는 배경 태스크 → DeepSeek V4 Flash

장단점

  • 장점: 추가 라우터 없이 설정만으로 배경 태스크 비용을 낮춤.
  • 한계: 작업 복잡도를 보고 능동적으로 모델을 바꾸지는 못함(수동 구분만 가능).

3.2 라우터 프록시 사용 (자동 분배)

ANTHROPIC_BASE_URL을 로컬 프록시로 지정하고, 요청 유형·토큰량·태그에 따라 DeepSeek·Qwen·GLM·Ollama 등으로 분배.

예시 (Claude Code Router 계열):

{
  "default": "deepseek,deepseek-v4-pro",
  "background": "deepseek,deepseek-v4-flash",
  "longContext": "qwen,qwen3.6-plus",
  "agentic": "z-ai/glm-5.1",
  "frontier": "anthropic,claude-opus-4-7"
}

참고 프로젝트: musistudio/claude-code-router, MadAppGang/claudish, samestrin/llm-env.

3.3 openrouter 경유

openrouter 하나로 DeepSeek·Qwen·GLM·Kimi 등 접근. Claude Code의 ANTHROPIC_BASE_URLopenrouter 엔드포인트로 설정 후 ANTHROPIC_MODEL을 전환.

장점: 제공자별 키 관리 부담이 적고 모델 비교/failover가 쉬움.
참고: Codersera, MindStudio OpenRouter 가이드, Kingy AI.


4. codex CLI 기준 구성

강의 실습은 Claude Code 중심이지만, Q3에서 직접 밝힌 대로 codex CLI도 같은 원리를 적용할 수 있다.
핵심 차이: codex는 OpenAI 호환 API를 쓰고, 모델 전환을 세션 단위 또는 외부 라우터로 구현해야 한다.

4.1 기본 접속 방식

  • 제공자별 OpenAI 호환 엔드포인트 직접 연결
    DeepSeek, Qwen, GLM, Kimi, MiniMax 등은 OpenAI 호환 엔드포인트를 제공(SiliconFlow, openrouter, 각사 대시보드 등). codex~/.codex/config.tomlmodel_provider를 정의하고 base_url을 해당 제공자 OpenAI 엔드포인트로 지정.

    AtlasCloud 예시 (codex):

    model_provider = "atlas_coding_plan"
    model = "deepseek-ai/deepseek-v4-pro"
     
    [model_providers.atlas_coding_plan]
    name = "atlascloud"
    base_url = "https://api.atlascloud.ai/v1"
    wire_api = "chat"
    requires_openai_auth = true

    ~/.codex/auth.jsonOPENAI_API_KEY로 제공자 키를 넣는다.

  • openrouter를 단일 게이트웨브로 사용
    codex의 베이스 URL을 https://openrouter.ai/api/v1로 두고, modeldeepseek/deepseek-v4-pro, qwen/qwen3.6-plus, z-ai/glm-5.1 등으로 지정. 가장 간단하게 “하나 키로 여러 모델”을 쓰는 방법.

  • 정액제 Coding Plan 이용
    GLM Coding Plan, Alibaba Coding Plan, StepFun Step Plan, MiMo Token Plan 등은 OpenAI 호환 엔드포인트 + 단일 키로 여러 모델을 정액/할당 크레딧 내에서 쓰게 해줌(AtlasCloud, 文学城, CodingPlan.org).

4.2 codex에는 내장 슬롯 분리가 없다 → 라우팅은 어떻게?

  1. 세션 분리형 (수동)
    작업 성격에 따라 codex를 띄울 때 환경/설정을 바꿔 다른 모델을 사용.

    • 탐색·요약·장문맥 분석 → Qwen 3.6 Plus / 3.7 Max
    • 실제 코딩·리팩토링 → DeepSeek V4 Pro / Flash
    • 도구 호출 많은 작업 → GLM 계열
      설정 변경은 config.tomlmodel 또는 환경변수(openrouter 사용 시 OPENAI_MODEL 등) 변경 후 재시작.
  2. 라우터 프록시 사용 (자동)
    LiteLLM, Portkey, 사용자 제작 프록시를 로컬에 두고, codexbase_url을 그 프록시로 향하게 한 뒤 프롬프트 내용·토큰량·태그 등에 따라 모델 분배.

  3. openrouter 자동 라우트 모델
    openrouter/auto 등으로 프롬프트 복잡도에 따라 cheap/expensive 자동 분배 가능(세밀한 작업별 제어는 어려움).

실무 조합: 세션 분리 + 필요 시 openrouter 게이트웨이가 가장 단순하고 빠르게 하이브리드 효과를 보는 길.

4.3 codex용 작업별 모델 배정 (권고안)

층위작업 예시codex 추천 모델참고
A반복·단순 코딩 루프deepseek-v4 Flash (또는 V3.2)AtlasCloud, Ruben Torney, Fastino
B핵심 코드 생성·수정 (중간 복잡도)deepseek-v4 Pro 또는 Qwen 3.6 Plus / 3.7 MaxTech Insider, Ruben Torney, Fastino
C대규모 코드베이스 분석·장문맥 탐색Qwen 3.6 Plus / Qwen 3.7 Max (1M 컨텍스트)이승유 강의, BuildFastWithAI, Tech Insider
D도구 호출·반복 탐색/수집glm-5.2 (OpenAI 호환 또는 게이트웨이 경유)AimadeTools, BuildFastWithAI, MindStudio
E정밀 계획·리뷰·실패 비용이 큰 작업gpt-5.5 (codex 생태계) 또는 프론티어 모델을 게이트웨이로Fastino, Ruben Torney

codex 조합 시작점 예시:

플래닝/리뷰: [[gpt-5.5]] ([[codex]] 기본 생태계)
코딩·실행: [[deepseek-v4]] Pro (주 작업) + [[deepseek-v4]] Flash (반복·단순 태스크)
장문맥 분석: Qwen 3.6 Plus / 3.7 Max
도구 호출·수집 반복: [[glm-5.2]]

5. 비용 절감의 현실적 범위와 조건

  • “10배”는 상한값으로 보는 것이 맞으며, 실제 절감은 아래 요소에 달림.
    • 반복/배경 태스크 비중이 클수록 절감폭 큼 (Tyler Folkman: 2,415턴 $76.77, Requesty: Opus 전체 → 70/20/10 라우팅 → 86% 절감 사례).
    • 대용량 컨텍스트 작업이 많으면 Qwen 장착 효과가 큼.
    • Tool Use/Agent 루프가 token 폭증의 주범이면 GLM 분리 이득.
  • 품질 하락 리스크: DeepSeek Flash/Pro, Qwen, GLM이 모든 작업에서 Claude Opus/Sonnet과 동등하지 않음. 특히 아키텍처 결정·복잡한 디버깅·프로덕션 리뷰는 프론티어를 남기는 편이 안전(Fastino, Ruben Torney, AimadeTools).
  • 벤치마크 비교 시 harness 조건 차이 주의: DeepSeek Terminal Bench 2.1과 GLM-5.3 Flash 점수는 서로 다른 harness로 측정된 것이라 직접 비교가 어려움(Local AI Zone).
  • 비용 절감 정량 재료: Tech Insider 세션당 비용표, Tyler Folkman 2,415턴 실험, Fastino 4단계 비용 프레임워크, Requesty 70/20/10 분포, RouteLLM(1426% 프론티어 라우팅으로 7585% 비용 절감).

6. 실전 워크플로우 (시작 순서)

  1. 현재 내 Claude Code/codex 사용에서 토큰 비용이 주로 어디서 발생하는지 측정 (사용 통계, 라우팅 로그).
  2. 가장 비중이 큰 낭비 구간을 cheap 모델로 옮긴다.
    • 반복·단순 코딩 → DeepSeek Flash/Pro
    • 장문맥 분석 → Qwen
    • 도구 호출 반복 → GLM
  3. 품질 위험이 큰 구간(아키텍처·까다로운 디버깅·프로덕션 리뷰)만 프론티어(Claude/GPT)로 남긴다.
  4. 라우팅 규칙(또는 슬롯 설정)을 만들고 실제 작업으로 품질·비용을 비교한다.
  5. 새 모델이 나오거나 작업 구성이 바뀌면 판정 기준을 다시 조정한다.

7. 함께 보면 좋은 공개 자료

자료핵심 내용링크
Alorse/cc-compatible-modelsClaude Code에 DeepSeek·Qwen·MiniMax·Kimi·GLM·MiMo·StepFun 등 붙이는 전체 구성법 + 가격표https://github.com/Alorse/cc-compatible-models
AtlasCloud (중)2026년 DeepSeek·Kimi·GLM·MiniMax·Qwen 모델 비교 + Claude Code/codex 설정 + 라우팅 가이드https://www.atlascloud.ai/zh/blog/tips/coding-plan-best-open-source-coding-llm
腾讯云开发者社区 (중)Claude Code에 DeepSeek·Qwen·GLM·Kimi 직접 연동 가이드https://cloud.tencent.com/developer/article/2685784
AimadeTools (영/중)GLM-5.1 vs DeepSeek V3 vs Qwen 3.5 비교, 작업별 추천https://www.aimadetools.com/blog/glm-5-1-vs-deepseek-vs-qwen-coding
BuildFastWithAI (영)Qwen 3.6 Plus vs GLM-5.1 vs Kimi 2.5 — 실사용 워크플로우 사례https://www.buildfastwithai.com/blogs/qwen-3-6-plus-vs-glm-5-1-vs-kimi-2-5-coding-2026
Tech Insider (영)Claude Opus 4.8 vs GPT-5.5 vs DeepSeek V4-Pro vs Qwen 3.6 — 세션당 비용·작업별 모델 선택https://tech-insider.org/best-ai-model-for-coding-2026
Ruben Torney (영)2026 LLM Coding Comparison — Claude·DeepSeek·GPT·Gemini·Qwen, “프롬팅보다 라우팅이 진짜 스킬”https://rubentorney.com/blog/en/comparatif-llm-coding-2026.html
Fastino AI (영)코딩 모델 4단계(Scoping→Planning→Execution→Refactoring)별 모델 추천 + 비용 최적화 프레임워크https://fastino.ai/blog/how-to-choose-the-best-coding-models-in-2026
Tyler Folkman (영)2,415 에이전트 턴을 6개 모델에 라우팅한 실제 로그 기반 분석https://tylerfolkman.substack.com/p/i-tested-6-ai-models-across-3-providers
MindStudio (영)2026년 에이전트 코딩용 오픈웨이트 모델 랭킹, Qwen 3.6 Plus·DeepSeek·GLM·Kimi 포지셔닝https://www.mindstudio.ai/blog/best-open-source-llms-agentic-coding-2026
Kingy AI (영)Best Open-Weight AI Models 2026 shortlist + codex/Claude Code 워크플로우별 추천https://kingy.ai/news/best-open-weight-ai-models-in-2026-glm-5-2-vs-deepseek-v4-vs-kimi-k2-6-vs-qwen-vs-mistral
Claude Code Router (영)Claude Code 요청을 작업 유형별 다른 모델로 라우팅하는 오픈소스 프록시https://www.morphllm.com/claude-code-router
Requesty (영)AI Agent 비용 최적화: 70/20/10 분포로 60~80% 절감, 모델 라우팅 일반론https://www.requesty.ai/blog/ai-agent-cost-optimization-how-to-cut-llm-spend-by-80-percent-with-routing
文学城 (중)2026 상반기 AI 업계 총정리 + Coding Plan·Anthropic 호환 생태계 분석https://www.wenxuecity.com/news/2026/06/11/126676390.html
이승유 강의 (한)클로드코드 + DeepSeek·Qwen·GLM 조합, 토큰 비용 절감, 하이브리드 워크플로우https://fastcampus.co.kr/data_online_openrouter
이승유 전작 (한)오픈소스 LLM으로 인프라 투자 없이 고성능 AI 모델 개발하기 (LLM 원리·구조·추론·Cost 최적화)https://fastcampus.co.kr/data_online_llmai