개요
NVIDIA NeMo Switchyard는 LLM 애플리케이션이 여러 모델과 제공자 사이에서 트래픽을 라우팅할 수 있게 하는 오픈소스 오케스트레이션 계층이다. 네이티브 OpenAI 및 Anthropic API 호환성을 유지하면서, 작업별로 최적의 모델을 선택해 비용·성능·정확도를 균형 있게 조정할 수 있다.^[https://github.com/NVIDIA-NeMo/Switchyard]
핵심 가치는 “각 LLM 호출을 해당 작업을 수행할 수 있는 가장 저렴한 모델로 라우팅”하는 것 — 에이전트 코드를 한 줄도 변경하지 않고 적용 가능하다.^[https://github.com/NVIDIA-NeMo/Switchyard]
저장소 메타 (2026-09-12 기준)
| 항목 | 값 |
|---|---|
| 전체 이름 | NVIDIA-NeMo/Switchyard |
| 설명 | Switchyard lets LLM applications route traffic across models and providers while preserving native OpenAI and Anthropic API compatibility - enabling flexible model selection, benchmarking, and cost/performance optimization. |
| 별점 | 2,908 |
| 포크 | 262 |
| 기본 브랜치 | main |
| 주 언어 | Python (Rust 구성 요소 병행) |
| 라이선스 | Apache-2.0 |
| 생성일 | 2026-05-19 |
| 마지막 업데이트 | 2026-09-12 |
| 오픈 이슈 | 75 |
| GitHub Pages | 있음 |
릴리즈 이력
| 태그 | 게시일 | 비고 |
|---|---|---|
| v0.2.0 | 2026-08-10 | 최신 안정 릴리스 |
| v0.1.0 | 2026-06-30 | 첫 메이저 릴리스 |
| v0.0.1 | 2026-06-30 | 초기 릴리스 |
Pre-1.0 소프트웨어로, API·구성·라우팅 동작이 릴리스 간 변경될 수 있으므로 통합 시 버전을 고정해야 한다.^[https://github.com/NVIDIA-NeMo/Switchyard]
아키텍처 개요
Switchyard는 라우팅 결정을 제공자 엔드포인트와 분리하는 설계다.^[https://developer.nvidia.com/blog/route-ai-agent-workloads-across-models-with-nvidia-nemo-switchyard/]
- switchyard-libsy — 제공자 중립 SDK. 요청을 표현하고, 사용 가능한 모델을 정의하며, 선택된 모델로의 호출을 관리한다. 각 모델 타겟은 의미론적 이름을 가지며, 클라이언트 뒤쪽이 그 이름을 제공자 엔드포인트와 모델 ID에 매핑한다.^[https://developer.nvidia.com/blog/route-ai-agent-workloads-across-models-with-nvidia-nemo-switchyard/]
- Switchyard 서버 — 참고 구현으로, 일반적인 API(OpenAI·Anthropic·Responses API)를 수용하는 LLM 게이트웨이 역할을 한다. 내부 Switchyard 요청 형식으로 변환 후 예상 응답 형식으로 반환하며, 선택된 모델·결정 근거·토큰 사용량·지연 시간·호출 결과를 기록한다.^[https://developer.nvidia.com/blog/route-ai-agent-workloads-across-models-with-nvidia-nemo-switchyard/]
- 라우팅 상태 관리 — 정책에 따라 에이전트 세션에 걸쳐 라우팅 상태를 유지할 수 있으며, 이전 턴의 도구 결과나 친화도 결정 등 정보를 이후 라우팅 결정에 활용할 수 있다.^[https://developer.nvidia.com/blog/route-ai-agent-workloads-across-models-with-nvidia-nemo-switchyard/]
통합 경로
Path 1 — NeMo Relay 플러그인
기존 NeMo Relay 배포에 routes.toml을 로드하는 네이티브 플러그인 방식.^[https://github.com/NVIDIA-NeMo/Switchyard]
Path 2 — 라이브러리 임베드
자체 게이트웨이/하네스 안에 라우팅 알고리즘을 내장. Switchyard가 모델을 선택하면 하네스가 호출을 수행하므로 전송· 재시도· 자격 증명은 그대로 유지된다.^[https://github.com/NVIDIA-NeMo/Switchyard]
- Python:
pip install nemo-switchyard - Rust:
switchyard-libsy(Cargo.toml에 추가)
Path 3 — LiteLLM 플러그인
LiteLLM의 Router 및 프록시를 위한 라우팅 플러그인으로 사용.^[https://github.com/NVIDIA-NeMo/Switchyard]
Path 4 — 독립형 프록시
게이트웨이 없이 에이전트 앞에 서버를 두는 방식.^[https://github.com/NVIDIA-NeMo/Switchyard]
cargo install --locked switchyard-server
switchyard-server --config routes.toml --port 4000Claude Code, Codex CLI 등 OpenAI/Anthropic SDK 클라이언트를 이 프록시에 연결하면, Switchyard가 턴마다 어떤 모델로 서비스할지 결정한다.^[https://github.com/NVIDIA-NeMo/Switchyard]
라우터 (라우팅 알고리즘)
튜닝 프리 라우터
LLM classifier — LLM을 판사로 사용하여 각 요청에 적합한 후보 모델을 선택하고, 세션 친화도를 유지해 이후 턴에서 반복 분류하지 않는다. 헤드리스·도메인 특화 시스템에 적합.^[https://developer.nvidia.com/blog/route-ai-agent-workloads-across-models-with-nvidia-nemo-switchyard/]
Stage router — 코딩 에이전트의 진행 단계(초기 탐색·오류 복구 → 안정 구현)를 도구 활동으로 판단해 모델 역량을 조절한다. 심각한 오류·반복 비생산적 작업·장시간 탐색은 고성능 모델로, 안정 작성·편집·테스트 통과 후는 효율 모델로 라우팅. 신호가 모호하면 LLM 판사 참조 후 기본값으로 폴백.^[https://developer.nvidia.com/blog/route-ai-agent-workloads-across-models-with-nvidia-nemo-switchyard/]
Escalation router — 대화를 저비용 모델로 시작해, LLM 판사가 턴별로 진행 상황을 감시하고 지속적 어려움을 감지하면 더 고성능 모델로 승격. 다중 턴 에이전트 워크로드에서 작은 모델이 일상 작업을 처리하되 반복 오류·루프·드리프트 발생 시 지원이 필요할 때 적합.^[https://developer.nvidia.com/blog/route-ai-agent-workloads-across-models-with-nvidia-nemo-switchyard/]
튜닝 가능 라우터
Prefill router — 학습 시 LLM의 residual stream을 추출해 쿼리 복잡도를 추정하고, 공유 MLP 트렁크가 각 후보 모델의 성공 확률을 예측. 추론 시 prefill 상태가 라우터 입력이 되고, 공유 트렁크가 각 LLM의 작업 완수 가능성을 예측. 예측 정확도와 비용·지연 시간 등을 혼합한 정책으로 점수를 매겨 최적 트레이드오프를 선택.^[https://developer.nvidia.com/blog/route-ai-agent-workloads-across-models-with-nvidia-nemo-switchyard/]
파트너 통합
에이전트 워크플로우
- Cognition — Devin Desktop에 staged-routing 방법론 구현, NVIDIA 내부 사용자 대상 실사용 테스트 진행.^[https://developer.nvidia.com/blog/route-ai-agent-workloads-across-models-with-nvidia-nemo-switchyard/]
- Nous Research — Hermes Agent 모델 라우팅 구성.^[https://developer.nvidia.com/blog/route-ai-agent-workloads-across-models-with-nvidia-nemo-switchyard/]
- Ramp — 금융 소프트웨어 엔지니어링 워크플로우.^[https://developer.nvidia.com/blog/route-ai-agent-workloads-across-models-with-nvidia-nemo-switchyard/]
- LangChain — 모델 라우팅 평가.^[https://developer.nvidia.com/blog/route-ai-agent-workloads-across-models-with-nvidia-nemo-switchyard/]
애플리케이션·인프라 통합
- LiteLLM — LLM 애플리케이션 스택 플러그인.^[https://developer.nvidia.com/blog/route-ai-agent-workloads-across-models-with-nvidia-nemo-switchyard/]
- Kong — AI 게이트웨이·거버넌스·API 트래픽 관리.^[https://developer.nvidia.com/blog/route-ai-agent-workloads-across-models-with-nvidia-nemo-switchyard/]
- Boomi — Agent Garden, 엔터프라이즈 자동화·연결성.^[https://developer.nvidia.com/blog/route-ai-agent-workloads-across-models-with-nvidia-nemo-switchyard/]
- Classmethod — Claude 모델 라우팅.^[https://developer.nvidia.com/blog/route-ai-agent-workloads-across-models-with-nvidia-nemo-switchyard/]
업계 특화 AI 에이전트
- Cadence — ChipStack AI Super Agent, 형식 검증 워크플로우.^[https://developer.nvidia.com/blog/route-ai-agent-workloads-across-models-with-nvidia-nemo-switchyard/]
- Siemens — EDA 에이전트 워크플로우.^[https://developer.nvidia.com/blog/route-ai-agent-workloads-across-models-with-nvidia-nemo-switchyard/]
벤치마크 결과
LangChain (에스컬레이션 라우터)
LangChain의 내부 deep agents 평가 스위트(정책 제약 조건 하의 고객 지원 대화, 온콜 사고 조사, 메시징·이슈 추적·이메일 간 다단계 워크플로우 자동화 등 145개 다중 턴 에이전트 태스크)로 테스트.^[https://developer.nvidia.com/blog/route-ai-agent-workloads-across-models-with-nvidia-nemo-switchyard/]
- Nemotron 3.5 Lightning ↔ Claude Opus 4.8 간 escalation router
- 5회 실행 평균 74% 비용 절감 (프론티어 전용 베이스라인 대비)
- 전체 호출의 7%만 프론티어 모델로 전송
- 측정 정확도 트레이드오프: 약 6포인트^[https://developer.nvidia.com/blog/route-ai-agent-workloads-across-models-with-nvidia-nemo-switchyard/]
Cognition / Devin Desktop (스테이지드 라우팅)
- Opus 5 ↔ Kimi K2.7 간 staged routing
- FrontierCode Main에서 50.6% 정확도, 평균 비용 $3.11
- Opus 5 정확도 대비 2.8%p 차이, 평균 비용 약 28% 절감^[https://developer.nvidia.com/blog/route-ai-agent-workloads-across-models-with-nvidia-nemo-switchyard/]
관련 페이지
- nemotron — NVIDIA Nemotron LLM 패밀리
- openrouter — 모델 라우팅/API 게이트웨이 플랫폼
- moc-ai-agents-orchestration — 에이전트 오케스트레이션 MOC
- moc-ai-coding — AI 코딩 MOC
출처
raw/articles/2026-09-12-nvidia-nemo-switchyard-github.md- NVIDIA 기술 블로그: https://developer.nvidia.com/blog/route-ai-agent-workloads-across-models-with-nvidia-nemo-switchyard/
- GitHub: https://github.com/NVIDIA-NeMo/Switchyard