개요

NVIDIA NeMo Switchyard는 LLM 애플리케이션이 여러 모델과 제공자 사이에서 트래픽을 라우팅할 수 있게 하는 오픈소스 오케스트레이션 계층이다. 네이티브 OpenAI 및 Anthropic API 호환성을 유지하면서, 작업별로 최적의 모델을 선택해 비용·성능·정확도를 균형 있게 조정할 수 있다.^[https://github.com/NVIDIA-NeMo/Switchyard]

핵심 가치는 “각 LLM 호출을 해당 작업을 수행할 수 있는 가장 저렴한 모델로 라우팅”하는 것 — 에이전트 코드를 한 줄도 변경하지 않고 적용 가능하다.^[https://github.com/NVIDIA-NeMo/Switchyard]

저장소 메타 (2026-09-12 기준)

항목
전체 이름NVIDIA-NeMo/Switchyard
설명Switchyard lets LLM applications route traffic across models and providers while preserving native OpenAI and Anthropic API compatibility - enabling flexible model selection, benchmarking, and cost/performance optimization.
별점2,908
포크262
기본 브랜치main
주 언어Python (Rust 구성 요소 병행)
라이선스Apache-2.0
생성일2026-05-19
마지막 업데이트2026-09-12
오픈 이슈75
GitHub Pages있음

릴리즈 이력

태그게시일비고
v0.2.02026-08-10최신 안정 릴리스
v0.1.02026-06-30첫 메이저 릴리스
v0.0.12026-06-30초기 릴리스

Pre-1.0 소프트웨어로, API·구성·라우팅 동작이 릴리스 간 변경될 수 있으므로 통합 시 버전을 고정해야 한다.^[https://github.com/NVIDIA-NeMo/Switchyard]

아키텍처 개요

Switchyard는 라우팅 결정을 제공자 엔드포인트와 분리하는 설계다.^[https://developer.nvidia.com/blog/route-ai-agent-workloads-across-models-with-nvidia-nemo-switchyard/]

통합 경로

Path 1 — NeMo Relay 플러그인

기존 NeMo Relay 배포에 routes.toml을 로드하는 네이티브 플러그인 방식.^[https://github.com/NVIDIA-NeMo/Switchyard]

Path 2 — 라이브러리 임베드

자체 게이트웨이/하네스 안에 라우팅 알고리즘을 내장. Switchyard가 모델을 선택하면 하네스가 호출을 수행하므로 전송· 재시도· 자격 증명은 그대로 유지된다.^[https://github.com/NVIDIA-NeMo/Switchyard]

  • Python: pip install nemo-switchyard
  • Rust: switchyard-libsy (Cargo.toml에 추가)

Path 3 — LiteLLM 플러그인

LiteLLM의 Router 및 프록시를 위한 라우팅 플러그인으로 사용.^[https://github.com/NVIDIA-NeMo/Switchyard]

Path 4 — 독립형 프록시

게이트웨이 없이 에이전트 앞에 서버를 두는 방식.^[https://github.com/NVIDIA-NeMo/Switchyard]

cargo install --locked switchyard-server
switchyard-server --config routes.toml --port 4000

Claude Code, Codex CLI 등 OpenAI/Anthropic SDK 클라이언트를 이 프록시에 연결하면, Switchyard가 턴마다 어떤 모델로 서비스할지 결정한다.^[https://github.com/NVIDIA-NeMo/Switchyard]

라우터 (라우팅 알고리즘)

튜닝 프리 라우터

LLM classifier — LLM을 판사로 사용하여 각 요청에 적합한 후보 모델을 선택하고, 세션 친화도를 유지해 이후 턴에서 반복 분류하지 않는다. 헤드리스·도메인 특화 시스템에 적합.^[https://developer.nvidia.com/blog/route-ai-agent-workloads-across-models-with-nvidia-nemo-switchyard/]

Stage router — 코딩 에이전트의 진행 단계(초기 탐색·오류 복구 → 안정 구현)를 도구 활동으로 판단해 모델 역량을 조절한다. 심각한 오류·반복 비생산적 작업·장시간 탐색은 고성능 모델로, 안정 작성·편집·테스트 통과 후는 효율 모델로 라우팅. 신호가 모호하면 LLM 판사 참조 후 기본값으로 폴백.^[https://developer.nvidia.com/blog/route-ai-agent-workloads-across-models-with-nvidia-nemo-switchyard/]

Escalation router — 대화를 저비용 모델로 시작해, LLM 판사가 턴별로 진행 상황을 감시하고 지속적 어려움을 감지하면 더 고성능 모델로 승격. 다중 턴 에이전트 워크로드에서 작은 모델이 일상 작업을 처리하되 반복 오류·루프·드리프트 발생 시 지원이 필요할 때 적합.^[https://developer.nvidia.com/blog/route-ai-agent-workloads-across-models-with-nvidia-nemo-switchyard/]

튜닝 가능 라우터

Prefill router — 학습 시 LLM의 residual stream을 추출해 쿼리 복잡도를 추정하고, 공유 MLP 트렁크가 각 후보 모델의 성공 확률을 예측. 추론 시 prefill 상태가 라우터 입력이 되고, 공유 트렁크가 각 LLM의 작업 완수 가능성을 예측. 예측 정확도와 비용·지연 시간 등을 혼합한 정책으로 점수를 매겨 최적 트레이드오프를 선택.^[https://developer.nvidia.com/blog/route-ai-agent-workloads-across-models-with-nvidia-nemo-switchyard/]

파트너 통합

에이전트 워크플로우

애플리케이션·인프라 통합

업계 특화 AI 에이전트

벤치마크 결과

LangChain (에스컬레이션 라우터)

LangChain의 내부 deep agents 평가 스위트(정책 제약 조건 하의 고객 지원 대화, 온콜 사고 조사, 메시징·이슈 추적·이메일 간 다단계 워크플로우 자동화 등 145개 다중 턴 에이전트 태스크)로 테스트.^[https://developer.nvidia.com/blog/route-ai-agent-workloads-across-models-with-nvidia-nemo-switchyard/]

Cognition / Devin Desktop (스테이지드 라우팅)

관련 페이지

출처