개요
NVIDIA NeMo Switchyard는 LLM 애플리케이션이 여러 모델과 제공자 사이에서 트래픽을 라우팅할 수 있게 하는 오픈소스 오케스트레이션 계층이다.^[https://github.com/NVIDIA-NeMo/Switchyard] 각 LLM 호출을 해당 작업을 수행할 수 있는 가장 저렴한 모델로라우팅하면서도, 네이티브 OpenAI 및 Anthropic API 호환성을 유지한다.^[https://github.com/NVIDIA-NeMo/Switchyard]
NVIDIA NeMo 생태계 내에서 Switchyard는 “모델 라우팅, API 번역 및 관측 가능성(OpenAI / Anthropic)“을 담당하는 구성 요소로 분류된다.^[https://github.com/nvidia-nemo]
저장소 메타
| 항목 | 값 |
|---|---|
| 전체 이름 | NVIDIA-NeMo/Switchyard |
| GitHub | https://github.com/NVIDIA-NeMo/Switchyard |
| 별점 | 2,908 |
| 포크 | 262 |
| 기본 브랜치 | main |
| 주 언어 | Python (Rust 구성 요소 병행) |
| 라이선스 | Apache-2.0 |
| 생성일 | 2026-05-19 |
| 최신 릴리스 | v0.2.0 (2026-08-10) |
| 오픈 이슈 | 75 |
| 상태 | 활성 (2026-09-12 기준 최근 커밋 있음) |
핵심 기능
- 모델 라우팅 — 각 요청을 평가해 작업에 가장 적합한 모델로 전달^[https://developer.nvidia.com/blog/route-ai-agent-workloads-across-models-with-nvidia-nemo-switchyard/]
- API 번역 — OpenAI·Anthropic·Responses API 요청을 내부 형식으로 변환, 예상 응답 형식으로 반환^[https://developer.nvidia.com/blog/route-ai-agent-workloads-across-models-with-nvidia-nemo-switchyard/]
- 관측 가능성(Observability) — 선택된 모델, 결정 근거, 토큰 사용량, 지연 시간, 호출 결과 기록^[https://developer.nvidia.com/blog/route-ai-agent-workloads-across-models-with-nvidia-nemo-switchyard/]
- 세팅 유지(stateful routing) — 정책에 따라 세션 간 라우팅 상태 유지, 이전 턴 정보(도구 결과·친화도 결정)를 이후 결정에 활용^[https://developer.nvidia.com/blog/route-ai-agent-workloads-across-models-with-nvidia-nemo-switchyard/]
구성 요소
switchyard-libsy
제공자 중립 SDK. 요청을 표현하고 사용 가능한 모델을 정의하며 선택된 모델로의 호출을 관리. 모델 타겟은 의미론적 이름을 가지며, 클라이언트 뒤쪽이 제공자 엔드포인트와 모델 ID에 매핑.^[https://developer.nvidia.com/blog/route-ai-agent-workloads-across-models-with-nvidia-nemo-switchyard/]
- 안정성: Beta
- 용도: 자체 게이트웨이/하네스 내 임베드 라우팅
- Python 패키지:
nemo-switchyard(pip) - Rust 크레이트:
switchyard-libsy
Switchyard 서버
OpenAI·Anthropic·Responses API를 수용하는 참고 구현 LLM 게이트웨이.^[https://github.com/NVIDIA-NeMo/Switchyard]
- 안정성: Beta
- 설치:
cargo install --locked switchyard-server - 실행:
switchyard-server --config routes.toml --port 4000
통합 경로
| 경로 | 방식 | 대상 |
|---|---|---|
| NeMo Relay 플러그인 | 네이티브 플러그인, routes.toml 로드 | 기존 Relay 배포 |
| LiteLLM 플러그인 | LiteLLM Router/프록시용 라우팅 플러그인 | LiteLLM 사용자 |
| 라이브러리 임베드 | pip install nemo-switchyard / Rust switchyard-libsy | 자체 게이트웨이/하네스 |
| 독립형 프록시 | switchyard-server | Claude Code, Codex CLI 등 클라이언트 |
라우터
튜닝 프리 (tuning-free)
- LLM classifier — LLM을 판사로 사용해 후보 모델 선택, 세션 친화도 유지
- Stage router — 도구 활동 분석으로 에이전트의 현재 필요 역량 판단, 고성능/효율 모델 간 전환
- Escalation router — 저비용 모델로 시작, 어려움 감지 시 고성능 모델로 격상
튜닝 가능 (tunable)
- Prefill router — 학습 시 LLM의 residual stream으로 쿼리 복잡도 추정, 공유 MLP 트렁크로 각 모델 성공 확률 예측
NeMo 조직 내 위치
NVIDIA NeMo는 여러 저장소로 구성된 프레임워크다.^[https://github.com/nvidia-nemo] Switchyard는 이 중 모델 라우팅 계층으로, 훈련 루프·훈련 백엔드·추론 백엔드 없이 “Agnostic (OpenAI-compatible)” 모델 커버리지와 컨테이너 없이 제공된다.^[https://github.com/nvidia-nemo]
| 저장소 | 기능 | Switchyard 역할 |
|---|---|---|
| Switchyard | 모델 라우팅, API 번역·관측 가능성 | 라우팅 계층 |
파트너 생태계
에이전트 워크플로우: Cognition (Devin Desktop), Nous Research (Hermes Agent), Ramp, LangChain
애플리케이션·인프라: LiteLLM, Kong, Boomi Agent Garden, Classmethod
업계 특화: Cadence (ChipStack AI Super Agent), Siemens (EDA 에이전트)^[https://developer.nvidia.com/blog/route-ai-agent-workloads-across-models-with-nvidia-nemo-switchyard/]
관련 엔티티
- nemotron — NVIDIA Nemotron LLM 패밀리
- nvidia-nim — NVIDIA 추론 API 플랫폼
- openrouter — 모델 라우팅/API 게이트웨이 플랫폼
관련 컨셉
- moc-ai-agents-orchestration — 에이전트 오케스트레이션 MOC
- moc-ai-models — AI 모델 MOC
출처
raw/articles/2026-09-12-nvidia-nemo-switchyard-github.md- GitHub: https://github.com/NVIDIA-NeMo/Switchyard
- NVIDIA 블로그: https://developer.nvidia.com/blog/route-ai-agent-workloads-across-models-with-nvidia-nemo-switchyard/