개요

NVIDIA NeMo Switchyard는 LLM 애플리케이션이 여러 모델과 제공자 사이에서 트래픽을 라우팅할 수 있게 하는 오픈소스 오케스트레이션 계층이다.^[https://github.com/NVIDIA-NeMo/Switchyard] 각 LLM 호출을 해당 작업을 수행할 수 있는 가장 저렴한 모델로라우팅하면서도, 네이티브 OpenAI 및 Anthropic API 호환성을 유지한다.^[https://github.com/NVIDIA-NeMo/Switchyard]

NVIDIA NeMo 생태계 내에서 Switchyard는 “모델 라우팅, API 번역 및 관측 가능성(OpenAI / Anthropic)“을 담당하는 구성 요소로 분류된다.^[https://github.com/nvidia-nemo]

저장소 메타

항목
전체 이름NVIDIA-NeMo/Switchyard
GitHubhttps://github.com/NVIDIA-NeMo/Switchyard
별점2,908
포크262
기본 브랜치main
주 언어Python (Rust 구성 요소 병행)
라이선스Apache-2.0
생성일2026-05-19
최신 릴리스v0.2.0 (2026-08-10)
오픈 이슈75
상태활성 (2026-09-12 기준 최근 커밋 있음)

핵심 기능

구성 요소

switchyard-libsy

제공자 중립 SDK. 요청을 표현하고 사용 가능한 모델을 정의하며 선택된 모델로의 호출을 관리. 모델 타겟은 의미론적 이름을 가지며, 클라이언트 뒤쪽이 제공자 엔드포인트와 모델 ID에 매핑.^[https://developer.nvidia.com/blog/route-ai-agent-workloads-across-models-with-nvidia-nemo-switchyard/]

  • 안정성: Beta
  • 용도: 자체 게이트웨이/하네스 내 임베드 라우팅
  • Python 패키지: nemo-switchyard (pip)
  • Rust 크레이트: switchyard-libsy

Switchyard 서버

OpenAI·Anthropic·Responses API를 수용하는 참고 구현 LLM 게이트웨이.^[https://github.com/NVIDIA-NeMo/Switchyard]

  • 안정성: Beta
  • 설치: cargo install --locked switchyard-server
  • 실행: switchyard-server --config routes.toml --port 4000

통합 경로

경로방식대상
NeMo Relay 플러그인네이티브 플러그인, routes.toml 로드기존 Relay 배포
LiteLLM 플러그인LiteLLM Router/프록시용 라우팅 플러그인LiteLLM 사용자
라이브러리 임베드pip install nemo-switchyard / Rust switchyard-libsy자체 게이트웨이/하네스
독립형 프록시switchyard-serverClaude Code, Codex CLI 등 클라이언트

라우터

튜닝 프리 (tuning-free)

  • LLM classifier — LLM을 판사로 사용해 후보 모델 선택, 세션 친화도 유지
  • Stage router — 도구 활동 분석으로 에이전트의 현재 필요 역량 판단, 고성능/효율 모델 간 전환
  • Escalation router — 저비용 모델로 시작, 어려움 감지 시 고성능 모델로 격상

튜닝 가능 (tunable)

  • Prefill router — 학습 시 LLM의 residual stream으로 쿼리 복잡도 추정, 공유 MLP 트렁크로 각 모델 성공 확률 예측

NeMo 조직 내 위치

NVIDIA NeMo는 여러 저장소로 구성된 프레임워크다.^[https://github.com/nvidia-nemo] Switchyard는 이 중 모델 라우팅 계층으로, 훈련 루프·훈련 백엔드·추론 백엔드 없이 “Agnostic (OpenAI-compatible)” 모델 커버리지와 컨테이너 없이 제공된다.^[https://github.com/nvidia-nemo]

저장소기능Switchyard 역할
Switchyard모델 라우팅, API 번역·관측 가능성라우팅 계층

파트너 생태계

에이전트 워크플로우: Cognition (Devin Desktop), Nous Research (Hermes Agent), Ramp, LangChain
애플리케이션·인프라: LiteLLM, Kong, Boomi Agent Garden, Classmethod
업계 특화: Cadence (ChipStack AI Super Agent), Siemens (EDA 에이전트)^[https://developer.nvidia.com/blog/route-ai-agent-workloads-across-models-with-nvidia-nemo-switchyard/]

관련 엔티티

  • nemotron — NVIDIA Nemotron LLM 패밀리
  • nvidia-nim — NVIDIA 추론 API 플랫폼
  • openrouter — 모델 라우팅/API 게이트웨이 플랫폼

관련 컨셉

출처