개요

모델 라우팅(model routing)는 단일 모델에 모든 요청을 보내는 대신, 각 요청의 특성과 사용 가능한 모델 풀의 역량을 고려해 가장 적합한 모델로 전달하는 패턴이다.^[https://developer.nvidia.com/blog/route-ai-agent-workloads-across-models-with-nvidia-nemo-switchyard/]

NVIDIA NeMo Switchyard는 이 패턴을 오픈소스 오케스트레이션 계층으로 구현한 사례 — 에이전트 코드를 한 줄도 변경하지 않고 각 LLM 호출을 작업별 최적 모델로 라우팅하는 것을 목표로 한다.^[https://github.com/NVIDIA-NeMo/Switchyard]

왜 모델 라우팅이 필요한가

단일 모델로는 모든 작업을 최적으로 처리하기 어렵다.^[https://developer.nvidia.com/blog/route-ai-agent-workloads-across-models-with-nvidia-nemo-switchyard/]

모델 라우팅의 의사결정 신호

효과적인 라우팅 결정은 세 영역에서 나오는 신호에 의존한다.^[https://developer.nvidia.com/blog/route-ai-agent-workloads-across-models-with-nvidia-nemo-switchyard/]

  1. 모델 역량 — 어떤 모델이 해당 작업을 정확히 해결할 수 있는가
  2. 모델 비용 프로필 — 각 모델의 지연 시간·비용
  3. 인프라 — 신뢰할 수 있는 끊김 없는 핸드오프를 가능하게 하는 시스템 수준 신호

신호의 원천

신호는 무엇을, 언제, 어디서 평가할지도 중요하다. 다중 턴 에이전트 태스크에서는 요청 전체를 특정 모델에 라우팅하거나 각 단계마다 라우팅할 수 있으며, 전체 시스템이 풀을 공유하거나 하위 에이전트가 특화된 모델 풀을 사용할 수 있다.^[https://developer.nvidia.com/blog/route-ai-agent-workloads-across-models-with-nvidia-nemo-switchyard/]

Switchyard의 라우팅 구현

Switchyard는 튜닝 프리(tuning-free)와 튜닝 가능(tunable) 두 부류의 라우터를 제공한다.^[https://developer.nvidia.com/blog/route-ai-agent-workloads-across-models-with-nvidia-nemo-switchyard/]

튜닝 프리 라우터

사전 학습 데이터 없이 고정 휴리스틱으로 동작하는 라우터들.

LLM classifier — LLM을 판사로 사용하여 후보 모델을 선택하고 세션 친화도를 유지. 작업 내용이 크게 변하지 않는 한 반복 재분류하지 않음. 헤드리스·도메인 특화 시스템(코딩·수학·헬스케어 등)에 적합.^[https://developer.nvidia.com/blog/route-ai-agent-workloads-across-models-with-nvidia-nemo-switchyard/]

Stage router — 코딩 에이전트의 진행 단계별 필요 역량을 도구 활동으로 판단.^[https://developer.nvidia.com/blog/route-ai-agent-workloads-across-models-with-nvidia-nemo-switchyard/]

  • 심각한 오류, 반복 비생산적 작업, 장시간 탐색 → 고성능 모델
  • 안정 작성·편집, 테스트 통과 후 → 효율 모델
  • 신호 모호 시 LLM 판사 참조 후 기본값 폴백

Escalation router — 대화를 저비용 모델로 시작해 LLM 판사가 턴별 진행 상황을 감시, 지속적 어려움 감지 시 고성능 모델로 승격.^[https://developer.nvidia.com/blog/route-ai-agent-workloads-across-models-with-nvidia-nemo-switchyard/]

  • 다중 턴 에이전트 워크로드 대상
  • LLM classifier를 정적에서 적응형으로 확장한 접근

튜닝 가능 라우터

실제 워크로드 데이터에서 학습한 신호로 고정 휴리스틱을 대체.^[https://developer.nvidia.com/blog/route-ai-agent-workloads-across-models-with-nvidia-nemo-switchyard/]

Prefill router —^[https://developer.nvidia.com/blog/route-ai-agent-workloads-across-models-with-nvidia-nemo-switchyard/]

  • 학습 시: LLM의 residual stream을 추출해 쿼리 복잡도 추정, 공유 MLP 트렁크가 각 LLM의 성공 확률 예측
  • 추론 시: prefill 상태가 라우터 입력이 되고 공유 트렁크가 각 후보 모델의 성공 가능성 예측
  • 정책: 예측 정확도를 비용·지연 시간·기타 배포 제약과 혼합해 각 후보 모델에 점수 부여, 최적 트레이드오프 선택

Switchyard 아키텍처의 특징

주요 벤치마크 결과 (Switchyard)

LangChain — Escalation router

Cognition / Devin Desktop — Staged routing

모델 라우팅의 과제

유용하고 프로덕션 준비된 라우팅 시스템 구축은 매우 어려운 엔지니어링 과제다.^[https://developer.nvidia.com/blog/route-ai-agent-workloads-across-models-with-nvidia-nemo-switchyard/]

  • 신호 선택·시점·장소 결정의 복잡성
  • 끊김 없는 핸드오프를 위한 인프라 요구
  • 모델 배포 변화에 따른 라우팅 계약 유지
  • 다중 턴 에이전트의 단계별/요청별 라우팅 전략 설계
  • 튜닝 가능 라우터의 경우 학습 데이터 수집·레이블링 필요

관련 엔티티

관련 컨셉

관련 노트

출처