출처

개요

Xybrid는 LLM, 음성 인식(ASR), 음성 합성(TTS)을 클라우드 서버가 아니라 사용자 기기에서 직접 실행하기 위한 크로스플랫폼 런타임이다. Rust로 작성된 단일 코어 런타임을 중심으로 Flutter, Unity, Kotlin, Rust, CLI용 SDK가 얇은 바인딩 형태로 제공된다. 개발팀은 같은 Rust 코어를 공유하기 때문에 플랫폼별로 모델 지원과 동작이 달라지는 문제를 줄일 수 있다고 설명한다. 주요 대상은 모바일 앱, 데스크톱 앱, 게임 엔진처럼 온디바이스 AI 기능을 앱 내부에 직접 넣고 싶은 개발 환경이다. 게시글은 Xybrid의 구조, 지원 모델, 멀티모델 파이프라인, 설치 및 사용법, 관련 링크를 정리한다.

핵심 포인트

  • Xybrid는 LLM, ASR, TTS를 사용자 기기에서 실행해 네트워크 지연, 외부 데이터 전송, API 호출 비용 문제를 줄이는 것을 목표로 한다.

  • 핵심 추론 로직은 Rust 코어에 있고, Flutter, Unity, Kotlin, Rust, CLI SDK는 이 코어를 호출하는 구조다. Swift SDK는 준비 중으로 소개된다.

  • 지원 플랫폼은 iOS, Android, macOS, Linux, Windows이며, 기능별로 음성 인식, 음성 합성, 언어 모델, 비전 모델을 다룬다. 임베딩은 아직 준비 중으로 표시되어 있다.

  • 모델 형식은 ONNX, GGUF, SafeTensors를 다루며, 등록된 모델은 xybrid models list 명령으로 확인할 수 있다.

  • 예시 모델로는 SmolLM2 360M, Kokoro 82M, Whisper Tiny, Wav2Vec2 Base, KittenTTS Nano, Gemma 3 1B, Llama 3.2 1B, Qwen 계열, LFM2.5 계열, LFM2-VL 450M 등이 언급된다.

  • 멀티모델 파이프라인(MMP)은 ASR → LLM → TTS처럼 여러 모델을 하나의 YAML 설정으로 연결하는 기능이며, 현재 실험적 기능으로 소개된다. 게시글 기준 Flutter와 Rust SDK에서 지원되고, Kotlin, Swift, Unity는 준비 중이다.

  • 개발팀은 Xybrid의 차별점으로 모바일 및 Unity 지원, ASR·TTS·LLM을 하나의 SDK에서 다루는 점, 서버 없이 프로세스 내에서 실행되는 점을 제시한다.

왜 중요한가

Xybrid는 온디바이스 AI를 앱이나 게임에 넣을 때 필요한 여러 구성요소를 하나의 런타임과 SDK 구조로 묶으려는 시도다. 기존에는 LLM, 음성 인식, 음성 합성을 각각 다른 런타임이나 클라우드 API로 연결해야 하는 경우가 많았지만, Xybrid는 이를 같은 API와 모델 실행 흐름 안에서 다루는 방향을 제안한다. 특히 모바일과 게임 엔진까지 지원 범위에 포함한다는 점은 로컬 AI 기능을 사용자 경험 안에 직접 통합하려는 개발자에게 의미가 있다. 다만 MMP와 BYM(Bring Your Own Model) 같은 일부 기능은 실험적 단계로 표시되어 있으므로 실제 도입 전에는 현재 지원 범위와 안정성을 확인해야 한다.

후속으로 볼 링크 / 키워드

링크

관련 키워드

  • On-device AI
  • Cross-platform AI runtime
  • Rust runtime
  • ASR
  • TTS
  • LLM
  • Multi-Model Inference Pipeline
  • MMP
  • ONNX
  • GGUF
  • SafeTensors
  • Flutter AI SDK
  • Unity AI SDK
  • Kokoro TTS
  • Whisper Tiny
  • llama.cpp
  • Ollama
  • ONNX Runtime

원문 보존 위치

원문 전체는 raw source: web-2026-07-08-pytorchkr-topic-11121-xybrid-on-device-llm-voice-runtimesource_url 및 HTML 원문과 함께 저장되어 있습니다.