출처

요약

TTS(텍스트→음성)와 ASR(음성→텍스트)은 오랫동안 완전히 분리된 시스템으로 발전해 왔고, 이 파편화는 통합 대화형 AI 시스템 구축의 걸림돌이었다. Microsoft Research가 공개한 VibeVoice는 이 두 태스크를 단일 프레임워크로 통합한 오픈소스 음성 AI 모델 패밀리다. 핵심은 7.5Hz의 초저프레임 연속 음성 토크나이저로, 연산 효율을 극대화하면서도 고품질 음향을 유지한다. 기반 LLM은 Qwen2.5이며, 이 때문에 Qwen2.5의 데이터 편향이 결과물에 일부 반영될 수 있음을 Microsoft가 명시하고 있다.

모델 구성 3종:

모델파라미터기능최대 길이공개 상태
VibeVoice-ASR7B음성 인식·화자 분리·타임스탬프·맞춤 핫워드, 50개+ 언어60분+완전 오픈소스
VibeVoice-TTS1.5B다화자(최대 4명) 합성, 감정 표현 일관 유지90분코드 제거됨(딥페이크 우려)
VibeVoice-Realtime0.5B스트리밍 텍스트→실시간 음성, 한국어 포함 9개 언어~10분완전 오픈소스

VibeVoice-ASR은 한 번의 추론으로 화자 분리·타임스탬프·전사를 동시에 구조화하며, vLLM 서빙으로 엔터프라이즈 배치 처리도 지원한다. VibeVoice-Realtime은 첫 음절 지연(First-Chunk Latency)이 약 300ms로 실시간 대화형 애플리케이션에 적합하다.

책임 있는 AI 관련 제약: 가장 강력한 VibeVoice-TTS(1.5B) 모델은 딥페이크·음성 피싱 악용 우려로 2025년 9월 내부 검토 후 메인 저장소에서 소스 코드가 임시 제거된 상태다 — ASR과 Realtime 모델만 완전히 공개돼 있다. MIT 라이선스로 배포되지만 악의적 사용은 금지되며, VibeVoice-ASR은 ICLR 2026 Oral 발표 논문을 기반으로 하고 macOS/Windows 음성 입력 도구 Vibing에 이미 실제 적용됐다.

관련 위키

원문 보존 위치

원문 전체는 raw source: web-2026-07-11-vibevoice-60-asr-tts-microsoft-aisource_url과 함께 저장되어 있다.