출처
- source_url: https://discuss.pytorch.kr/t/vibevoice-60-asr-tts-microsoft-ai/9536
- author: 9bow (PyTorchKR)
- published: 2026-04-03
- raw: raw source:
web-2026-07-11-vibevoice-60-asr-tts-microsoft-ai
요약
TTS(텍스트→음성)와 ASR(음성→텍스트)은 오랫동안 완전히 분리된 시스템으로 발전해 왔고, 이 파편화는 통합 대화형 AI 시스템 구축의 걸림돌이었다. Microsoft Research가 공개한 VibeVoice는 이 두 태스크를 단일 프레임워크로 통합한 오픈소스 음성 AI 모델 패밀리다. 핵심은 7.5Hz의 초저프레임 연속 음성 토크나이저로, 연산 효율을 극대화하면서도 고품질 음향을 유지한다. 기반 LLM은 Qwen2.5이며, 이 때문에 Qwen2.5의 데이터 편향이 결과물에 일부 반영될 수 있음을 Microsoft가 명시하고 있다.
모델 구성 3종:
| 모델 | 파라미터 | 기능 | 최대 길이 | 공개 상태 |
|---|---|---|---|---|
| VibeVoice-ASR | 7B | 음성 인식·화자 분리·타임스탬프·맞춤 핫워드, 50개+ 언어 | 60분+ | 완전 오픈소스 |
| VibeVoice-TTS | 1.5B | 다화자(최대 4명) 합성, 감정 표현 일관 유지 | 90분 | 코드 제거됨(딥페이크 우려) |
| VibeVoice-Realtime | 0.5B | 스트리밍 텍스트→실시간 음성, 한국어 포함 9개 언어 | ~10분 | 완전 오픈소스 |
VibeVoice-ASR은 한 번의 추론으로 화자 분리·타임스탬프·전사를 동시에 구조화하며, vLLM 서빙으로 엔터프라이즈 배치 처리도 지원한다. VibeVoice-Realtime은 첫 음절 지연(First-Chunk Latency)이 약 300ms로 실시간 대화형 애플리케이션에 적합하다.
책임 있는 AI 관련 제약: 가장 강력한 VibeVoice-TTS(1.5B) 모델은 딥페이크·음성 피싱 악용 우려로 2025년 9월 내부 검토 후 메인 저장소에서 소스 코드가 임시 제거된 상태다 — ASR과 Realtime 모델만 완전히 공개돼 있다. MIT 라이선스로 배포되지만 악의적 사용은 금지되며, VibeVoice-ASR은 ICLR 2026 Oral 발표 논문을 기반으로 하고 macOS/Windows 음성 입력 도구 Vibing에 이미 실제 적용됐다.
관련 위키
원문 보존 위치
원문 전체는 raw source: web-2026-07-11-vibevoice-60-asr-tts-microsoft-ai에 source_url과 함께 저장되어 있다.