원문: YoMii(@Gas1688)의 X 게시물 · 게시일: 2026-08-12 08:52 KST

“发现开源TTS卷到这个地步…(오픈소스 TTS가 이 지경까지 왔다)” — 게시물은 청화대 OpenBMB의 VoxCPM2를 소개하며, tokenizer를 쓰지 않고 2B 파라미터·48kHz로 다국어 음성을 생성하는 설계가 오픈소스 TTS의 경쟁 구도를 바꿨다고 주장한다.

원문 핵심

  • 설계: VoxCPM2는 오디오를 discrete token으로 잘라 생성하지 않고 연속 잠재 공간에서 diffusion-autoregressive로 음성을 만든다. 게시물은 이를 “음색·감정·호흡 리듬을 end-to-end로 보존”하는 핵심 차별점으로 본다.
  • 주요 수치(게시물 주장): 2B 파라미터, 200만 시간 다국어 오디오 학습, 48kHz 출력, RTX 4090에서 실시간율 0.13.
  • 언어·제어: 30개 언어 + 9개 중국어 방언(표준어·광둥어·민난어), 자연어 설명만으로 참조 음성 없이 목소리를 설계, 감정·속도·말투 제어, 참조 오디오+텍스트로 호흡까지 복제하는 “궁극 클로닝”.
  • 라이선스·확산: Apache 2.0, GitHub 1만 스타 돌파·Trending 연속 1위. 링크는 OpenBMB/VoxCPM.
  • 양날의 검: 창작자 진입장벽을 낮추는 동시에 사기범에게 “더 날카로운 칼”을 쥐어준다는 우려 — “이제 소리는 맹신할 수 없다.”

기존 저장소 노트와의 교차 검증

이 볼트에는 이미 저장소 조사 노트 2026-08-13-github-openbmb-voxcpm가 있다. 게시물 주장과 저장소 README 기준 수치를 대조하면 다음과 같다.

게시물 주장저장소 노트(2026-08-13-github-openbmb-voxcpm) 기준판정
2B 파라미터, 48kHz 출력README 비교표: 2B backbone, 48kHz 출력, 6.25Hz LM token rate일치
RTX 4090 실시간율 0.13README: 표준 PyTorch RTF 약 0.30, Nano-vLLM 경유 시 약 0.13주의 필요 — 0.13은 최적화 서빙 경로 수치
30개 언어README: 30-language일치
9개 중국어 방언README에는 방언 9종 명시 확인 안 됨게시물 단독 주장
200만 시간 학습README에는 학습 데이터 규모 명시 확인 안 됨게시물 단독 주장
tokenizer 미사용AudioVAE V2 latent 공간에서 LocEnc→TSLM→RALM→LocDiT diffusion-autoregressive 파이프라인일치
Apache 2.0, 1만+ 스타Apache-2.0 확인, 인기 급상승일치

즉 게시물의 골격(2B·48kHz·tokenizer-free·30개 언어)은 저장소와 부합하지만, 실시간율 0.13은 기본 PyTorch 실행 기준이 아니라 Nano-vLLM 최적화 경로 수치를 가져온 것이고, 200만 시간 학습·방언 9종은 게시물 단독 주장으로 저장소 조사에서 검증되지 않았다.

해석: 왜 주목할 만한가

  • 음성 생성의 토큰화 단계가 사라진다. 전통 TTS가 오디오를 discrete token으로 압축하면서 잃던 정보를, latent 연속 공간에서 흐름 정합(flow matching)으로 복원하는 방향은 2026-07-11-vibevoice-microsoft-asr-tts의 저프레임 토크나이저 접근과도 다른 축이다.
  • 참조 음성 없이 “목소리 설계”가 가능해진다. 자연어로 음색을 묘사하면 그 목소리가 나오는 모드는 기존 TTS 비교 노트 2026-07-25-local-open-tts-models의 Parler-TTS류와 비슷한 방향이지만, 복제 충실도·방언·48kHz 품질까지 한 모델에 합쳐졌다는 점이 다르다.
  • 오픈소스 TTS가 유료 서비스급 품질에 접근했다는 신호. 게시물의 “전통 TTS 퇴장” 표현은 과장이지만, 로컬 GPU 1장으로 다국어 고품질 음성 합성과 복제가 가능해졌다는 방향성은 유효하다.

보안·윤리 경계

게시물이 직접 지적하듯, 음성 복제는 딥페이크·보이스피싱·허위 정보에 악용될 수 있다. 저장소 노트도 본인 음성 또는 명시적 허가를 받은 음성에만 사용하고, AI 생성 콘텐츠를 명확히 표시하라고 권고한다. VoxCPM2 자체에 사용자 검증 기능이 내장되어 있다는 근거는 확인되지 않았다.

관련 노트