개요
Voicebox는 짧은 참조 오디오로 목소리를 복제하고, 로컬 TTS·STT·받아쓰기·에이전트 음성 출력을 한데 묶은 오픈소스 AI 음성 스튜디오다. README는 이를 ElevenLabs(음성 출력)와 WisprFlow(음성 입력)를 함께 대체하려는 local-first voice I/O stack으로 설명한다.
핵심은 단순 TTS 앱이 아니라, 다음 양방향 루프를 하나의 데스크톱 앱에서 제공하는 데 있다.
- 입력: Whisper 기반 음성 전사, 전역 단축키 받아쓰기, 인앱 마이크, macOS 접근성 기반 자동 붙여넣기
- 변환: 선택적 로컬 Qwen3 LLM을 이용한 filler·말더듬 정리와 음성 프로필별 personality 재작성
- 출력: 음성 복제·프리셋 보이스·7개 TTS 엔진·오디오 이펙트·긴 텍스트 자동 분할
- 에이전트 연결: MCP의
voicebox.speak또는 RESTPOST /speak로 Claude Code·Cursor·Windsurf·VS Code 등에서 음성 응답
2026-08-04 기준 실측 메타데이터
GitHub REST API와 저장소 README를 2026-08-04 11:08 KST에 확인했다.
| 항목 | 값 |
|---|---|
| 저장소 | jamiepine/voicebox |
| 설명 | The open-source AI voice studio. Clone, dictate, create. |
| Stars | 48,722 |
| Forks | 5,994 |
| Open issues | 576 |
| 주 언어 | TypeScript |
| 라이선스 | MIT |
| 기본 브랜치 | main |
| 생성일 | 2026-01-25 |
| 최근 push | 2026-07-28 |
| 최신 릴리스 | v0.5.0 (2026-04-25 공개) |
| 홈페이지 | voicebox.sh |
Stars·forks·issues는 캡처 시점의 GitHub 수치이며 프로젝트 품질이나 실제 사용량을 직접 증명하는 지표는 아니다.
기능 구성
멀티 엔진 TTS와 보이스 클로닝
README 기준 7개 엔진을 생성마다 선택할 수 있다.
| 엔진 | 언어 수 | 특징 |
|---|---|---|
| Qwen3-TTS (0.6B / 1.7B) | 10 | 다국어 음성 복제와 자연어 전달 지시 |
| Qwen CustomVoice | 10 | 참조 음성 없이 9개 프리셋 보이스와 전달 제어 |
| LuxTTS | 영어 | 약 1GB VRAM, 48kHz, 가벼운 추론 |
| Chatterbox Multilingual | 23 | 가장 넓은 언어 커버리지 |
| Chatterbox Turbo | 영어 | 350M급 고속 모델과 [laugh], [sigh] 같은 표현 태그 |
| HumeAI TADA (1B / 3B) | 10 | 긴 오디오와 텍스트-음향 정렬을 겨냥한 모델 |
| Kokoro | 8 | 82M급 경량 모델과 50개 프리셋 보이스 |
공통 기능으로 음성 프로필·다중 참조 샘플·기본 이펙트 체인을 관리하고, 생성 결과를 원본·이펙트 버전·재생성 take로 나누어 계보를 보존한다. 텍스트는 문장 경계에서 자동 분할한 뒤 크로스페이드하며 최대 50,000자까지 처리한다고 설명한다.
오디오 편집과 Stories
Spotify pedalboard 기반 이펙트 8종(Pitch Shift, Reverb, Delay, Chorus/Flanger, Compressor, Gain, High-Pass, Low-Pass)을 실시간 미리보기와 프리셋으로 제공한다. Stories 에디터는 여러 음성 트랙을 타임라인에 배치하고, 클립을 자르고 나누며 대화·팟캐스트·내러티브를 구성하는 용도다.
음성 입력과 Captures
전역 hotkey의 push-to-talk/toggle 방식으로 받아쓰기하고, macOS에서는 현재 포커스된 텍스트 필드에 접근성 검증 후 붙여넣는다. 모든 받아쓰기·인앱 녹음·업로드 오디오는 Captures에 원본 오디오와 전사를 함께 보존한다. Whisper 계열 모델(Base/Small/Medium/Large/Turbo)로 재전사하거나 로컬 LLM으로 정리할 수 있다.
MCP·REST 에이전트 음성 출력
Voicebox는 앱 내부에 Streamable HTTP MCP 서버를 /mcp로 마운트한다. MCP 문서에 기록된 네 가지 도구는 다음과 같다.
voicebox.speak: 프로필의 목소리로 말하기voicebox.transcribe: 오디오를 Whisper로 전사voicebox.list_captures: 최근 캡처 조회voicebox.list_profiles: 음성 프로필 조회
Claude Code 예시는 다음과 같다.
claude mcp add voicebox \
--transport http \
--url http://127.0.0.1:17493/mcp \
--header "X-Voicebox-Client-Id: claude-code"MCP를 지원하지 않는 클라이언트는 POST /speak REST API를 사용할 수 있고, HTTP를 지원하지 않는 클라이언트에는 앱에 포함된 voicebox-mcp stdio shim을 사용할 수 있다. 프로필 해석 순서는 명시적 profile 인자 → X-Voicebox-Client-Id별 바인딩 → 전역 기본 프로필이다.
에이전트가 말하는 동안에는 프로필 이름과 시간을 표시하는 floating speaking pill을 띄운다. 공식 MCP 문서는 무음 백그라운드 TTS를 신뢰 경계의 위험으로 보고, 어떤 음성이 재생되는지 항상 화면에 표시하는 설계를 설명한다.
플랫폼과 실행 백엔드
- macOS Apple Silicon: MLX/Metal
- macOS Intel: DMG 제공
- Windows NVIDIA: PyTorch/CUDA
- Linux NVIDIA: PyTorch/CUDA, 소스 빌드·로컬/원격 Python 백엔드
- Linux AMD: PyTorch/ROCm
- Windows 범용 GPU: DirectML
- Intel Arc: IPEX/XPU
- 공통 fallback: CPU
데스크톱 셸은 Tauri/Rust이며 프론트엔드는 React·TypeScript·Tailwind CSS, 백엔드는 FastAPI/Python, 상태 관리는 Zustand·React Query, 저장소는 SQLite다. Electron 기반이 아니라는 점이 네이티브 배포와 로컬 성능의 핵심 차별점으로 제시된다.
인기 요인과 성장 신호
- 입력과 출력을 한 제품으로 묶음 — ElevenLabs와 WisprFlow가 나누어 가진 음성 I/O를 cloning·TTS·STT·dictation·agent output으로 연결해 사용 사례가 넓다.
- 로컬 우선 프라이버시와 크로스플랫폼 — 모델·음성 데이터·캡처가 기본적으로 기기에 남고, Apple Silicon MLX부터 CUDA·ROCm·DirectML까지 지원한다.
- 에이전트 통합의 구체성 — MCP 도구·REST API·stdio shim·클라이언트별 음성 바인딩을 함께 제공해 “에이전트가 말한다”를 한 번의 설정으로 만들었다.
- 제품 범위가 넓음 — 단일 TTS 데모를 넘어 Stories 편집기, generation provenance, 효과 프리셋, Captures, personality LLM까지 포함한다.
- 빠른 오픈소스 확산 — 위키에 남아 있는 이전 GitHub Trending 캡처는 2026-04-17 18,963 stars, 2026-04-28 23,426 stars를 기록했고, 같은 기준으로 2026-08-04 API 수치는 48,722 stars다. 이는 가파른 관심 증가의 신호지만 GitHub의 연속 시계열을 재구성한 수치는 아니다.
균형 시각과 위험
- MCP 보안 경계: 공식 MCP 문서에 따르면 기본 서버는
127.0.0.1에 바인딩되고 인증이 없다. 같은 컴퓨터에서 loopback에 접근할 수 있는 프로세스는 MCP를 호출할 수 있으므로, 원격 모드에서는 신뢰 네트워크와 HTTPS를 사용해야 한다. - 음성 복제의 동의 문제:
RESPONSIBLE_USE.md는 도구가 음성 샘플의 소유권을 검증할 수 없다고 명시한다. 본인 음성 또는 명시적 허가를 받은 음성만 사용해야 하며 사칭·사기·음성 인증 우회·비동의 성적 콘텐츠 등을 금지한다. - 품질 재현성: GitHub issue #515에는 Qwen3-TTS 복제 품질 저하와 0.5.0에서 다른 목소리가 생성된다는 사용자 보고가 있다. 이는 커뮤니티 보고이며 이 페이지에서 독립 재현한 결과가 아니다.
- 리소스와 배포 제약: 7개 엔진·Whisper·로컬 LLM을 모두 활용하려면 모델 다운로드와 GPU/메모리 관리가 필요하다. Linux는 README 기준 사전 빌드 바이너리가 아직 없고 소스 빌드가 필요하다.
- 오픈 이슈 규모: 캡처 시점 576개 open issues는 활발한 사용과 빠른 개발의 신호일 수 있지만, 동시에 호환성·품질·운영 이슈를 선별해야 한다는 뜻이기도 하다.
- 프라이버시의 범위: 로컬 처리는 데이터 전송 위험을 줄이지만 동의·저작권·AI 생성 음성 고지 의무를 자동으로 해결하지 않는다. 원격 서버 모드로 전환하면 네트워크 보안과 인증을 별도로 설계해야 한다.
정석님 관점의 활용성
Voicebox는 ChatOps 트레이딩 시스템에서 KST 08:00 시장 브리핑을 음성으로 읽거나, 장시간 실행 에이전트의 완료·질문·알림을 고정된 음성 프로필로 전달하는 로컬 voice output layer 후보가 된다. 핵심 연결점은 TTS API 자체보다 voicebox.speak의 MCP 호출과 클라이언트별 프로필 바인딩이다.
권장 실험 순서는 다음과 같다.
- macOS에 Voicebox를 설치하고 본인 음성 또는 허가받은 샘플로 프로필을 만든다.
- Claude Code/로컬 에이전트에 MCP HTTP 연결을 추가한다.
- 짧은
voicebox.speak호출로 프로필 해석과 speaking pill을 확인한다. - 브리핑 생성 에이전트에서는 텍스트 생성·검증과 음성 합성을 분리하고, 실패 시 텍스트 알림으로 fallback한다.
- 원격 접근을 켜지 않는 한 localhost-only를 유지하고, 음성 샘플의 동의 기록과 보존 정책을 별도로 관리한다.
관련 위키
- moc-ai-agents — 에이전트 도구·하네스·인프라를 묶는 상위 MOC
- moc-ai-models — TTS·STT·로컬 추론 모델을 연결할 수 있는 모델 MOC
- 2026-07-07-openvoice-instant-voice-cloning — 음색과 스타일을 분리한 Zero-shot 음성 복제 프레임워크
- 2026-07-11-vibevoice-microsoft-asr-tts — Microsoft의 온디바이스 ASR/TTS 계열 프로젝트
검증과 원문
- 공식 저장소: github.com/jamiepine/voicebox
- 홈페이지: voicebox.sh
- 최신 릴리스: v0.5.0
- 원문 캡처:
raw/articles/github-jamiepine-voicebox.md - README 캡처 브랜치:
main(저장소 API의default_branch로 확인) - raw body SHA-256:
e6f40a0f5e9261a55c311f8ccbc5ef917a03a51392985236b0d902ab2f20aa19 - 해시 검증: 파일 작성 후 closing frontmatter delimiter 뒤의 저장된 body를 다시 읽어 위 SHA-256과 일치함을 확인
- 저장소의 README·MCP 문서·
RESPONSIBLE_USE.md·SECURITY.md는 공식 저장소 자료로 분리해 해석했으며, GitHub issue 515의 품질 내용은 커뮤니티 보고로 표시했다.