음성 인식(STT), 음성 합성(TTS), 음성 입력 앱, Apple Speech API 관련 노트 모음
화면 녹화·영상 편집
| 노트 | 설명 |
|---|---|
| [[summaries/2026-09-04-github-kajisho5-ffmpeg-skill | 2026-09-04-github-kajisho5-ffmpeg-skill]] |
| 2026-08-05-sechak-ag-capptivo | 멀티플랫폼 Tauri 화면 녹화·편집 앱 — ScreenCaptureKit/Windows.Graphics.Capture/PipeWire, 자막·줌·export |
| 2026-08-09-github-microsoft-zoomitformac | macOS 메뉴 막대형 ZoomIt — 화면 확대·주석·OCR·MP4 녹화·웹캠 PIP·스크롤 파노라마 |
음성 입력 앱 (macOS)
| 노트 | 설명 |
|---|---|
| 2026-04-04-whispree-korean-stt-llm-voice-input | 한국어 개발자용 STT + LLM 교정 음성 입력 (Groq/Codex) |
| 2026-04-04-vvrite-on-device-voice-typing | Qwen3-ASR 온디바이스 음성 타이핑 (한국어 우수) |
| 2026-04-04-freeflow-voice-dictation | Groq 기반 무료 음성 받아쓰기 (컨텍스트 인식) |
| 2026-08-08-wispr-flow-vs-handy-korean-stt | Wispr Flow와 Handy/Qwen3-ASR 1.7B의 한국어·로컬 처리·비용·성능 근거 비교 |
Apple Speech API
| 노트 | 설명 |
|---|---|
| 2026-04-04-apple-speech-api-whisper-alternative | SpeechAnalyzer/SpeechTranscriber — Whisper 대비 2.2배 빠른 전사 |
음성 인식 모델
| 노트 | 설명 |
|---|---|
| [[summaries/2026-05-27-whisper-diarization | 2026-05-27-whisper-diarization]] |
| 2026-04-04-apfel-mac-builtin-ai | Mac 내장 Apple 온디바이스 LLM 활용 도구 (FoundationModels.framework) |
음성 합성 모델
| 노트 | 설명 |
|---|---|
| 2026-08-08-github-kyutai-labs-pocket-tts | Kyutai의 100M 파라미터 CPU 중심 TTS — 24kHz streaming, voice state 재사용·cloning, Python API/CLI/FastAPI |
| 2026-08-13-github-openbmb-voxcpm | OpenBMB VoxCPM2 — tokenizer-free 30개 언어·48kHz TTS, voice design·cloning·streaming·LoRA |
| [[summaries/2026-08-15-x-gas1688-voxcpm2 | 2026-08-15-x-gas1688-voxcpm2]] |
외부 큐레이션·커뮤니티
| 노트 | 설명 |
|---|---|
| [[summaries/2026-08-05-hada-32125-krafton-ax-k2-raon-speech | 2026-08-05-hada-32125-krafton-ax-k2-raon-speech]] |
비디오·미디어 다운로드
| 노트 | 설명 |
|---|---|
| 2026-04-05-open-source-video-download-extensions | VDH 대안 — Media Downloader Unleashed, Turbo DM, VidBee 등 |
| 2026-05-07-react-video-ascii | WebGL2로 비디오를 ASCII 문자로 렌더링하는 React 컴포넌트 |
| 2026-08-08-github-oso95-scroll-world | 프레임 고정형 dive/connector 영상과 vanilla-JS scroll scrub engine을 묶은 3D landing page 스킬 |
오디오-비주얼 생성
| 노트 | 설명 |
|---|---|
| 2026-08-15-github-starknightt-night-street | Three.js + R3F로 빌드한 Golden Hour 도시 거리 — 모든 텍스처·메시·조명·사운드가 코드로 생성된 프로시저럴 3D 렌더링. Web Audio 합성 DSP 포함. |
| [[summaries/2026-07-12-pytorchkr-topic-11207-joyai-echo-long-audio-visual-generation | 2026-07-12-pytorchkr-topic-11207-joyai-echo-long-audio-visual-generation]] |
| 2026-08-15-x-owenyuwono-poseidon | Three.js WebGPU/TSL로 GPU에서 FFT·파도 스펙트럼·거품을 계산하는 실시간 해양 시뮬레이션 — X 티저와 저장소 심층 정리 |
음성 입력 앱 비교
| 앱 | 모델 | 한국어 | 네트워크 | 후처리 | 비고 |
|---|---|---|---|---|---|
| Whispree | Groq/Codex + LLM | 우수 (교정) | 필요 | LLM 교정 | Structured Mode, Visual Context |
| vvrite | Qwen3-ASR | 우수 | 불필요 | 없음 | 온디바이스 전용 |
| FreeFlow | Groq + LLM | 보통 | 필요 | LLM 후처리 | 컨텍스트 인식 |
| Wispr Flow | cloud ensemble | 지원 | 필요 | filler/formatting/context | 100+ 언어, 비영어 정확도 한계 명시 |
| Handy | Qwen3-ASR 1.7B 등 선택 | 지원 | 불필요(core) | optional post-processing | MIT, 로컬·오프라인; Qwen 1.7B catalog 확인 |
| Apple Speech API | SpeechAnalyzer | 미확인 | 불필요 | 없음 | 34분 영상 45초 처리 |
2026-07-18 신규 유입 (고아 정리)
| 노트 | 설명 |
|---|---|
| 2026-07-25-local-open-tts-models | Qwen-Audio-3.0-TTS 대신 로컬에서 돌릴 수 있는 오픈소스 TTS(Kokoro·GPT-SoVITS·XTTS-v2 등) 비교. |
| 2026-04-19-local-korean-xtts-engine | 한국어 숏츠 내레이션을 위한 로컬 one-take XTTS-v2 엔진. |
| 2026-07-10-snapotter | SnapOtter는 이미지, 영상, 오디오, PDF, 일반 파일 작업을 자체 서버에서 처리하는 셀프호스팅 도구 모음이다. |
| 2026-07-07-openvoice-instant-voice-cloning | 짧은 참조 오디오만으로 화자 음색을 복제하고 감정·억양·언어를 별도 제어하는 feed-forward 구조의 오픈소스 Zero-shot TTS, MyShell.ai가 실서비스에 적용. |
| 2026-07-11-vibevoice-microsoft-asr-tts | Qwen2.5 기반의 7.5Hz 초저프레임 음성 토크나이저로 60분 ASR, 90분 다화자 TTS, 300ms 초저지연 스트리밍 TTS를 통합 제공하는 Microsoft 오픈소스 모델군. |