출처
- source_url: https://aisparkup.com/posts/15004
- author: Spark
- published: Wed, 05 Aug 2026 02:45:51 +0000
- raw: raw source:
2026-08-05-aisparkup-post-15004-minimax-h3-2k
MiniMax H3 오픈웨이트 공개, 2K 영상과 스테레오 사운드 생성
개요
MiniMax가 Hailuo 계열의 3세대 영상 모델 H3 가중치를 공개했으며, ComfyUI는 공개 당일 네이티브 지원을 추가했다. H3는 텍스트·이미지·영상·오디오를 입력으로 받아 최대 2K 해상도와 15초 길이의 영상, 네이티브 스테레오 사운드를 함께 생성한다. 대사·효과음·주변 소리를 영상과 같은 생성 과정에서 만들고 동작에 맞춰 정렬하는 점이 기존 영상 생성·후처리 흐름과 다르다. ComfyUI는 modulation weight 제거, 양자화, VRAM 최적화 커널과 동적 오프로딩을 통해 모델 용량을 123.6GB에서 42.5GB로 줄였다고 설명했다. 다만 RTX 3060 실행 가능 여부와 메모리 절감 수치는 ComfyUI 자체 측정이며, 독립적인 검증 결과는 아직 제시되지 않았다.
핵심 포인트
- 통합 오디오·영상 생성: 영상과 함께 대사, 효과음, 주변 소리를 생성하며 모든 출력은 네이티브 스테레오로 제공된다.
- 다중 입력 지원: 텍스트→영상, 이미지→영상, 첫 프레임·끝 프레임 지정, 참조 이미지·영상·음성을 활용한 영상 생성이 가능하다.
- 참조 기반 모션 전이: 참조 영상에서 카메라 움직임이나 연기 등의 동작을 가져오고, 피사체와 스타일은 별도로 지정하는 작업을 지원한다.
- 메모리 최적화: 전체 파라미터의 약 40%를 차지하는 modulation weight를 룩업 테이블로 대체하고, int8 convrot 양자화와 VRAM 절감 커널을 적용했다.
- 로컬 실행 가능성: ComfyUI는 동적 VRAM 오프로딩을 사용할 경우 RTX 3060급 GPU에서도 실행할 수 있다고 밝혔다.
- API 비용과 해상도 제한: Segmind 기준 2K 출력은 초당 0.1625달러이며, 현재 API에서는
resolution값으로 2K만 선택할 수 있다고 설명한다.
왜 중요한가
H3는 영상과 오디오를 별도 후처리하지 않고 하나의 모델 흐름에서 처리하려는 접근을 보여준다. 특히 오픈웨이트가 공개되면서 ComfyUI가 모델 구조를 분석해 메모리 사용량을 낮추는 최적화를 시도할 수 있었고, 이는 대형 영상 모델의 로컬 실행 가능성을 넓히는 사례가 될 수 있다. 다만 실제 품질, RTX 3060 실행 성능, 최적화에 따른 호환성과 안정성은 독립적인 재현 및 검증이 필요하다.
참고 링크
- 원문: https://aisparkup.com/posts/15004
- ComfyUI 공식 소개: https://blog.comfy.org/p/minimax-h3-day-0-support-in-comfyui
- MiniMax H3 모델 가중치: https://huggingface.co/MiniMaxAI/MiniMax-H3
- MiniMax H3 API 가격 및 공개 정보: https://blog.segmind.com/minimax-h3-release-date-open-weights-and-api-pricing-explained/
- 관련 글: https://aisparkup.com/posts/14879
관련 위키
원문 보존 위치
원문 전체는 raw source: 2026-08-05-aisparkup-post-15004-minimax-h3-2k에 source_url 및 HTML 원문과 함께 저장되어 있습니다.