출처
- source_url: https://discuss.pytorch.kr/t/minimax-33b-h3/11523
- author: 9bow
- published: Tue, 04 Aug 2026 05:00:58 +0000
- raw: raw source:
2026-08-04-pytorchkr-topic-11523-minimax-33b-h3
MiniMax H3: 영상과 음향을 함께 생성하는 33B 옴니모달 모델
개요
MiniMax H3는 텍스트·이미지·영상·음성을 하나의 컨텍스트로 처리하고, 최대 2K 해상도·15초 길이의 24fps 영상과 32kHz 네이티브 스테레오 음향을 함께 생성하는 옴니모달 모델이다. 영상·대사·효과음·배경음악을 별도 후처리로 결합하지 않고 동일한 디노이징 과정에서 생성하는 구조를 사용한다. 오픈 웨이트로 공개된 부분은 768p 영상을 생성하는 H3-Base이며, 입력 해석을 담당하는 H3-Context-IR과 2K 재생성 모듈 H3-Regenerate-2K는 공개되지 않았다. 다만 MiniMax H3 Community License에서 대한민국을 제외 지역으로 명시하고 있어, 국내에서 가중치를 운영·배포하려면 별도 승인이 필요하다는 점을 먼저 확인해야 한다.
핵심 포인트
- 33B 밀집 단일 스트림 Omni Transformer가 텍스트, 이미지, 참조 영상·음향, 목표 영상·음향을 하나의 패킹된 멀티모달 시퀀스로 처리한다.
- 영상과 음향을 동시에 예측하며, 출력은 24fps 영상과 32kHz 스테레오 음향이다. 지원 길이는 원문과 구현체에 따라 4
15초 또는 515초로 표기되어 있어 사용 스택별 확인이 필요하다. - 공개 체크포인트는
MiniMax-H3 Base FL2VA와MiniMax-H3 Base Ref2VA두 종류다. 각각 텍스트·첫/끝 프레임 기반 생성과 이미지·영상·음향 참조 기반 생성에 사용된다. - H3-Context-IR은 자유 형식의 멀티모달 지시를 구조화된 컨텍스트 표현으로 변환하는 호스팅 모듈이며, 최종 품질에 중요한 역할을 하지만 오픈 웨이트로 제공되지 않는다.
- H3-Base는 Qwen3-VL-32B의 중간 표현, 별도 영상·음향 VAE, 33B Omni Transformer를 결합한다. CFG 증류 모델이므로 네거티브 프롬프트와
guidance_scale을 사용하지 않는다. - SGLang, vLLM-Omni, diffusers, ComfyUI에서 지원되지만, 해상도·참조 입력 수·양자화·메모리 요구량·통합 상태 등은 스택마다 다르다.
- 대한민국은 라이선스의
Excluded Territories에 포함된다. 저장소에서 파일을 다운로드할 수 있더라도, 원문은 국내에서 가중치를 그대로 운영하거나 배포하려면 MiniMax의 별도 승인과 컴플라이언스 통제가 필요하다고 설명한다.
왜 중요한가
H3는 텍스트-영상, 이미지-영상, 영상 편집, 모션 참조, 음성·효과음·음악 생성을 여러 전문 모델로 나누기보다, 자연어로 모달리티 간 관계를 설명하는 하나의 생성 시스템으로 통합하려는 사례다. 특히 영상과 음향을 같은 생성 루프에서 다루고 참조 이미지·영상·음향을 한 요청에서 조합한다는 점은 멀티모달 영상 생성 모델의 설계 방향을 보여 준다. 동시에 공개된 웨이트만으로는 2K 전체 파이프라인을 재현할 수 없고, 국내 사용자는 라이선스 제약을 받으므로 “오픈 웨이트 공개”를 곧바로 자유로운 국내 운영 가능성으로 해석해서는 안 된다.
후속으로 볼 링크와 키워드
- 원문: https://discuss.pytorch.kr/t/minimax-33b-h3/11523
- Hugging Face 모델 저장소: https://huggingface.co/MiniMaxAI/MiniMax-H3
- 라이선스: https://huggingface.co/MiniMaxAI/MiniMax-H3/blob/main/LICENSE
- T2VA/I2VA/FL2VA 프롬프트 가이드: https://huggingface.co/MiniMaxAI/MiniMax-H3/blob/main/docs/VIDEO_PROMPT_WRITING_GUIDE_base_en.md
- Ref2VA 프롬프트 가이드: https://huggingface.co/MiniMaxAI/MiniMax-H3/blob/main/docs/VIDEO_PROMPT_WRITING_GUIDE_ref_en.md
- 키워드:
MiniMax H3,omni-modal video generation,native stereo sound,H3-Context-IR,H3-Base,FL2VA,Ref2VA,CFG distillation,SGLang,vLLM-Omni,diffusers,ComfyUI,MiniMax H3 Community License
관련 위키
원문 보존 위치
원문 전체는 raw source: 2026-08-04-pytorchkr-topic-11523-minimax-33b-h3에 source_url 및 HTML 원문과 함께 저장되어 있습니다.