MiniMax H3 开源深度解析:33B全模态生成系统架构、本地部署与2K视频工作流全解读
2026年8月3日,MiniMax 正式开源新一代通用视频模型 MiniMax H3。这是一个能够统一理解文本、图像、视频、音频的多模态生成系统,可生成最高2K分辨率、最长15秒、带原生立体声音频的视频。本文将从系统架构、核心技术、API调用、本地部署、2K工作流等维度进行超过8000字的全面拆解,并附8个实战代码示例。

一、开源始末:一个"全模态"时代的开端
2026年8月3日,MiniMax正式开源了新一代通用视频模型 MiniMax H3。
与传统的语言模型开源不同,H3的开源带来的是一个全模态生成系统——它不是单纯的语言模型,也不是单纯的视频模型,而是一个能够统一理解文本、图像、视频、音频等多种模态信息,并直接生成带原生立体声音频的视频内容的生成系统。MiniMax官网,点击打开

H3的核心能力可以用一句话概括:你只需要给它一段文字描述(甚至给它几张参考图或视频),它就能直接"拍"出一段带有立体声音效的高清电影片段。 它不只是"拼接"素材,而是真正"理解"了你要的故事。
1.1 输出规格一览
| 参数 | 规格 |
|---|---|
| 输出时长 | 4-15秒 |
| 最大分辨率 | 2K(2560×1440) |
| 默认分辨率 | 768p(较短边768像素) |
| 帧率 | 24 FPS |
| 音频 | 32 kHz 立体声(原生生成,非后期合成) |
| 宽高比 | 21:9、16:9、4:3、1:1、3:4、9:16 |
| 支持语言 | 11种(中、英、日、韩、法、德、俄、阿拉伯、意大利、葡萄牙、西班牙) |
1.2 开源范围

需要特别注意的是,H3的"开源"有其明确的边界。完整的H3系统由三个模块组成,其中只有H3-Base开放了权重:
| 模块 | 功能 | 开源状态 | 输出 |
|---|---|---|---|
| H3-Context-IR | 多模态输入理解与中间表示生成 | 未开源(提供API) | Context Intermediate Representation |
| H3-Base | 根据指令生成音视频 | 已开源(BF16权重) | 768p 音视频 |
| H3-Regenerate-2K | 768p→2K分辨率重新生成 | 未开源(提供API) | 2K 音视频 |
MiniMax发布了H3-Base的完整BF16权重和推理代码,包括33B参数的dense diffusion transformer、视觉和音频自编码器、基于Qwen3-VL的上下文编码器、任务专用检查点以及可运行的推理路径。但Context-IR、Regenerate-2K以及稀疏注意力实现均未包含在首个开源版本中。
1.3 开源资源地址
| 资源 | 地址 |
|---|---|
| HuggingFace | https://huggingface.co/MiniMaxAI/MiniMax-H3 |
| ModelScope魔搭社区 | https://modelscope.cn/models/MiniMax/MiniMax-H3 |
| GitHub | https://github.com/MiniMax-AI/MiniMax-H3 |
| MiniMax开放平台(国内) | https://platform.minimaxi.com |
| MiniMax API Docs(海外) | https://platform.minimax.io |
| 在线体验 | https://hailuoai.video |
| 官方技术博客 | https://www.minimax.io/blog/minimax-h3 |

二、系统架构:三阶段流水线设计

2.1 整体架构
完整的H3系统由三个模块串联构成,形成一个从输入理解到高分辨率输出的完整流水线:
用户输入(文本/图片/视频/音频)
↓
H3-Context-IR(托管API)
├── 指令解析
├── 跨模态关联
├── 时序理解
└── 复杂逻辑推理
↓
Context Intermediate Representation(上下文中间表示,约4K Token)
↓
H3-Base(已开源,33B参数DiT)
├── 联合预测视频latent和音频latent
└── 分别解码为视频和立体声音频
↓
768p 音视频结果
↓
H3-Regenerate-2K(托管API)
├── 将768p结果连同原始上下文重新输入
└── In-context方式重新生成
↓
2K 音视频结果
用通俗的话来说,把这个流程想象成"顶级电影制作团队":
- H3-Context-IR = 导演+编剧。仔细阅读你的剧本和参考画稿,深刻理解你想要什么风格、什么情绪,然后写出一份详细的"拍摄脚本"(中间表示)。
- H3-Base = 摄影团队。拿着脚本快速拍出一版"粗剪样片"(768p),构图、运镜、人物动作、背景音都有,画质尚可但细节不够精细。
- H3-Regenerate-2K = 后期特效大师。他不像传统软件那样"模糊变清晰",而是对着样片和原始脚本,重新"脑补"并渲染出超高精细度的最终大片(2K)。
2.2 H3-Context-IR:多模态理解的"大脑"
H3-Context-IR是一套托管式预处理与编排系统,专为自由形式的多模态输入而设计。它能够理解文本、图像、音频和参考视频之间的关系,以及这些素材与预期生成结果之间的关系。
其内部工作流包括:
- 指令解析:解析用户的自然语言指令
- 跨模态关联:建立不同模态素材之间的关联关系
- 时序理解:理解素材的时间顺序和时序逻辑
- 复杂逻辑推理:处理需要推理的复杂场景
H3-Context-IR会将其对上下文的理解序列化为一种H3-Base可接收的结构化表示。在不偏离用户原始意图的前提下,它也可能在适当情况下补充缺失或描述不充分的语义细节。
由于H3-Context-IR依赖多阶段工作流和多个托管模型与服务,因此不包含在本次开源发布中。但官方提供了API和详细的提示词指南,开发者可以参考构建自己的预处理系统。
2.3 H3-Base:33B参数的生成核心
H3-Base是整个系统中已开源的核心模块,使用不同模态各自对应的编码器或VAE进行编码,并将编码后的表示组织成统一的packed multimodal sequence(打包多模态序列),随后通过RoPE表达token之间的空间和时间关系,再将整个序列输入H3-Omni-Transformer。
具体而言:
- 文本由H3-Encoder编码
- 视觉输入同时由H3-Encoder和H3-VisualVAE编码
- 音频仅由H3-AudioVAE编码
H3-Omni-Transformer联合预测视频latent和音频latent,随后分别将其解码为视频和立体声音频。
H3-Encoder
H3-Encoder使用Qwen3-VL-32B的完整预训练权重,并将其第50层的hidden states提供给H3-Omni-Transformer。在tokenizer配置中增加了若干special tokens(例如<d>),使用时需要采用H3仓库中提供的tokenizer及相关配置文件。
H3-VisualVAE
H3-VisualVAE是一个采用时间因果结构的视频自编码器:
| 参数 | 规格 |
|---|---|
| 空间压缩倍率 | 16倍 |
| 时间压缩倍率 | 4倍 |
| Latent channel数 | 24 |
| 标记 | f16t4d24 |
| Patch size(进入Transformer前) | 1×2×2 |
| 等效空间下采样倍率 | 32倍 |
| 时间下采样倍率 | 4倍 |
H3-VisualVAE的latent space同时针对重建质量和生成模型的易学性进行了优化。在完成encoder训练后,还进一步训练了一个基于ViT的decoder,以降低解码成本并提升重建质量。
H3-AudioVAE
H3-AudioVAE使用同一套编码器和解码器分别独立处理左、右音频声道,再将解码后的两个声道重新组合,从而支持立体声音频的输入与输出。
对于每个声道,H3-AudioVAE会将32kHz音频压缩为时间频率为40 Hz的latent token序列。
H3-Omni-Transformer
H3-Omni-Transformer是整个模型的核心,其设计理念是"相对简洁":
| 参数 | 规格 |
|---|---|
| 总参数量 | 33B(33.1B) |
| 架构类型 | Dense、Single-stream Transformer |
| AdaLN分支参数 | 约13B |
| 位置编码 | 三维MM-RoPE(t, h, w) |
| Modality-specific结构 | 仅存在于input/output layer和AdaLN分支 |
关键设计特点:
- attention层和FFN层均不包含modality-specific结构,与模态相关的参数仅存在于input/output layer和AdaLN分支中
- modality-specific AdaLN能以相对较低的额外训练和推理成本提升生成质量
- AdaLN的调制输出可以预先计算并缓存,因此在仅用于推理的部署中,无需加载这部分参数(可节省约13B参数的显存)
- 使用三维Multimodal Rotary Position Embeddings(MM-RoPE),表达时间维度和两个空间维度(t, h, w)上的位置关系
在训练的最后阶段,引入了原生稀疏注意力以降低长序列的计算开销,但稀疏注意力实现未包含在首个开源版本中,将在后续更新中单独发布。
2.4 H3-Regenerate-2K:In-Context再生成
对于H3的2K分辨率输出,MiniMax没有采用传统的专用超分辨率模块,而是通过in-context的方式,使用H3基础模型对其自身生成的低分辨率结果进行重新生成。
这一方法具有两方面优势:
- 复用已有能力:再生成过程能够最大限度地复用H3基础模型已有的生成能力
- 信息还原:In-context形式能够在生成高分辨率输出时再次利用原始多模态上下文,从而还原传统超分辨率方法只能依靠"猜测"来补充的信息,例如小文字和精细细节
三、核心技术:四大创新点

H3的核心技术可以归纳为以下四项:
3.1 Contextual Omni Representation(COR)
用自然语言作为"桥梁"统一描述多模态素材之间、素材与目标之间的关系。大部分素材消耗约100K Token推理,最终压缩为约4K Token的表示。
这一技术的意义在于:无论输入是文本、图片、视频还是音频,无论组合多么复杂,COR都能将其统一为一种H3-Base可以理解的结构化表示,大幅降低了模型的输入复杂度。
3.2 H3-VAE:全新Tokenizer
H3-VAE实现了4倍序列长度压缩,直接降低训练和推理成本,是支撑原生2K输出的核心技术。
通过视觉和音频各自的VAE,将原始的高维多模态数据压缩为低维latent表示,使得33B参数的Transformer能够高效处理长视频序列。
3.3 H3-Omni-Transformer:异构训练架构
33B参数的稠密单流Transformer,采用理解与生成异构训练架构,端到端训练吞吐提升近30%。
异构训练架构的核心思想是:在同一个模型中同时优化"理解"和"生成"两种能力,但通过AdaLN等机制让两种能力在参数空间中相对独立,避免互相干扰。
3.4 In-Context Regeneration
不用专用超分模块,而是让基模对自身低分辨率结果进行"上下文重新生成",能还原传统超分"猜"不出的细节(如小文字、精细纹理)。
这是一个非常巧妙的设计:传统超分辨率方法只能基于低分辨率图像的像素信息进行"放大",而In-Context Regeneration可以同时参考原始的多模态上下文(包括文本指令、参考图片等),因此能够"知道"低分辨率图像中模糊的小文字原本应该是什么,从而精准还原。
四、模型版本与输入规格

H3-Base以两个task-specific checkpoints的形式发布,每个checkpoint均包含针对相应任务训练的Omni Transformer Model,以及推理所需的processor、tokenizer、text encoder、Visual VAE和独立Audio VAE。
4.1 H3-Base-FL2VA(首尾帧模式)
| 输入图像数量 | 模式 | 说明 |
|---|---|---|
| 0张 | 文生视频 | 纯文本生成视频 |
| 1张(首帧) | 首帧生视频 | 以指定图片为起始帧 |
| 1张(尾帧) | 尾帧生视频 | 以指定图片为结束帧 |
| 2张(首+尾) | 首尾帧生视频 | 以两张图片为起止帧 |
4.2 H3-Base-Ref2VA(全模态参考模式)
| 输入类型 | 最大数量 | 限制条件 |
|---|---|---|
| 图像 | 9张 | - |
| 视频 | 3段 | 每段2-15秒,总时长≤15秒 |
| 音频 | 3段 | 必须与图像或视频一同输入;每段2-15秒,总时长≤15秒 |
| 混合 | 合计最多12个 | 所有类型输入文件总和 |
在Ref2VA示例中,模型可以保留原视频中的人物身份、服装、镜头构图、光线和场景,并部分复用原视频的背景音乐;同时参考另一段男性语音的voice timbre,为人物生成新的对白及相应嘴型动作。
五、API调用实战

https://platform.minimaxi.com/docs/token-plan/intro
5.1 API定价
| 模型 | 分辨率 | 计费规则 | 价格 |
|---|---|---|---|
| MiniMax-H3 | 2K | 按秒计费 | 0.80元/秒 |
| MiniMax-H3 | 768P | 按秒计费 | 0.50元/秒 |
5.2 代码示例1:Python API文生视频(完整流程)
import os
import time
import requests
api_key = os.environ["MINIMAX_API_KEY"]
headers = {
"Authorization": f"Bearer {api_key}",
"Content-Type": "application/json"
}
# 国内端点;海外改为 api.minimax.io
BASE_URL = "https://api.minimaxi.com"
# 第一步:提交文生视频任务
def create_t2va_task(prompt: str, duration: int = 5, ratio: str = "16:9") -> str:
url = f"{BASE_URL}/v2/video_generation"
payload = {
"model": "MiniMax-H3",
"content": [{"type": "text", "text": prompt}],
"resolution": "2K",
"duration": duration,
"ratio": ratio
}
r = requests.post(url, headers=headers, json=payload)
r.raise_for_status()
return r.json()["task_id"]
# 第二步:轮询任务状态
def poll_task(task_id: str) -> dict:
url = f"{BASE_URL}/v2/query/video_generation"
while True:
r = requests.get(url, headers=headers, params={"task_id": task_id})
r.raise_for_status()
task = r.json()["task"]
status = task["status"]
if status == "succeeded":
return task
elif status in ("failed", "cancelled"):
raise RuntimeError(f"任务失败:{task}")
print(f"状态:{status},等待中...")
time.sleep(5)
# 第三步:下载视频
def download_video(task: dict, output_path: str):
video_url = task["content"]["url"]
r = requests.get(video_url, stream=True)
r.raise_for_status()
with open(output_path, "wb") as f:
for chunk in r.iter_content(chunk_size=8192):
f.write(chunk)
print(f"已保存:{output_path}")
# 完整调用
task_id = create_t2va_task(
"镜头拍摄一个女性坐在咖啡馆里,她抬头看向窗外,"
"镜头缓缓推向窗外的街道,暖色调,电影感。",
duration=5
)
task = poll_task(task_id)
download_video(task, "output.mp4")
5.3 代码示例2:curl直接调用
# 文生视频(最简调用)
curl -X POST "https://api.minimax.io/v2/video_generation" \
-H "Authorization: Bearer $MINIMAX_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "MiniMax-H3",
"content": [{"type":"text","text":"Cinematic drone shot over a misty forest at dawn"}],
"duration": 5,
"ratio": "16:9"
}'
5.4 代码示例3:多模态参考生视频
import requests
import os
api_key = os.environ["MINIMAX_API_KEY"]
headers = {
"Authorization": f"Bearer {api_key}",
"Content-Type": "application/json"
}
# 首帧图生视频
payload_i2v = {
"model": "MiniMax-H3",
"content": [
{"type": "text", "text": "a cat running in the garden, cinematic shot"},
{"type": "image_url", "image_url": {"url": "https://example.com/cat.jpg"}, "role": "first_frame"}
],
"resolution": "2K",
"duration": 5,
"ratio": "16:9"
}
# 首尾帧生视频
payload_fl2v = {
"model": "MiniMax-H3",
"content": [
{"type": "text", "text": "a car driving through the city at night"},
{"type": "image_url", "image_url": {"url": "https://example.com/first.jpg"}, "role": "first_frame"},
{"type": "image_url", "image_url": {"url": "https://example.com/last.jpg"}, "role": "last_frame"}
],
"resolution": "2K",
"duration": 5,
"ratio": "16:9"
}
r = requests.post(
"https://api.minimax.io/v2/video_generation",
headers=headers,
json=payload_i2v
)
print(r.json())
5.5 代码示例4:H3-Context-IR API调用
H3-Context-IR对最终输出质量非常重要,官方强烈建议将其接入生成流程。
# 使用 H3-Context-IR 增强提示词
curl --request POST \
--url https://api.minimax.io/v2/h3_context_ir \
--header 'Authorization: Bearer <token>' \
--header 'Content-Type: application/json' \
--data '{
"model": "MiniMax-H3",
"content": [
{
"type": "text",
"text": "史诗级太空歌剧院线预告:女舰长独自站在巨大观景窗前,最后一支舰队正在集结并跃迁离去,强光爆闪、舰桥震动,她被留在原地。"
}
],
"duration": 5,
"ratio": "16:9"
}'
Context-IR返回的增强Prompt可以直接传给H3-Base或视频生成API,显著提升生成质量。
六、本地部署全攻略

6.1 硬件需求
显存是本地部署最主要的瓶颈。以下是不同部署方案的硬件需求:
| 部署方案 | 最低显存 | 适用人群 |
|---|---|---|
| NF4量化 + Disk Offload | ~6 GB | 老款游戏本(1060/2060),速度慢 |
| NF4量化(DiffSynth-Studio) | 7-8 GB | 主流轻薄游戏本(3050/4050) |
| 非量化原生部署 | 12 GB+ | 台式机高端卡(3080/4080) |
| INT8量化 + ComfyUI(推荐) | ~14 GB | 16GB显存卡(4060Ti 16G、4080) |
| DGX Spark部署 | 110 GiB+ | 企业级AI服务器 |
| 完整BF16部署(单分区) | ~134 GiB | 顶级数据中心配置 |
系统内存:推荐64GB以上;32GB为最低门槛。
磁盘空间:模型权重下载约42.5GB(最小);完整FL2VA检查点约144GB;两个检查点全部下载需预留约270GB。
6.2 GPU支持情况
| 平台 | 型号 | 说明 |
|---|---|---|
| NVIDIA | RTX 3060及以上 | 原生CUDA支持 |
| NVIDIA | RTX 5090 | 支持专用层卸载方案 |
| AMD | Instinct MI355X、MI300X | 通过ROCm + SGLang |
| 摩尔线程 | MTT S5000 | 国产GPU适配 |
| 沐曦 | 曦云C系列 | 国产GPU适配 |
| Apple | Silicon Mac | 通过MLX适配 |
6.3 代码示例5:获取模型权重
# 登录 Hugging Face(需要先申请模型访问权限)
hf auth login
# 下载模型到本地(约 270 GB,建议使用国内镜像加速)
export MODEL_ROOT=/path/to/MiniMax-H3
hf download MiniMaxAI/MiniMax-H3 --local-dir "${MODEL_ROOT}"
# 国内用户可使用 ModelScope 魔搭社区镜像直连下载,支持断点续传
6.4 代码示例6:SGLang部署(推荐生产环境)
SGLang是官方推荐的部署框架,支持多卡分布式推理:
# FL2VA(首尾帧模式)部署
sglang serve \
--model-path MiniMaxAI/MiniMax-H3 \
--num-gpus 4 \
--ulysses-degree 4 \
--performance-mode speed \
--host 0.0.0.0 \
--port 30010 \
--model-variant fl2va
# Ref2VA(全参考模式)部署
sglang serve \
--model-path MiniMaxAI/MiniMax-H3 \
--num-gpus 4 \
--ulysses-degree 4 \
--performance-mode speed \
--host 0.0.0.0 \
--port 30010 \
--model-variant ref2va
注意:一个服务器进程只能加载一个检查点分区,切换T2VA/FL2VA和Ref2VA需要重启服务指向另一个分区。
6.5 代码示例7:Diffusers部署(最简单)
Diffusers提供最简洁的Python API,适合快速测试:
import torch
from diffusers import DiffusionPipeline
# 加载模型(切换 "mps" 可支持 Apple 设备)
pipe = DiffusionPipeline.from_pretrained(
"MiniMaxAI/MiniMax-H3",
torch_dtype=torch.bfloat16
)
pipe = pipe.to("cuda")
# 生成视频
prompt = "一只猫在花园里奔跑,电影感镜头,阳光透过树叶洒下斑驳光影"
output = pipe(
prompt=prompt,
num_inference_steps=20,
guidance_scale=7.0,
duration=5, # 秒
height=768,
width=1344 # 16:9 比例
)
output.save("output.mp4")
print("视频已保存到 output.mp4")
6.6 ComfyUI部署(消费级显卡最佳选择)
对于16GB显存的消费级显卡,ComfyUI(v0.30.0+)是最佳选择。它支持INT8量化部署,在RTX 4060 Ti 16G或RTX 4080上可以获得非常好的体验。ComfyUI还提供了可视化工作流编辑器,方便调整生成参数。
七、完整2K工作流

7.1 工作流概述
为了帮助开发者验证完整的H3生成流程,官方提供了一套Full 2K Workflow,将本地部署的H3-Base与官方H3-Context-IR、H3-Regenerate-2K API组合使用,以复现通过MiniMax API直接生成的2K视频质量。
整个流程分为三个阶段:
- Context-IR阶段:H3-Context-IR对用户输入的文本、图像、视频和音频等多模态信息进行理解与扩展,生成供H3-Base和后续再生成阶段使用的完整Prompt
- Base生成阶段:本地部署的H3-Base根据扩展后的Prompt与输入条件,生成短边为768像素的音视频结果
- 2K再生成阶段:H3-Regenerate-2K将H3-Base生成的768p视频作为
base_video,并结合扩展后的Prompt与原始输入上下文,再生成2K视频
7.2 三类完整复现案例
| 案例 | 输入 | 流程 |
|---|---|---|
| T2VA | 文本Prompt | Context-IR扩展 → H3-Base 768p → Regenerate-2K |
| I2VA | 文本+首帧图像 | Context-IR扩展 → H3-Base 768p → Regenerate-2K |
| Ref2VA | 文本+参考视频+参考音频 | Context-IR扩展 → H3-Base 768p → Regenerate-2K(继续使用原始参考素材) |
7.3 代码示例8:完整2K工作流
"""
MiniMax H3 完整 2K 工作流
将本地部署的 H3-Base 与官方 Context-IR、Regenerate-2K API 组合使用
"""
import os
import requests
import base64
API_KEY = os.environ["MINIMAX_API_KEY"]
headers = {
"Authorization": f"Bearer {API_KEY}",
"Content-Type": "application/json"
}
BASE_URL = "https://api.minimax.io"
# 本地 SGLang 部署的 H3-Base 地址
LOCAL_BASE_URL = "http://localhost:30010"
# ========== 第一步:H3-Context-IR 增强 Prompt ==========
def context_ir(text_prompt: str) -> str:
"""调用 Context-IR API,将用户输入转化为增强 Prompt"""
resp = requests.post(
f"{BASE_URL}/v2/h3_context_ir",
headers=headers,
json={
"model": "MiniMax-H3",
"content": [{"type": "text", "text": text_prompt}],
"duration": 5,
"ratio": "16:9"
}
)
resp.raise_for_status()
# 返回增强后的 Prompt
return resp.json()["enhanced_prompt"]
# ========== 第二步:本地 H3-Base 生成 768p 视频 ==========
def local_base_generate(enhanced_prompt: str, output_path: str):
"""调用本地部署的 H3-Base 生成 768p 视频"""
resp = requests.post(
f"{LOCAL_BASE_URL}/generate",
json={
"prompt": enhanced_prompt,
"duration": 5,
"height": 768,
"width": 1344,
"guidance_scale": 7.0,
"num_inference_steps": 20
}
)
resp.raise_for_status()
video_data = resp.content
with open(output_path, "wb") as f:
f.write(video_data)
print(f"768p 视频已保存:{output_path}")
return output_path
# ========== 第三步:H3-Regenerate-2K 重新生成 2K ==========
def regenerate_2k(video_path: str, enhanced_prompt: str, original_context: str) -> str:
"""调用 Regenerate-2K API,将 768p 视频升级为 2K"""
# 将本地视频编码为 Base64(生产环境建议上传到可公开访问的 URL)
with open(video_path, "rb") as f:
video_b64 = base64.b64encode(f.read()).decode()
resp = requests.post(
f"{BASE_URL}/v2/video_generation",
headers=headers,
json={
"model": "MiniMax-H3",
"content": [
{"type": "text", "text": enhanced_prompt},
{"type": "base_video", "base_video": video_b64}
],
"resolution": "2K",
"duration": 5,
"ratio": "16:9",
"mode": "regenerate_2k"
}
)
resp.raise_for_status()
task_id = resp.json()["task_id"]
# 轮询任务状态
import time
while True:
r = requests.get(
f"{BASE_URL}/v2/query/video_generation",
headers=headers,
params={"task_id": task_id}
)
r.raise_for_status()
task = r.json()["task"]
if task["status"] == "succeeded":
return task["content"]["url"]
elif task["status"] in ("failed", "cancelled"):
raise RuntimeError(f"2K 再生成失败:{task}")
print(f"2K 再生成状态:{task['status']},等待中...")
time.sleep(5)
# ========== 完整工作流执行 ==========
if __name__ == "__main__":
user_prompt = "一只金色的猫在樱花树下追逐蝴蝶,电影感,暖色调,镜头跟随"
# Step 1: Context-IR 增强
print("Step 1: Context-IR 增强中...")
enhanced = context_ir(user_prompt)
print(f"增强 Prompt: {enhanced[:100]}...")
# Step 2: 本地 H3-Base 生成 768p
print("Step 2: 本地 H3-Base 生成 768p...")
video_768p = local_base_generate(enhanced, "output_768p.mp4")
# Step 3: Regenerate-2K
print("Step 3: H3-Regenerate-2K 再生成 2K...")
video_2k_url = regenerate_2k(video_768p, enhanced, user_prompt)
print(f"2K 视频下载地址: {video_2k_url}")
# 下载 2K 视频
r = requests.get(video_2k_url, stream=True)
with open("output_2k.mp4", "wb") as f:
for chunk in r.iter_content(chunk_size=8192):
f.write(chunk)
print("2K 视频已保存:output_2k.mp4")
八、应用场景

H3可广泛用于以下领域:
| 场景 | 典型用例 | 优势 |
|---|---|---|
| 广告与品牌 | 品牌广告素材生成 | 精准呈现Logo和文字 |
| 电商 | 产品展示视频、360°环绕展示 | 多角度展示,原生音频 |
| 影视娱乐 | 电影片头、预告片、概念可视化 | 电影级画质,2K输出 |
| 游戏 | 过场动画、环境漫游、角色展示 | 多模态参考,角色一致性 |
| UI/UX与产品设计 | 动态交互原型、应用演示 | 快速原型验证 |
| 社交媒体 | 竖屏短视频、动态海报 | 支持竖屏9:16,多语言 |
行业地位:H3的视频编辑能力在Artificial Analysis视频模型榜单中排名全球第一。
九、许可协议与使用限制

9.1 MiniMax H3 Community License
MiniMax H3基于MiniMax H3 Community License发布。需要注意以下关键限制:
- 地域限制:许可证排除美国、英国、欧盟和韩国,除非获得单独授权
- 大型商业用户:对大型商业用户设有额外条件
- 输出限制:限制使用模型输出来改进其他AI模型
9.2 “开放权重"还是"完全开源”
准确地说,H3是"开放权重"(open-weight)而非"完全开源"(fully open-source):
- 已开放:H3-Base的BF16权重、推理代码、H3-VisualVAE、H3-AudioVAE、Qwen3-VL-based context encoder、task-specific checkpoints、可运行的推理路径
- 未开放:H3-Context-IR、H3-Regenerate-2K、稀疏注意力实现
本地部署H3-Base可以生成768p视频,但要获得完整的2K体验,仍需依赖MiniMax的托管API。
十、核心优势总结
| 优势 | 说明 |
|---|---|
| 真正的全模态统一 | 理解素材之间的关系,不是"把图片硬塞进去",而是真正"看懂"了图片内容并融入剧情 |
| 任务泛化 | 用自然语言描述任务,直接说人话就行,不用学复杂的参数 |
| 原生双声道音频 | 直接输出带立体声音频,生成的视频自带左右声道环境音,不用再找音效素材合成 |
| 极高性价比 | 2K仅0.8元/秒,仅为同级别国际大牌的1/3价格 |
| 完全开源(基础模型) | 基础模型开放下载,科研和私密数据场景可以自己搭 |
| 视频编辑第一 | Artificial Analysis全球榜首 |
| 多比例多语言 | 支持竖屏、横屏、11种语言 |
十一、云端API vs 本地部署:决策指南

何时选择云端API
- 追求最高2K画质
- 不想折腾硬件
- 需要快速出片
- 使用频次不高
- 需要Context-IR增强和Regenerate-2K
何时选择本地部署
- 注重数据隐私(如商业机密素材)
- 有高性能显卡(16GB+显存)
- 长期大量使用,想节省API调用费用
- 需要深度定制和微调
- 科研用途
何时选择混合方案
- 本地部署H3-Base处理768p生成
- 按需调用Context-IR和Regenerate-2K API
- 兼顾隐私、成本和画质
十二、避坑指南

12.1 开源边界认知
最常见的误区是"下载H3就能跑2K视频"。实际上,本地部署的H3-Base只能输出768p视频。要获得2K输出,需要:
- 调用H3-Regenerate-2K API(需付费)
- 或等待官方后续开源Regenerate-2K模块
12.2 显存不足的解决方案
如果显存不足,不要强行运行非量化模型。按需选择:
- 6-8GB显存:使用NF4量化 + ComfyUI
- 12-16GB显存:使用INT8量化 + ComfyUI
- 24GB+显存:可以尝试非量化原生部署
12.3 稀疏注意力未开放的影响
首个开源版本仅提供全注意力推理,未包含稀疏注意力实现。这意味着:
- 推理速度可能比官方API慢
- 长视频(15秒)的显存消耗较高
- 后续版本可能会发布稀疏注意力实现
12.4 Context-IR的重要性
官方强烈建议将H3-Context-IR接入生成流程。跳过Context-IR直接使用H3-Base,生成质量会有明显下降。如果不想调用API,可以参考官方提供的提示词指南搭建自己的上下文处理系统。
12.5 多GPU部署注意事项
- SGLang部署时,
--ulysses-degree参数需要与--num-gpus一致 - vLLM-Omni多GPU部署建议至少200GB系统内存
- 一个服务器进程只能加载一个检查点分区
十三、与其他视频生成模型的对比

| 特性 | MiniMax H3 | Sora 2 | Kling 2.0 | Seedance 2.0 |
|---|---|---|---|---|
| 最大分辨率 | 2K (1440p) | 1080p | 1080p | 720p |
| 最大时长 | 15秒 | 20秒 | 10秒 | 15秒 |
| 原生音频 | 立体声(32kHz) | 无 | 无 | 立体声 |
| 多模态输入 | 文/图/视/音 | 文/图 | 文/图 | 文/图/视/音 |
| 开源 | 基础模型开源 | 闭源 | 闭源 | 闭源 |
| 视频编辑 | 全球第一 | - | - | - |
| 价格(2K) | 0.8元/秒 | - | - | - |
H3的核心差异化优势在于:原生立体声音频 + 全模态参考输入 + 开源基础模型 + 全球第一的视频编辑能力。
十四、总结与展望
MiniMax H3的开源标志着视频生成进入了一个新的阶段——从"能生成视频"到"能理解和编辑视频"。
关键价值总结
- 架构创新:33B参数的dense single-stream Transformer,通过MM-RoPE和modality-specific AdaLN实现了真正的全模态统一
- 三阶段流水线:Context-IR → Base → Regenerate-2K的分离设计,既保证了质量又实现了灵活部署
- In-Context Regeneration:不用专用超分模块,而是让基模对自身低分辨率结果进行重新生成,能还原传统超分"猜"不出的细节
- 原生立体声音频:32kHz立体声与视频在同一前向传播中生成,音画天然同步
- 开放权重:H3-Base的BF16权重以MiniMax H3 Community License开放,支持本地部署和微调
- 生态完善:SGLang、vLLM-Omni、Diffusers、ComfyUI均有Day 0支持,AMD Instinct GPU也已适配
不足与期待
- 2K完整系统未开源:Context-IR和Regenerate-2K仍是托管API
- 稀疏注意力未开放:首个版本仅提供全注意力推理
- 许可限制:排除美国、英国、欧盟和韩国
- 显存需求高:完整BF16部署需要134GB显存
行业影响
H3的开源对整个AI视频生成行业的影响是深远的:
- 降低门槛:开发者可以免费在本地运行768p视频生成
- 推动创新:开放权重支持微调和二次开发
- 生态竞争:倒逼闭源模型提供商提升性价比
- 全模态趋势:从单一模态向全模态统一发展的方向更加明确
MiniMax用H3证明了:开源不等于低质量,开放权重也可以做到全球第一。这场开源不仅是一次模型发布,更是对AI视频生成行业格局的一次重塑。
参考资料:
- MiniMax官方开源公告: https://www.minimaxi.com/news/minimax-h3-open-source
- HuggingFace模型仓库: https://huggingface.co/MiniMaxAI/MiniMax-H3
- MiniMax开放平台API文档: https://platform.minimaxi.com
- AMD Day 0支持文章: https://www.amd.com/en/developer/resources/technical-articles/2026/day-0-support-for-minimax-h3-on-amd-gpus.html
- NxCode技术分析: https://www.nxcode.io/hu/resources/news/minimax-h3-open-weights-2k-system-boundary-2026
- 视频提示词写作指南: https://huggingface.co/MiniMaxAI/MiniMax-H3/blob/main/docs/VIDEO_PROMPT_WRITING_GUIDE_base_en.md
转载自 CSDN-专业IT技术社区
原文链接:https://blog.csdn.net/beautifulmemory/article/details/163797346




