
7 月 31 日,MiniMax 发布了第三代视频生成模型 H3。这不是又一个文生视频工具:H3 将文本、图像、视频、音频作为统一上下文输入,生成带原生立体声音轨、最高 2K 分辨率、最长 15 秒的视频片段。两天后,模型权重在 HuggingFace 上线,ComfyUI 完成首日适配。
核心规格
| 参数 | 规格 |
|---|---|
| 输出分辨率 | 最高 2K(短边 1440px) |
| 视频时长 | 4 至 15 秒(整数秒) |
| 帧率 | 24fps |
| 宽高比 | 21:9、16:9、4:3、1:1、3:4、9:16、自适应 |
| 音频 | 原生立体声,与视频同一步骤生成 |
| 输入模态 | 文本、图像(最多 9 张)、视频(最多 3 段)、音频(最多 3 段) |
| 混合输入上限 | 12 个文件 |
| 许可证 | MiniMax Community License(商用需申请) |
| 权重地址 | HuggingFace: MiniMaxAI/MiniMax-H3、Comfy-Org/MiniMax-H3 |
H3 是 MiniMax 视频系列的第三代产品。前两代 Hailuo 01 和 Hailuo 02 分别建立了基础架构和优化了核心组件。H3 做了一件前两代都没做的事:开源权重。
架构设计:从分任务到全模态统一
此前视频生成领域的标准做法是按任务拆分模型:文生视频(T2V)、图生视频(I2V)、首尾帧生成、主体参考、动作参考、视频编辑,每个任务往往对应一个独立的专家模型。音频生成同样被切成语音、音效、音乐三个独立领域。
H3 的设计出发点是打破这些边界。在预训练阶段,所有数据类型和任务被尽早融合:
- 文生图、文生视频(含联合生成的音频,所有音频输出为原生立体声)
- 原生多镜头建模
- 文生音频(语音、音效、音乐联合建模,不做分离)
- 广义参考和编辑:图生图、图生视频、音生音、音视频生音视频
参考和编辑关系通过自然语言描述,而非固定任务集定义。一个典型的多模态提示词:参考视频 1 中的希区柯克式运镜,让图像 2 中的人物唱歌,声轨匹配音频 3。模型自行处理跨模态的复杂关联。
四个核心技术组件
Contextual Omni Representation(上下文全模态表示)
MiniMax 在工程实现中重点加强了模型的描述能力(captioning capability)。引入多模态上下文后,描述不再只针对目标视频,还要描述上下文与目标视频之间的关系,甚至上下文元素内部的关系。视频和音频需要联合描述,多镜头场景下音画关系更加复杂。
本质上这是一种上下文全模态表示:语言充当可泛化的桥梁和解释器,将任务统一为开放式描述形式。实现路径上,MiniMax 构建了专用模型和全模态理解管线,大部分原始素材需要约 100K token 的推理计算,蒸馏后平均压缩到约 4K token。
H3-VAE:4 倍有效序列长度
tokenizer 技术是 H 系列持续投入的方向。H3 对 tokenizer 做了全面重构,在重建质量和可学习性上获得全面提升。关键指标是压缩比:高压缩比带来了 4 倍的有效序列长度增益。
这个 4 倍增益直接降低了训练和推理成本,也是原生 2K 分辨率得以实现的技术基础。没有这层压缩,2K 视频的 token 序列长度会超出可行的计算预算。
H3-Omni Transformer
架构设计服务于任务泛化这一目标。MiniMax 明确放弃了 Hailuo-02 的架构,尽管它曾带来显著的架构优势,但对围绕任务泛化设计的模型而言引入了不必要的复杂度。
引入多模态上下文后,序列长度的方差增加了三倍,理解和生成的计算负载变得更加异构。H3 采用了分离理解和生成工作负载的训练架构,分别优化各自的硬件利用率,同时联合平衡样本级异构计算与跨样本负载均衡。端到端训练吞吐量提升近 30%。
In-Context Regeneration(上下文内重生成)
H3 的 2K 输出没有使用传统的独立超分辨率模块。取而代之的做法是让 H3 基座模型在上下文内重新生成自身的低分辨率输出。
这个机制有两个优势:第一,重生成过程最大限度地复用基座模型已具备的生成能力;第二,上下文内方式允许模型再次引用原始多模态上下文来产生高分辨率输出,恢复传统超分辨率只能猜测、往往无法还原的细节,比如小号文字和品牌标识。
本地部署:从 124GB 到 42GB
ComfyUI 团队在首日适配中做了大量机器学习工程优化。核心发现是:模型的调制权重(约占总参数量的 40%)可以被剪枝,替换为功能等价的查找表(lookup table),在不损失输出质量的前提下大幅缩减内存占用。
权重自带了精确高效的 int8 convrot 量化方案,配合自定义 CUDA 内核减少推理峰值显存。优化结果:
| 配置 | 内存占用 |
|---|---|
| 全精度(bf16) | 123.6 GB |
| 量化 + 剪枝(最小变体) | 42.5 GB |
内存占用降低 66%。结合 ComfyUI 的动态 VRAM 卸载机制,一代 2K 视频模型可以在 RTX 3060 级别的消费级 GPU 上本地运行。
ComfyUI 部署步骤
- 更新 ComfyUI 至 0.30.0 或更高版本
- 从 HuggingFace 下载模型权重(Comfy-Org/MiniMax-H3),包含 diffusion_models、text_encoders、vae 三个目录
- 工作流模板:T2V(文生视频)、I2V(图生视频)、R2V(参考生成)可从 Comfy-Org GitHub 仓库获取
- 可选量化变体:int8 convrot(推荐消费级显卡)、pruned fp8 scaled、pruned int8 convrot
HuggingFace 上的 Comfy-Org/MiniMax-H3 仓库提供了 15 个文件,覆盖全精度和多种量化配置:
- 扩散模型:fl2va(首尾帧到视频)和 ref2va(参考到视频),各有 bf16/int8_convrot/pruned_fp8/pruned_int8 四种变体
- 文本编码器:Qwen3VL-32B,提供 bf16/int8_convrot/nvfp4_awq 三种变体
- VAE:视频 VAE(fp16)和音频 VAE(fp32)独立文件
API 调用
不愿本地部署的用户可通过 MiniMax 平台 API 调用,模型 ID 为 MiniMax-H3。API 支持三种入口模式:文生视频、首尾帧图生视频、参考生成。调用流程为异步三步:创建任务、轮询 task_id、下载 content.url。
文件大小限制:视频 50MB、图像 30MB、音频 15MB。支持格式:H.264/H.265 视频,JPG/PNG/WEBP/HEIC 图像,WAV/MP3 音频。注意音频不能单独发送,必须附带图像或视频。
定价
MiniMax 官方公布的价格优势:2K 分辨率下,H3 每秒价格不到主流模型的三分之一;768p 下,不到主流模型 720p 价格的一半。Artificial Analysis 排行榜标注的视频编辑 API 定价为 $7.80/分钟,即一个 15 秒 2K 片段约 $1.95。MiniMax 的按量付费页面在发布时仍只列出 Hailuo 2.3 的定价档位。
第三方评测排名
Artificial Analysis 的 Video Arena(盲测 Elo 排名)数据:
| 类别 | 排名 | Elo 分 |
|---|---|---|
| 视频编辑(含音频) | 第 1 | 1,130 |
| 文生视频(无音频) | 第 2 | 1,305 |
| 文生视频(含音频) | 第 2 | 1,240 |
| 图生视频 | 前 3 | — |
视频编辑排名第一,文生视频和图生视频均进入前三。文生视频第一名为 Google Gemini Omni Flash(Elo 1,324),H3 以 1,305 分紧随其后。在含音频的文生视频类别中,Gemini Omni Flash 以 1,244 分领先,H3 以 1,240 分接近。
H3 在视频编辑上的优势与其架构设计直接相关:In-Context Regeneration 机制让模型在编辑时能重新引用全部多模态上下文,而不是简单地叠加超分辨率层。这对广告、电商等需要精确品牌标识和文字渲染的场景意义显著。
开源权重的行业影响
MiniMax 选择开源 H3 权重,将开源权重的实践从大语言模型领域延伸到了视频生成领域。此前视频生成的主要模型(Sora 2、Veo 4、Gemini Omni Flash)均为闭源。
据路透社报道,MiniMax 计划在数日内发布 H3 的模型权重,允许用户下载和定制底层系统。实际发布时间线:7 月 31 日 API 上线,8 月 3 日权重在 HuggingFace 上线,MiniMaxAI 和 Comfy-Org 两个仓库同步发布。ComfyUI 同日完成适配,实现了 Day-0 支持。
权重以 MiniMax Community License 发布。该许可证允许研究和非商用使用,商用需向 MiniMax 申请授权。HuggingFace 上 MiniMaxAI/MiniMax-H3 仓库在发布当天获得超过 1,400 个点赞。
MiniMax 的迭代路线
MiniMax 在官方博客中明确了 H3 后续版本的优先方向:
- 多模态理解能力是高质量生成的基础,下一代 H 系列计划整合 M 系列模型的能力(MiniMax M3 拥有 1M 上下文和原生多模态能力)
- 当前模型尺寸仍有提升空间,扩大规模是明确路径
- 部分场景下视觉细节仍有改进余地,将持续推进更高分辨率和视觉保真度
来源:MiniMax 官方博客 · ComfyUI 博客 · HuggingFace 模型页 · Artificial Analysis 排行榜