
当整个AI视频行业都在用高昂的API定价和闭源壁垒筑起高墙时MiniMax选择了一条截然不同的路——它问了一个看似简单却极其硬核的问题如果把全模态视频生成模型的定价打到行业同类模型的1/3并且直接开源会怎样模型地址https://modelscope.cn/models/MiniMax/MiniMax-H3一、为什么这个模型值得你停下来读如果你接触过AI视频生成你一定对这样的困境习以为常想生成一支高质量的商业视频得用闭源模型。但闭源模型要么贵得离谱每秒几十元要么能力单一只能文生视频不支持多模态参考要么数据安全堪忧素材要上传云端。但MiniMax H3给出了一个颠覆性的答案一个通用的全模态生成系统支持文本、图像、视频、音频的统一理解与生成最高输出15秒2K分辨率2560×1440原生双声道视频定价仅为行业同类模型的1/3——而且宣布开源更绝的是它在第三方评测机构Artificial Analysis的文生视频有声榜单中排名第二Elo 1242分仅以微弱差距落后谷歌Gemini Omni Flash1245分在视频编辑榜单中更以1130 Elo排名全球第一领先Google Gemini Omni、字节Seedance 2.0等模型。这不是在现有视频模型上做点微调——它是从架构到定价到开源策略重新定义了“多模态视频模型应该怎么做”。二、核心亮点三大杀手锏2.1 ★ 全模态统一理解与生成文本/图像/视频/音频“一网打尽”H3最核心的能力是真正的全模态Omni-modal——不是“文本模型外挂视觉模块”而是从系统层面原生支持多模态统一理解与生成输入文本、图像、视频、音频的任意组合输出最高2K分辨率、15秒时长、24FPS、32kHz立体声的音视频语言支持稳定支持中、英、日、韩、法、德、西、意、葡、俄、阿等11种语言具体怎么用H3提供了两种核心输入模式模式输入类型用途首尾帧模式Base-FL2VA0/1/2张图像文生视频、首帧→视频、尾帧→视频、首尾帧→视频全参考模式Base-Ref2VA≤9张图像 ≤3个视频片段 ≤3个音频片段多模态参考生成总输入≤12个文件一个具体例子给H3一张人物参考图 一段希区柯克式镜头运动的参考视频 一条参考歌声的音频它能读懂“让图里的人物按参考视频的镜头运动并配上参考歌声”——把三种完全不相关的模态融合成一个连贯的输出。2.2 ★ 价格屠夫每秒8毛钱仅为行业1/3MiniMax H3在定价上展现了惊人的攻击性2K视频生成价格0.8元/秒约为业内同类旗舰模型的1/3以12贝壳/秒计价2K效果怎么做到的MiniMax用高压缩Tokenizer减少视频生成所需Token数量并对异构训练、任务负载均衡和GPU利用效率进行了全面优化。对于需要大规模生成视频的商业场景广告、电商、品牌、游戏这意味着成本直接断崖式下降。2.3 ★ 开源 64B Dense架构多模态领域的“DeepSeek时刻”H3宣布开源模型权重已上架ModelScope维度MiniMax H3模型大小138.47BSafetensors格式架构64B · DENSE开源协议MiniMax H3社区许可证下载量已超1,361次截至8月3日“天下苦闭源模型久矣MiniMax要做多模态领域的Deepseek。”这句话精准地概括了H3的战略意义——用开源打破闭源壁垒用低价打破价格垄断。三、技术解析三大核心模块重新定义多模态生成H3的技术架构围绕三个核心模块展开3.1 H3-Context-IR多模态“理解大脑”这是一个托管的预处理与编排系统专为自由形式的多模态输入设计。它能理解文本、图像、音频和参考视频之间的关系以及这些素材与预期生成输出之间的关联。内部工作流程包括指令解析理解用户到底想要什么跨模态关联建立不同模态素材之间的联系时序理解理解视频的时间顺序逻辑复杂逻辑推理处理多步、多条件生成需求注意H3-Context-IR依赖于多阶段工作流和多个托管模型未包含在本次开源发布中但MiniMax提供了API供开发者复现官方工作流。3.2 H3-Base768p核心生成引擎H3-Base是模型的核心生成模块文本编码使用Qwen3-VL-32B的完整预训练权重将其第50层的隐藏状态提供给H3-Omni-Transformer视觉编码H3-Encoder H3-VisualVAE联合编码音频编码H3-AudioVAE独立编码核心TransformerH3-Omni-Transformer联合预测视频和音频的潜在表示随后分别解码稀疏注意力原生支持稀疏注意力训练与推理初始开源版本仅提供全注意力推理稀疏注意力实现将在未来更新中发布H3-VisualVAE的关键参数参数值空间压缩因子16×时间压缩因子4×潜在通道数24f16t4d24进入Transformer的patch1×2×2等效空间下采样32×等效时间下采样4×H3-AudioVAE左右声道独立处理使用相同编码器/解码器32kHz音频压缩为40Hz的潜在token序列受VA-VAE启发优化潜在空间兼顾重建质量和可学习性3.3 H3-Regenerate-2K从768p到2K的“超分增强”H3默认输出为768p短边768像素。要获得2K分辨率需要使用H3-Regenerate-2K模块将768p的结果连同原始上下文重新输入H3再生2K分辨率输出。该过程充分利用了H3强大的生成能力以及原始上下文中包含的丰富信息从而生成细节更准确、视觉保真度更高的高分辨率输出。输出规格汇总规格参数时长4–15秒宽高比21:9、16:9、4:3、1:1、3:4、9:16分辨率默认768p短边2K2560×1440通过Regenerate实现帧率24 FPS音频32kHz 立体声语言11种稳定支持四、性能表现全球视频编辑第一文生视频第二4.1 第三方评测双榜顶尖榜单排名Elo分数击败对手Artificial Analysis 视频编辑榜全球第11130Google Gemini Omni、字节Seedance 2.0Artificial Analysis 文生视频有声榜全球第21242仅落后Gemini Omni Flash 3分4.2 核心能力商用级多场景内容生成官方宣称H3具备商用级的多场景内容生成能力指令遵循精准理解并执行复杂多模态指令文字与品牌信息呈现视频中文字清晰可读品牌信息准确传达V2V Motion Transfer视频到视频动作迁移让参考动作“移植”到新角色上精准可控的多模态内容编辑与生成适用场景广告、品牌、电商、产品设计、游戏视觉包装和后期特效特效剪辑包装类视频4.3 实际体验与Seedance“有来有回”早期实测显示H3与Seedance 2.0能打得有来有回同时生成速度更快价格按照官方定价直接对比也更低。简单的人物/背景/物体替换、基于参考视频学习风格并复制、根据文字需求直接生成一支产品概念片——这些都是H3的强项。五、快速上手5.1 模型下载ModelScopegitlfsinstallgitclone https://modelscope.cn/models/MiniMax/MiniMax-H3模型大小138.47B约288GB5.2 在线体验无需下载平台链接Web全球版hailuoai.videoWeb中国版hailuoai.com桌面全球版hub.minimax.io桌面中国版hub.minimaxi.com5.3 API调用MiniMax提供了在线API供开发者直接使用H3的能力。重要提示官方强烈建议将H3-Context-IR集成到生成流程中或遵循“提示指南”构建自己的上下文处理系统。5.4 硬件适配沐曦股份曦云C系列GPU已率先完成对H3的Day 0适配基于自研核心GPU IP打造具备高能效比与高通用性。六、总结与思考MiniMax H3的价值远不止于“又出了一个视频模型”。它真正值得深思的地方在于第一它证明了“多模态模型可以既强又便宜”。2K视频每秒8毛钱、视频编辑全球第一、文生视频全球第二——性能不妥协价格打骨折。第二它用开源打破了闭源壁垒。“天下苦闭源模型久矣”——H3的开源让开发者、企业和研究者第一次拥有了一个商用级全模态视频生成模型的完整权重。你可以本地部署、二次开发、定制微调。第三它重新定义了“多模态”的边界。不是“文生视频”一个孤岛而是文本、图像、视频、音频的任意组合输入→统一理解→音视频联合输出。这代表着从“单一任务模型”到“通用多模态智能”的范式跃迁。第四它的技术架构极具前瞻性。H3-Context-IR做多模态理解、H3-Base做核心生成、H3-Regenerate-2K做超分增强——三个模块各司其职构成了一个完整的全模态生成操作系统。当然H3也有明显局限H3-Context-IR未开源依赖API调用初始版本仅支持全注意力推理稀疏注意力待后续更新138B的模型规模对硬件有较高要求。但它打开了一扇门如果多模态视频生成的未来不一定是“更贵更闭源”而是“更便宜更开放”呢模型地址https://modelscope.cn/models/MiniMax/MiniMax-H3欢迎下载、体验、二次开发——一起探索多模态视频生成的另一种可能。