- 类型
- 模型
- 来源
- AIHOT · X / 公众号精选
- 发布
- 2026年8月3日 02:44
- 状态
- 单一信源
01
发生了什么
2026年8月3日,据AIHOT报道,MiniMax正式开源新一代通用视频模型H3。该模型可统一理解文本、图像、视频和音频,能生成最高2K分辨率、最长15秒、带32kHz原生立体声音频的视频。
02
为什么重要
此前开源视频模型多在分辨率、时长或音频能力上有所取舍,H3同时支持2K分辨率、15秒时长和32kHz原生立体声,且统一处理多模态输入,标志着开源模型在多模态生成能力上的新水平。
03
底层逻辑
MiniMax通过统一模型架构处理文本、图像、视频和音频,使各模态间信息可交互,降低多步生成误差。开源策略可吸引开发者测试反馈,加速模型迭代,并扩大生态影响力。
04
产品与商业机会
对产品与研发团队,H3开源提供了可直接集成的高质量视频生成能力,可降低自研多模态模型的技术门槛与成本,缩短功能上线周期,同时需评估其部署资源消耗与现有产品技术栈的兼容性。
- 集成H3到短视频创作工具,提供2K、15秒内的一键生成服务。
- 基于H3开发多模态内容理解与生成功能,如自动生成带背景音乐的解说视频。
- 针对H3推出云端API服务,按调用量收费,向中小企业售卖。
05
仍待确认
- H3的模型参数量与训练数据规模尚未披露。
- 开源许可证类型与商用条款未说明。
- H3生成视频的具体推理速度与硬件要求未知。
- 是否有独立第三方评测验证2K与立体声效果尚待确认。