MiniMax H3 开源登场:能理解文图音视频,还能直接生成 2K 立体声视频
MiniMax 发布全能多模态模型 H3,支持文本、图像、视频、音频联合理解与生成,可输出 2K 分辨率、原生立体声 15 秒视频,2K 定价不到主流三分之一,并即将开源模型权重。

MiniMax 正式推出全能多模态生成模型 H3,宣称这是新一代同时支持文本、图像、视频和音频统一理解与生成的开源模型。H3 最高可输出 2K 分辨率、15 秒时长并带原生立体声的视频片段。
和市面上"只会画"的视频模型不同,H3 把"看、听、读、写"四件事捆进了同一个网络。它既要理解输入的文本与图像,也要按指令生成画面、动作、音轨,甚至还原画面里的文字和品牌标识。
核心能力拆解
官方在发布说明里重点强调了三项能力:指令跟随准确度更高、文字与品牌标识还原更稳,以及视频到视频(V2V)的动作迁移。这意味着用户不再需要为不同任务来回切换模型。
在视频生成这条已经非常拥挤的赛道上,H3 选择了"开源 + 原生立体声"做切入口。立体声是大多数同类模型忽略的细节,H3 把双声道音频直接写进了生成流程,而不只是后期拼接。
价格策略与开源计划
H3 公布的定价相当激进:2K 视频每秒费用低于主流闭源模型的三分之一,768p 分辨率下更是压到主流 720p 价格的一半以下。对靠量出活的创作者来说,这一差价直接决定能不能用得起。
更值得关注的,是 MiniMax 计划近期开源模型权重。视频生成模型的开源节奏在过去一年明显加快,但能同时输出立体声和 2K 画面、还要开源的,H3 之前并不多见。
对开发者和创作者的实际影响
对独立开发者而言,H3 意味着可以在本地或私有云里跑一套多模态流水线,而不是按调用次数给闭源厂商打工。但要注意,视频类模型对显存要求高,2K 推理在消费级显卡上并不轻松。
对内容创作者来说,立体声和 2K 同时到位,配合 V2V 动作迁移,能把原本外包给剪辑师的镜头语言试错,搬到生成环节里直接做 A/B 测试,缩短内容生产周期。
企业用户应该怎么评估
如果你是品牌方或营销团队,重点看两件事:一,画面里文字与品牌标识的还原能力,这直接决定能不能直出投放物料;二,私有化部署成本,开源权重加上自购 GPU 是一次性投入,但运维和合规是否兜得住要看团队能力。
后续观察点
开源权重落地后,社区的微调、量化版本和类似 ControlNet 的控制插件,会决定 H3 最终能不能成为"视频领域的 Stable Diffusion"。同时,官方声称的低价能否在调用高峰期维持,也需要持续跟踪。
对中国 AI 工具使用者来说,H3 真正的价值不止是更强的视频生成器,而是它把"多模态理解 + 多模态生成 + 开源"三件事拼到了同一张牌桌上。谁先把这条链路跑通,谁就在下一轮内容应用中拿到先发权。
同主题阅读路径
查看「模型发布」栏目读完文章后,如果你想继续筛选 AI 工具,可以从真实使用场景开始做横向比较。
查看 AI 工具