全模态视频模型迎来新突破:MiniMax正式发布H3 并承诺开源权重
来源:互联网
时间:2026-08-05 17:44:06
最近,AI大模型赛道又迎来了一位重量级玩家——MiniMax正式发布了全新的全模态生成模型
MiniMax H3
这款模型支持多模态上下文输入,也就是说,你可以同时丢给它文本、图像、视频甚至声音的任意组合,最终它输出的是一段带原生双声道音频的高清视频。换句话说,你只需要提供参考素材(一段视频、一张图、一段音频),再配上自然语言指令,就能一次性完成复杂的视听内容创作——从概念到成品,一步到位。

技术架构上,MiniMax H3打破了传统多模态模型“按任务拆分专家模型”的套路。研发团队没有分设文生图、文生视频、图到视频、音频处理等独立模块,而是把所有任务整合进同一个预训练框架,端到端训练吞吐量提升了近30%。这背后,是全新的H3-Omni Transformer架构,以及重写Tokenizer后带来的H3-VAE架构,后者凭借极高的压缩率,显著降低了高分辨率下的推理成本。
定价方面,MiniMax H3在2K分辨率下的每秒价格,不到主流同类模型的三分之一。更关键的是,它从设计之初就充分考虑了对国产芯片的兼容性——这意味着在自主可控的算力环境下,也能跑得动。目前,该模型在电影片头、游戏UI动画、动态海报、广告电商等场景中已经展现出不错的应用潜力,尤其是对文字渲染和品牌信息呈现的准确度,有了明显提升。