MiniMax 今日发布新一代开源视频模型 MiniMax H3,主打“Seedance 级别”的全模态精准控制与“AI 原生后期”能力。实测显示,该模型不仅能基于 7 张产品截图生成一支宣传片,还能在保持人物动作与镜头运镜的前提下,精准替换物体、修改背景、调整镜头角度,甚至将小提琴换成二胡。在 Artificial Analysis 的全球视频编辑榜上,H3 发布即超越 Gemini Omni 等模型,拿下榜单第一。
H3 是一款“开放通用多模态视频模型”,支持文字、图片、视频和音频混合输入,一次最多使用 9 张图片、3 段视频和 3 段音频,混合文件上限为 12 个。在测试中,编辑将 7 张产品截图和一段设计介绍视频交给 H3,仅用一句话提示词,模型便自动完成转场与动效,生成两支风格一致、文字准确的宣传片,且一次性生成、无需抽卡。不过,当画面中出现较小且密集的文本时,H3 仍偶发乱码,上传图片的画质会直接影响生成准确性。
H3 的精准编辑能力是其核心亮点。在 Artificial Analysis 榜单登顶后,编辑复现了 Gemini Omni 发布时的小提琴案例:将小提琴家在音乐厅演奏的视频,直接修改为在草原和海边的场景,人物光影、表情、镜头视角均完美保留,仅背景被精准替换。更进一步的测试中,H3 将小提琴换成二胡,甚至让演奏者“弹空气提琴”,物体替换无缝完成。在双人画面中,H3 还能分别处理不同对象的指令,例如将左边人物的衣服换成参考图样式,同时将右边人物变成一条狗。此外,H3 支持调整摄像机角度,同时保持人物细节与背景一致。
对于专业用户,H3 兼容分镜工作流。编辑用 GPT Image 2 生成机车图片和分镜,H3 能重新布局画面,并将文字作为视觉设计元素融入场景,而非简单叠加。例如,将机车名称和 Logo 放在机车下方,更符合观看体验。H3 还能生成游戏 HUD 界面、产品广告片,并结合语音模型实现声音、画面与角色动作的对齐。
H3 的另一大优势是降低使用成本。通过技术积累,MiniMax 为企业客户和创作者提供更低的使用成本,同时解决了生成“不可控”、“离成片远”的问题。编辑认为,H3 不仅让非视频专业用户能以极低门槛制作 demo 和提案素材,还显著降低了非专业用户与专业用户协作时的沟通障碍。
从产业角度看,AI 视频竞争正从单纯追求画质和电影感,转向更完整的生产工具能力。H3 将生成、剪辑、字幕、动效、声音等环节整合进单一模型,并开源,让内容团队可以围绕模型搭建自己的视频生产能力,而非依赖高价 Token 采购。这或许为 AI 视频发展开辟了另一条赛道:持续打磨模型能力,使其更接近真正可交付内容的生产工具。




津公网安备12011002023007号