Skip to content

认识 MiniMax H3:把"会自己配声音"的 2K 视频开源给全世界

你有没有过这种经历:用 AI 生成一个视频,画面挺美,一放声音——得,静音的。然后你还得再开一个配音工具、一段段对嘴型、调情绪、卡节奏,原本三分钟能收工的活儿,硬生生折腾成一下午的"音视频缝合怪"。问题不在你手笨,在于这个圈子里绝大多数视频模型,天生就是"聋的"。

2026 年 8 月 3 日,上海公司 MiniMax 干了件让整个 AI 视频圈睡不着觉的事:H3(海螺 3.0)直接把权重开源到了 HuggingFace。它不是又一款"画质还行但要后期配音"的模型,而是业界首个开源就能本地跑、而且画面和声音是同一次前向推理一起蹦出来的通用全模态视频模型。消息一出,当天 Video Arena 上它的开源榜直接冲到第一,把第二名 hunyuan-video-1.5 甩开 280 分。

有人说这是"视频圈的 DeepSeek 时刻"。我倒觉得更准确的说法是:它把"音画分离"这件行业默认的事,变成了历史。

什么是 MiniMax H3

MiniMax H3 是稀宇科技(MiniMax)的旗舰通用全模态视频生成模型,也是 MiniMax 第一款开源的多模态模型。它最初在 2026 年 7 月的世界人工智能大会(WAIC 2026)亮相,7 月 31 日正式发布,8 月 3 日就把权重开放下载——从发布到开源,只隔了三天。

它最炸裂的点不是分辨率,而是**"音画同出"**:视频和双声道立体声是同一个模型、同一次前向过程生成的,而不是"先生成静音视频、再拿 MMAudio 或者 Foley 去贴声音"。给它一张人物图、一段希区柯克式运镜的参考视频、一段歌声音频,它能直接产出人物按指定运镜动作、用参考歌声演唱的 2K 成片。

一句话:它不是"视频模型 + 配音插件"的拼装货,而是一个把文本、图像、视频、音频统一塞进同一个上下文、又能统一吐出来的"生成系统"。

MiniMax H3 有什么特点

  • 业界首个开源通用全模态生成模型:一个模型同时理解并生成文本、图像、视频、声音四种模态,视频和原生立体声一次生成,不用事后配音。
  • 33.1B 密集单流 Omni Transformer:文本编码器用的是 Qwen3-VL-32B,整体是单流结构,理解和生成在同一个模型里完成。
  • 三大核心模块H3-Context-IR 负责多模态上下文理解,H3-Base 是统一生成主干,H3-Regenerate-2K 负责高分辨率重生(注意:2K 模块闭源,本地只能跑 768P 的 H3-Base)。
  • 原生 2K + 原生立体声:最高 2K(1440P)分辨率、24fps 电影级帧率、4–15 秒时长(延伸模式约 30 秒),音频是原生 32kHz 双声道,口型、停顿、情绪跟着给定音频走。
  • 全能参考输入:文本 + 图片 + 视频 + 音频任意组合,单次最多 9 张图 + 3 段视频 + 3 段音频(共 12 份参考素材),Prompt 上限 7000 字符。
  • 六大画幅全覆盖:21:9 / 16:9 / 4:3 / 1:1 / 3:4 / 9:16,支持 11 种语言(中 / 英 / 日 / 韩等)。
  • 结构降本而非补贴:自研 H3-VAE 把视频序列长度压缩 4 倍,H3-Omni Transformer 用异构训练把端到端吞吐提升近 30%,这才有底气把价格打到地板价(详见下文)。
  • 开源即生态:发布当天就有 16 家芯片厂商和平台完成适配,创下国产开源模型纪录;可走 SGLang、vLLM、diffusers、ComfyUI 多种部署路径。

先泼盆冷水:H3 是视频模型,不是聊天/代码大模型。要对话、写代码,得用同门的 MiniMax M3 文本大模型。别拿它问"地球有多大",它会给你生成一段地球自转的带声音视频——虽然也很酷,但不是你想要的。

MiniMax H3 能用在哪(真实案例)

别只看"开源"两个字上头,这模型是真有人拿它干正事的,而且数据挺硬:

  • 独立电影人省下真金白银:有创作者向某闭源视频模型(Seedance)反复提交同一条提示词,十多次被拒;同样需求交给 H3,镜头很快生成、价格更低。他在社交媒体感叹:如果 H3 早些发布,自己的片子或许早就用上了。
  • 一张产品图 → 一条 2K 广告:另一位创作者只上传了一张产品图 + 一句提示词,H3 就生成了一段 2K 广告。打动他的不仅是清晰度,而是模型自己把光线、镜头和品牌调性都处理妥当了——这对电商、品牌小样、游戏概念 PV 是刚需。
  • MiniMax 自家产品直接用:海螺 AI(Hailuo)、Talkie 等 MiniMax 系应用背后就是这套生成能力,相当于"自己造的引擎自己先踩油门"。
  • 资本用脚投票:8 月 3 日开源当天,MiniMax 股价(MiniMax-W)一度涨超 8.67%——市场比我们还兴奋。

榜单上它也一点不含糊(数据来自 Artificial Analysis,截至 2026-07-31 H3 发布当日):

能力项排名
视频编辑(Video Editing)全球第一(Elo 1130,领先 Gemini Omni、Seedance 2.0)
文生视频(Text-to-Video)全球第二
图生视频(Image-to-Video)全球第三

在 Video Arena 上,MiniMax-H3 是开源模型第一:文生视频、图生视频均居开源榜首,比第二名 hunyuan-video-1.5 高出 280 分,直接从 Hailuo-2.3 的 #27(1199 分)跳到开源榜头名。

最颠覆的是价格。H3 的 API 定价 0.8 元 / 秒,仅为同类旗舰视频模型(如 Seedance 2.5 的 10 元 / 秒)的约十二分之一;一条 15 秒 2K 视频标价约 1.95 美元。2K 分辨率下每秒价格不到主流模型的三分之一。这不是烧钱补贴,是 H3-VAE 把 Token 量压缩下来的结构性降本。

初体验:怎么上手 MiniMax H3

普通人根本不用自己扛 33B 的权重去炼丹,先薅 API 或本地玩 768P 最香:

想最快看到效果:直接去 MiniMax 开放平台或海螺 AI 网页端,上传一张图 + 一句话就能生成带声音的视频;开发者走 OpenAI 兼容接口,换个 base_url 即可。

想本地部署(768P):开源的 H3-Base 模块支持 ComfyUI、diffusers、vLLM、SGLang。ComfyUI v0.30.0+ 已合入原生支持,一张 RTX 5090 就能本地跑 768P 带立体声的视频。

bash
# 从 HuggingFace 拉取权重(注意:本地开源版最高 768P)
# 用 diffusers 加载 H3-Base 示例(伪代码示意,具体以官方 repo 为准)
from diffusers import ...  # MiniMax 官方会给出 H3 的 diffusers / transformers 加载示例
# 路径:https://huggingface.co/MiniMaxAI/MiniMax-H3

想冲 2K 画质:原生 2K 由闭源的 H3-Regenerate-2K 模块负责,本地无论什么硬件都跑不出原生 2K,只能调用官方 API 实现。换句话说——本地玩玩法、云端拿画质,是 H3 当前的现实分工。

部署前务必读一遍 MiniMax Community License:该协议排除欧盟、英国、韩国、美国地区;年营收超过 2000 万美元的商业用户需单独授权;且生成内容不能用于训练其他 AI 模型。商用前把 License 读三遍,别等律师找上门。

进阶

更多开源技术干货和学习资料,关注公众号「遇码」,领取专属福利。

遇码MeetCoding 开源技术社区