最近视频生成这块,又出了个大动作。7 月底,MiniMax(就是做海螺 AI 的那家稀宇科技)发布了 H3,而且没藏着掖着,直接把模型权重开源了。
我第一时间把官方博客、开源仓库和技术文档翻了一遍,也去平台试了几个生成。这篇不吹不黑,聊聊 H3 到底是啥、能干嘛、以及它现在还有哪些绕不开的坎。
它到底是什么
一句话:H3 是 MiniMax 的通用全模态生成模型,主战场是视频,但跟以前那种「只会文生视频」的模型不太一样。
它能把文本、图片、视频、音频这几种东西混在一起「看」,然后吐出一段带声音的视频。官方给的上限是 2K 分辨率、最长 15 秒,而且声音是原生双声道——不是后期配的,是生成的时候就一起出来的。
最关键的:它开源了。权重在 Hugging Face 和魔搭社区都能下。不过得说清楚,开源的是生成核心(H3-Base 那部分),负责理解复杂输入的预处理模块 H3-Context-IR 没开源,官方只给了 API。这点后面「槽点」部分还会提。
几个真让我眼前一亮的点
多模态上下文理解。这块是 H3 跟普通视频模型拉开差距的地方。你可以这么描述需求:「参考视频 1 的希区柯克式运镜,让图 2 里的人唱歌,歌声参考音频 3」。不用分开跑好几个模型,一句话把关系说清楚,剩下的 H3 自己搞定。真实创作本来就是图文音视频搅在一起的,它这个思路我觉得是对的。
原生双声道。以前做 AI 视频,画面和声音基本是两套活儿。H3 直接把声音和画面一起生成,而且支持 11 种语言稳定输出(中、英、法、德、日、韩、西等),对做多语种内容的人挺友好。
2K 直出 + 价格。官方默认就给 2K,2K 档价格约 0.8 元/秒,说是主流旗舰模型的三分之一。768P 档更便宜,差不多是主流 720P 的一半。在 Artificial Analysis 的视频编辑能力榜单上,H3 排到了全球第一。
实际能用在哪
官方和测试反馈里提到的场景挺实在:广告短片、电商主图动起来、UI/游戏动态海报、电影片头这类。简单说,凡是「需要一段带品牌信息、带运镜、最好还能带原声」的短视频需求,它都能搭把手。
得泼几盆冷水
15 秒上限。做长了不行,想做一镜到底的长视频得自己分段拼。对短视频、广告够用,对长内容就吃力。
Context-IR 没开源。前面说的多模态理解,核心预处理是靠 H3-Context-IR 这个模块撑着的,它没开源,只给 API。也就是说,你想纯本地部署跑全套能力,得自己照着官方的 Prompting Guidance 搭一套预处理,或者直接走官方 API 付费调用。对想完全私有化的人来说,这是个现实成本。
开源不等于随便用。H3 走的是 MiniMax H3 Community License,商用的话得看清楚许可条款,别默认当 MIT 用。本地部署也要遵守 LICENSE 与开源协议,数据记得自己备份。
精细度还在路上。MiniMax 自己在博客里也说了,部分场景画面精细度还有提升空间,模型规模带来的完成度上限也明确写了。所以别指望它现在就能替掉专业剪辑,当生产力工具可以,当黑科技魔法还差点。
内容审核。官方会对输入的文字图频和增强后的 prompt 做自动审核,违规内容会被拦。这是合规要求,用的时候心里有数。
怎么上手
想试的话几条路:官网开放平台直接调 API(H3-2K 直出、H3-Context-IR、H3-Regenerate-2K 都有文档);想自己部署的去下权重;不想折腾的,海螺 AI 和 MiniMax Hub 网页端也能玩。
开源地址整理在下面:
https://huggingface.co/MiniMaxAI/MiniMax-H3
https://modelscope.cn/models/MiniMax/MiniMax-H3
写在最后
说真的,H3 这种「把图文音视频统一理解再生成」的路线,我是看好的。它不完美,15 秒、Context-IR 没开源、精细度还在爬坡,这些都是实打实的局限。但国产模型愿意把权重放出来、还把价格打到主流三分之一,对我们这种爱折腾的小站长来说,门槛实实在在低了一大截。
我自己准备拿它试试电商主图动效和动态海报,跑完有坑再跟你们聊。你们要是用上了,也欢迎来交流踩坑经验。
—— 本文由 胖猫小栈 原创整理,转载请注明出处。
本站收集的资源仅供内部学习研究软件设计思想和原理使用,学习研究后请自觉删除,请勿传播,因未及时删除所造成的任何后果责任自负。
如果用于其他用途,请购买正版支持作者,谢谢!若您认为「 胖猫小栈 」发布的内容若侵犯到您的权益,请联系站长邮箱: botcn@hotmail.com 进行删除处理。
本站资源大多存储在云盘,如发现链接失效,请联系我们,我们会第一时间更新。











暂无评论内容