洱海新闻

中国AI,为何越强越开源

来源:洱海新闻 分类:科技
中国AI,为何越强越开源

「01、」

文章配图-1

“Bravo to MiniMax(向MiniMax致敬)”

这句由Stable Diffusion创始人Emad Mostaque在社交平台上发出的赞叹,时间定格在8月3日。当MiniMax正式放开视频模型H3的核心权重后,这份赞赏不胫而走。

回溯四年前,Stable Diffusion初次将高质量图像生成的钥匙从少数公司的支配下解放出来,送到了全球开发者和创作者的手中。彼时,硅谷顶级投资机构a16z的合伙人Justine Moore亦是震惊之中,难以抑制激动的心情,分享了她的实测体验。

一年半时间里,Justine Moore用一道难题不断审视AI视频模型的表现:让画面里的男子用粉笔在黑板上写下“Hi”。在H3问世前,这个看似简单的任务,从无模型能成功完成。

对人类而言,不过是寻常举动;对视频模型来说,却是一大技术难关。它必须在连续画面中,同时处理手、粉笔与黑板的互动细节,还要理清笔画出现的时序,并保证写出的字母不会因画面变化而变形或消失。

Emad Mostaque作为生成式AI开放运动的代表人物,Justine Moore作为产业竞争的敏锐观察者,都对一家中国公司给予如此高的评价,这显然并非仅仅因为市面上多了一个顶尖视频模型。

真正引人注目的,是一个过去很少同时出现的组合:全球顶尖的视频生成水平,不再局限于闭源产品或高价接口,而是以开源的形式分享给了开发者。

这让人不由想起2025年DeepSeek-R1发布时带来的开源冲击。

从文本到视频,中国AI企业的持续开放,正将单点突破提升为明确的技术路线。

视频,曾是AI领域最难啃的一块骨头

过去几年,开源语言模型的发展路径逐渐清晰可见。

从美国的Llama到中国的DeepSeek,开源模型的表现不断提升,与此相关的量化、微调和本地部署工具也日趋完善。如今,个人开发者乃至企业,在本地部署一个具备实用功能的语言模型,已不再是什么稀奇事。

视频生成赛道却呈现出不同的局面。

文本模型输出的主要是一串符号,而视频模型则需要同时应对空间和时间维度。视频中的人物,在数百帧连续画面里不能突然更换脸庞;服饰、场景与光线不能随意跳变;动作必须连贯前后状态;镜头更要精准执行创作者的意图。

若要做到音画同步,对白、环境音与配乐还需与画面进行毫秒级的时空契合。

这种复杂性,使得视频成为生成式AI中计算需求最重、工程链条最繁琐的领域之一。视频生成不仅推理负担沉重,容错率也极低——文字写错一句还可以局部修改,视频动作失误却往往意味着整个项目重来,先前投入的算力付诸东流。

因此,前沿的视频生成技术长期主要掌握在云端产品和付费接口中。视频赛道的开源模型并非不存在,但真正难得的是:一个开源模型,能否同时站在全球商业竞争的最前沿?

MiniMax发布的H3正是跨过了这道门坎。

在全球AI模型评测平台Artificial Analysis的最新排名中,H3的视频编辑能力排名榜首,文生视频能力位列第二,图生视频能力则排在第三位;在视频模型对战平台Arena的比拼结果里,它在文生视频和图生视频两大类别中都是顶尖的开源模型。

更值得称道的是性能与成本的平衡点。Artificial Analysis的数据揭示了H3的2K音视频生成价格约为每分钟7.8美元,这个定价低于当时市面上多款1080p的主流商业模型,在质量与价格的权衡中占据主导地位。

在以前,音画同步直出本就是闭源模型的核心竞争力之一。H3却将行业顶尖的性能、极高的性价比和完全开源的特性集于一身,实现了视频领域的DeepSeek式突破。

用户还能在同套系统内,同时输入图片、视频和音频作为参考素材,让模型完成从画面生成到声音匹配的完整工作流程,而过去这通常需要借助多个模型和软件反复切换。MiniMax开放的

相关推荐