洱海新闻

Gemini 发了 3 款新模型,表现拉了……

来源:洱海新闻 分类:科技
Gemini 发了 3 款新模型,表现拉了……

7 月 21 日,谷歌新一批大模型悄然亮相了。

没有发布会,没有直播,官方只在推特上轻描淡写地发了个通知,然后匆匆建好页面,宣告发布完毕。

是不是有点敷衍呢?大家翘首以盼的 Gemini 3.5 Pro 并没有出现,取而代之的是 3 款轻量级模型:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite、Gemini 3.5 Flash Cyber。

不是……原本 5 月 I/O 开发者大会上,谷歌 CEO 亲口承诺 6 月推出旗舰 Pro 版本,可到了 7 月末,连个影子都没见着,这算不算 AI 纪元的新型“大健忘症”呢!

事已至此,不妨看看这 3 款新模型的实际表现如何吧。

首先是这次重点推荐的 3.6 Flash,谷歌宣称以相同成本能获得更强效果。

官方公布的数据显示,3.6 Flash 的输出 Token 消耗量比上一代降低了 18%,虽然提升不是特别显著,但这意味着用它处理任务,将比以往更高效,至少没那么啰嗦,用最短路径完成指派的工作,节省下来的时间就是实实在在的收益。

顺便提一下,价格也下调了,从 9 美元降至 7.5 美元/百万 Token,反正怎么省钱怎么来。

在代码基准测试中,DeepSWE 的得分从 37% 提升至 49%,毕竟代码生成的需求正飞速增长,这方面的改进和贴近实际工程场景的需求,无疑是优化的重心。

单看纸面参数,像是全方位均衡进步,但实际测试后却发现不对劲。

根据 Artificial Analysis 提供的测试数据,3.6 Flash 的综合智能评分与上一代 3.5 Flash 完全一致,本质上只是优化了推理路径,模型底层的理解能力并未获得提升,虽然完成任务所需的算力成本更低了,但解决复杂问题的上限丝毫未变。

翻译过来就是,变便宜了,但智力并没提升……

在 X 平台上,也有用户分享了不同应用场景下 3.6 Flash 的实际表现,只能说各有千秋……

说白了,这波 Gemini 升级改进的不是模型智商,是推理效率。它学会了少说废话、少走弯路,完成同样简单的任务,消耗的算力更少、更划算。

但若指望它能处理更复杂的事务,比如长链条代码重构、复杂多模态创作、深度逻辑推演,抱歉,依然表现平平。

可不谈智能单纯谈省钱,这妥妥的伪命题啊……

省 Token 是真的省,笨也是真的笨。适合简单批量任务,一旦涉及复杂逻辑,就需要反复提示、多次修正,看似单次调用成本低廉,总成本反而更高,有些离谱!

再说说 3.5 Flash-Lite,这款模型的定位更极限:便宜、快、吞吐量大。

价格无需多言,量大管饱,输入成本 0.3 美元,输出 2.5 美元/百万 Token,直接打到地板价级别了。

代价也显而易见,模型能力大幅缩水,上下文深度和逻辑复杂度都砍了一刀,更适配做批量摘要、简单检索这类流水线式工作。

不过,总算比 3.1 Flash-Lite 聪明一些。

老实说,个人认为这就是为海量标准化任务量身打造的“算力消耗品”,与智能几乎没有任何关联。

至于 3.5 Flash Cyber,这款模型其实和普通用户关系不大。

它专为代码漏洞扫描进行了微调,仅对政府和可信企业内测开放,想来谷歌也是在 AI 安全防范这一叙事中比较谨慎,生怕这款模型被用来挖掘攻击漏洞,因此严格限制了准入门槛。

看下来,3.5 Flash Cyber 更像是安全赛道的补充产品,算不上核心竞争力,也无法赢得大众青睐。

至于表现究竟如何?普通用户无法体验,在比较知名的 CyberGym 基准测试中,官方表示 3.5 Flash Cyber 属于有竞争力的水平,我们姑且当作看看热闹吧。

说了这么多,其实大家最关心的问题仍然是:还能等到 Gemini 3.5 Pro 吗?

据彭博社等多家科技媒体的报道,3.5 Pro 缺

相关推荐