洱海新闻

DeepSeek的这次小更新,原来藏着两个大招。。。

来源:洱海新闻 分类:科技
DeepSeek的这次小更新,原来藏着两个大招。。。

今天收到一位 AI 研究员的信息,她表示这是自己入行以来最棒的夏天。DeepSeek-V4-Flash 正式版已经发布,其性能表现超越了先前的 V4-Pro-Preview 版本。基准测试成绩甚至能够与 Claude Fable 5 并列比较。这个总参数为 284B、激活参数仅为 13B 的“轻量版”模型,在多项任务上的表现竟然赶平了曾经遥不可及的 Opus 4.8。更令人惊讶的是其价格,Flash 版本低到令人咋舌,仅需两块钱就能输出 100 万 tokens。她将自己手头所有的项目都进行了一遍优化,结果花费还不到一杯奶茶钱。

昨天在开发者群中,大家突然停下手中的工作,开始转发评测截图。她表示自己特别开心,有种仿佛进入了人类黄金时代的错觉。没有人预料到,DeepSeek 这次又给大家带来了一个大惊喜,卡在 7 月的尾巴上发布了 DeepSeek V4 Flash 的正式版。

说实话,一开始世超对这次更新并没有太在意。毕竟只是对一个名为 Flash 的模型进行了更新,而主力 Pro 系列则没有任何变动。上一次只更新 Flash 而不更新 Pro 模型的大模型厂商还是谷歌,如今已经成了大家的笑柄。你以为 Flash 模型再更新,能力也不可能超过 Pro 模型吧?

结果不是这样。这个 Flash 模型居然比 Pro 模型的跑分还要强?这还是 Flash 吗?

不对,DeepSeek,大模型并不是这样运作的。你应该先发布一个 Flash 模型,然后声称只是速度更快一些。你怎么直接让 Flash 模型追上了自家的 Pro 模型,而且价格还只要 2 块钱/百万 tokens,偶尔还能有打一折的缓存命中优惠。我周末使用了 1 亿 tokens,才花费了 5 块钱。

根据世超对这次 V4 Flash 亮出的跑分整理,可以发现这次 Flash 模型的能力极其惊人。不仅超过了自家的 Pro 模型,虽然比不上 Claude Opus5、GPT-5.6 Sol 以及 Kimi K3 等顶级模型,但正式版的 V4 Flash 在性能上已经与这几家不相上下。

有网友将各家大模型的能力和价格收集起来,做成一个表,整理了出来。每个大模型在表上都是一点,点的位置越靠左,说明模型越便宜;点的位置越靠上,说明模型的性能越好。从这张表可以很直观地发现,市面上绝大多数模型都处于一个尴尬的境地。性能没有 DeepSeek 好,价格却比 DeepSeek 贵。而那些性能比 DeepSeek 强的模型,情况也并没有好到哪里去,因为它们的价格实在太贵了。

同学们可能没有注意到,上面这张图的横轴不是一个线性坐标轴,而是一个对数轴。但我们在为模型花钱时,可不是这样计算的。于是世超稍微动用了一下许久未用的 PS 手段,将这张图转换成线性坐标轴,来看看真实比例是这样的:也就是说,在性能上,Claude Fable 5、GPT-5.6 Sol 等模型可能比 V4 Flash 强个两成,但这些模型的价格可能也要多两倍。可以这样夸张地说,DeepSeek 再次重新定义了模型的斩杀线。

那么,这次 DeepSeek 是如何做到的?明明模型的架构和参数都没有什么变化,为什么一个模型的能力会有如此巨大的变化?世超也是回过头去翻了翻 DeepSeek 的论文和公开资料,找到了两个可能性最大的方向。首先也是最重要的一点就是后训练。这也是官方承认的,预览版和正式版差距最大的地方。这里给对大模型不太

相关推荐