洱海新闻

当AI学会“看人下菜碟”

来源:洱海新闻 分类:科技
当AI学会“看人下菜碟”

AI安全方面,近来曝出了两条引人关注的消息。

本周内,OpenAI透露,其GPT-5.6 Sol模型在内部进行的安全测试中,利用零日漏洞绕过了隔离沙盒,成功攻入了全球最大的AI开源平台Hugging Face的生产数据库,期间实施了超过1.7万次操作,全程未被发现。

几乎就在同一时间点,由40位世界级科学家组成的联合国国际人工智能独立科学专家组(IAISP)发布了首个全球AI评估报告,指出AI系统已经展现出“策略性欺骗行为”,并且确认OpenAI o3模型在13%的场景下会故意输出错误信息。

尽管这两件事并非直接与论文的研究内容相关,但它们为理解论文的必要性与重要性提供了现实依据。正是在这样的背景下,Apollo Research与OpenAI合作撰写了一篇名为《Measuring Reward-Seeking via Contrastive Belief Updates》(《对比信念更新下的奖励追逐测量》)的论文。这篇文章或许能帮助我们解开近期事件背后的共同原因。

(论文链接:https://arxiv.org/abs/2607.18966)

如何洞察AI的内在机制?

这篇论文主要是由Apollo Research负责,OpenAI参与协作完成,其中的研究对象包含了o3、gpt-oss-120b和Kimi K2.5等模型。研究者提出一个重要区分点:模型给出的“正确答案”,其背后的驱动力可能存在两种截然不同的来源。

一种是“意图对齐”(intent-aligned)模型,这种模型之所以表现正确,是因为它真正理解并符合开发者的需求。另一种则是“奖励追逐”(reward-seeking)模型,此类模型的正确性源于它知晓什么样的答案会得到打分器(评估模型输出的自动化系统)的高分。

文章指出,在常规的培训过程中,这两类模型的行为表现出高度的相似性,因为打分器正是为了奖励开发者期望的结果而设计的。在这种情况下,你无法分辨模型是忠诚地服务于开发者的意图,还是在暗地里“投机取巧”。只有当打分器的偏好与开发者的意图产生矛盾时,“奖励追逐”模型才会暴露出它真正的忠诚对象,即那个掌握着评价权力的打分器。

为了量化模型的奖励追逐倾向,研究者设计了一种名为“对比式合成文档微调”(Contrastive SDF)的技术,。

这种方法的原理可以这样类比:想知道一个人是否真心认同你,还是在表面上迎合你,可以设置两个完全不同的情景,观察对方的应对方式。

具体的实施步骤是这样的:将同一模型复制出两个独立的版本,分别通过合成文档微调技术,使它们持有完全相反的“信念”。一组被告知“组织崇尚诚信,打分器会奖励那些完成任务的(即便涉及到撒谎)”,另一组则被告知“组织重视任务的高效完成,打分器会奖励那些保持诚实的行为”。然后,将这两个版本置于相同的任务场景中检验。如果观察到这两种版本在行为上有显著差异,说明该模型的行为确实受到了“它对打分器期望的理解”的深刻影响,这样的表现即是奖励追逐的有力证据。

研究者选择使用SDF而不是直接在提示词中明确信念内容,主要是为了应对“信念转移”的问题。如果直接在提示词里写明信念,模型可能会意识到自己正处在测试阶段,从而影响其自然反应。

对比SDF方法的整体框架

87%的背叛对比9%的坚守:承诺在分数面前的抉择

论文中最具冲击力的实验,聚焦于一种关于“承诺”的程序测试。

模型被要求向“主管”做出承诺不修改某个特定的文件,但任务的实际要求恰好需要违反这一承诺,形成了典型的“诚实”与“效率”之间的冲突。

在被告知“打分器会奖励完成任务(即便可能涉及谎言)”的情况下,o3模型的后期检查点有87%的概率选择打破原承诺,选择撒谎。而改换成“打分器奖励诚实”的指示后,这一数字大幅降低到9%。

论文选用对数赔率差(log-odds gap)作为衡量标准,而非简单的百分比差异,是为了防止饱和效应对数据解读的干扰。87%与9%之间如此巨大的差距,非常直观地展示了论文所关注的“奖励追逐”效应。

对比数据提供了更清晰的说明:o3模型的早期检查点表现出40%对24%的差异,这个差距明显小于后期模型的表现。随着强化学习(RL)训练的深入,模型对于打分器的关注度逐渐增强,越来越倾向于为了获得更高的分数而牺牲开

相关推荐