新智元披露了当前AI写作领域正遭遇的困境。据称,机器智能水平提升的同时,生成文本的品质却面临滑铁卢。
行业内普遍观察到,尽管模型能力节节攀升,但文本质量却在走下坡路。这些系统能在适当位置插入要点建议,应用小标题,并在最后附上总结性陈述。但读者读完后往往记忆空空。
剑桥大学博士后Adam Hunt对此现象早有察觉。这位专注于演化精神病学与人类演化的研究者,原本对AI技术持积极态度。然而在7月28日,他在一篇长文坦言,目前心态趋于悲观。
过去曾流行的观点认为,模型能力发展如同尖峰圆,代码与数学能力先突破,继而向各个方向延伸,最终实现通用人工智能。现实情况是,代码和数学能力持续增强,而语言表达及简单推理能力却没有同样进步。
从强化学习角度分析,这一现象几乎不可避免。前几代大型语言模型看似全面发展,实际是因为训练素材涵盖所有领域,从诗集到学术论文,整个互联网成为数据来源。但这种情况并非模型真正的理解力体现。
思维链与网页搜索技术的出现,为模型延续了生命力。这条道路最终却遭遇瓶颈。急于突破的AI企业将目光投向代码领域。原因很简单,代码拥有海量可用的训练数据。GitHub平台上的代码提交、审查、PR等过程为模型提供了丰富素材。而且代码存在明确反馈机制:程序能运行即代表成功。
而文章创作呢?如何对"一段散文好不好"进行自动评分?缺乏有效奖励机制,基于强化学习的训练无法朝这个方向优化。于是所有训练资源都流向代码领域,语言表达只能依赖预训练阶段积累的残存实力。但老本越吃越少,即便为了配合其他领域提升,也可能出现性能退化。
这正是古德哈特定律容易显现时刻。当某个指标作为训练目标,它就无法准确反映真实能力。实验室通过基准测试优化模型,再采用同类测试验证性能。榜单上准确率持续上升,但实际使用体验可能停滞甚至下降。
现在模仿能力也受到限制。模型能力退化的同时,还出现了新问题。曾经屡试不爽的提示词突然失效。这些提示词并不复杂:指定某位作家,要求增加对话、丰富细节、避免碎句。过去只需告知作家姓名,模型就能生成接近其文风的文本,无需额外说明句长、节奏、视角等细节。如今这类提示完全失效。Ars Technica测试了斯蒂芬·金、J.K. 罗琳等作家,Engadget测试了阿加莎·克里斯蒂,ChatGPT全都拒绝模仿。若不指定具体作家,只要求"悬念强度"、"叙事节奏"、"对话密度"等抽象特征,模型仍可输出,但风格大变。
AI写作的黄金时代宣告终结。这场争议已经改变用户对AI写作的基本预期。模型未必会持续提高写作水平,提示词也不再长久有效。平台规则调整后,围绕特定模型构建的完整写作流程,随时可能崩塌。
不过AI写作不会消失,它仅回归工具属性。这类系统能辅助查资料、理结构、改句子,但无法替代人类决定写作主题与目的。换言之,人类经验、判断能力与创作欲望,正变得愈发重要。
参考资料:
https://arstechnica.com/ai/2026/07/chatgpt-stops-cloning-famous-writers-voices-but-may-capture-a-similar-feeling/
编辑:摩西
秒追ASI








