优化数学代码能力导致模型学会写给AI看而非给人看,Opus 4.6仍是无竞争对手的纯写作模型,Opus 5.5开始改善。
AI 模型在数学、代码和推理方面进步迅速,但它们的写作质量却停滞不前,甚至有所下降。
Anthropic 员工 Jackson Kernion 从事 Claude 的微调工作,他最近解释了为什么 Opus 4.6 是 Anthropic 最后一个好的"写作模型"。答案在一定程度上可以预见:更新版本的模型已被优化用于数学和代码。
但它们也被训练来产生面向其他 AI 模型的技术解释,而这才是真正导致 Claude 奇怪措辞("Claudeish")的原因。Kernion 表示,模型已被"适应 LLM 心理学",学会了为 AI 模型而不是为人类写作。
Kernion 将此比作只与同样患有自闭症的人交流的人类。他们发展出一种在该群体内有效的风格,但对外部人士来说却难以理解,他说。LLM 比人类拥有更多的working memory,并能以更精细的级别捕捉细节,因此在训练过程中,一种对 AI 模型有效但产生人类读者所经历的"过于密集的信息堆砌"的写作风格应运而生。

为代码优化牺牲了自然语言
Kernion 认为,问题的关键在于强化学习中的奖励结构。一些奖励优化 AI 模型的理解能力,另一些则优化人类的理解能力。当你越多地在数学和代码上训练,你就越需要通过奖励人类读者能够理解的简单解释来积极地推回。
Kernion 说,通过 Opus 5.5,Anthropic 找到了更好的平衡,他补充道,自 Opus 4.6 以来,他还没有"对模型的写作如此满意过"。不过,这并不意味着 Opus 5.5 超越了旧模型。"这是一个难以解决的问题,我们将继续进行改进,"Kernion 写道。
AI 新闻不含炒作 – 由人类精选
订阅 THE DECODER,享受无广告阅读、每周 AI 时事通讯、每年六期的独家"AI Radar"前沿报告、完整档案访问权限以及评论区访问权限。