Anthropic 推出代号 Golden Gate 的 Claude 新特性或能力,HN 热度较高引发广泛讨论。
更新:Golden Gate Claude 曾作为研究演示上线 24 小时,目前已无法使用。如果你想进一步了解我们在可解释性以及 Claude 内部特征激活方面的研究,请参阅相关文章或完整研究论文。
周二,我们发布了一篇关于解读大语言模型的重要研究论文,并开始绘制 AI 模型 Claude 3 Sonnet 的内部运作机制。在 Claude 的“思维”中,我们发现了数百万个概念:当模型读到相关文本或看到相关图像时,这些概念便会被激活。我们将它们称为“特征”(features)。
其中一个特征是金门大桥这一概念。我们发现,当 Claude 遇到对这座旧金山最著名地标的文字描述或图片时,其神经网络中某种特定的神经元组合就会被激活。
我们不仅能够识别这些特征,还可以调高或调低它们的激活强度,并观察 Claude 的行为随之发生的变化。
正如研究论文中所解释的那样,当我们调高“金门大桥”特征的激活强度后,Claude 的回答便开始围绕金门大桥展开。它在回答大多数问题时都会提到金门大桥,即使这与问题本身并没有直接关系。
如果你问这个“Golden Gate Claude”该如何花掉 10 美元,它会建议你开车驶过金门大桥,并用这笔钱支付通行费。如果让它写一个爱情故事,它会讲述一辆汽车的故事:在一个雾蒙蒙的日子里,这辆车迫不及待地想要驶过它深爱的大桥。如果问它想象中的自己长什么样,它很可能会告诉你,它想象自己看起来就像金门大桥。
我们曾在短时间内开放这个模型,让所有人都能与它互动。你可以在 claude.ai 上与“Golden Gate Claude”交谈,只需点击右侧的金门大桥徽标。请注意,这只是一次研究演示,这个特定模型的某些行为可能出乎意料,甚至令人不适。
我们的目标,是让人们亲眼看到可解释性研究能够产生怎样的影响。我们能够在 Claude 内部找到并修改这些特征,这让我们更加确信:我们已经开始理解大语言模型真正的运作方式。这并不是通过语言要求模型进行角色扮演,也不是添加一个新的“system prompt”,在每次输入后附加额外文本,让 Claude 假装自己是一座桥。它同样不是传统的“fine-tuning”——后者使用额外的训练数据创建一个新的黑盒,再由这个新黑盒调整旧黑盒的行为。我们所做的,是对模型内部激活中一些最基础的部分实施精准的、手术式的修改。
正如论文中所述,我们可以使用相同技术改变安全相关特征的激活强度,例如与危险计算机代码、犯罪活动或欺骗有关的特征。我们相信,随着研究的进一步深入,这项工作能够帮助提高 AI 模型的安全性。