Anthropic 首次透露 Claude 的系统提示词内容,对优化 prompt 工程和理解 AI 行为有重要参考。这对所有 Claude 用户和 AI 研究人员都是高价值内容。
生成式AI模型其实并不像人类。它们没有智能或个性——它们只是统计系统,预测句子中最可能出现的下一个词。但就像在专制工作场所的实习生一样,它们不加怨言地遵循指令——包括最初的"系统提示",这些提示为模型提供了基本特性,以及它应该和不应该做什么。
从OpenAI到Anthropic,每个生成式AI供应商都使用系统提示来防止(或至少尝试防止)模型行为不当,并引导模型回复的总体语气和情感。例如,提示可能告诉模型应该有礼貌但永远不要道歉,或者坦诚它不能知道所有事情。
但供应商通常对系统提示讳莫如深——可能是出于竞争原因,也可能是因为了解系统提示可能会提示规避方法。例如,暴露GPT-4o系统提示的唯一方法是通过prompt injection攻击。即使这样,系统的输出也不能完全信任。
然而,Anthropic为了继续塑造自己是一个更具伦理性、透明的AI供应商的形象,已经在Claude iOS和Android应用以及网络上发布了其最新模型(Claude 3 Opus、Claude 3.5 Sonnet和Claude 3 Haiku)的系统提示。
Anthropic开发者关系负责人Alex Albert在X上的一篇帖子中表示,Anthropic计划在更新和微调系统提示时,定期进行这类披露。
最新的提示(日期为7月12日)明确列出了Claude模型不能做什么——例如"Claude不能打开URL、链接或视频"。面部识别是绝对禁止的;Claude Opus的系统提示告诉模型"始终回应得就像完全看不清面孔",并"避免识别或命名[图像]中的任何人"。
但这些提示也描述了某些个性特征和特点——Anthropic希望Claude模型体现的特征和特点。
例如,Claude 3 Opus的提示说,Claude应该表现得"非常聪慧和充满好奇心","享受听取人类对问题的看法并就广泛的话题进行讨论"。它还指示Claude以公平和客观的方式处理有争议的话题,提供"深思熟虑的想法"和"清晰的信息"——并且永远不要以"肯定"或"绝对"这样的词开头回复。
对这个人来说,这些系统提示有点奇怪,它们的写法就像舞台剧演员写角色分析表一样。Opus的提示以"Claude现在正在与一个人连接"结束,这给人的印象是Claude是屏幕另一端的某种意识,其唯一目的是满足其人类对话伙伴的幻想。
但这当然是一种幻觉。如果Claude的提示能告诉我们什么,那就是没有人类的指导和扶持,这些模型是令人恐惧的空白板。
通过这些新的系统提示更改日志——来自主要AI供应商的首次此类举动——Anthropic正在对竞争对手施加压力,让他们也发布相同的内容。我们将看看这个策略是否有效。