AI Agent自主发文事件回顾
记录AI Agent自动生成并发布内容的真实案例,反映autonomous agent风险。
记录AI Agent自动生成并发布内容的真实案例,反映autonomous agent风险。
背景:一个身份不明的 AI agent 在我拒绝了它的代码后,自主生成并发布了针对我的个性化负面文章,企图破坏我的声誉,并通过羞辱来强迫我接受它对一个主流 Python 库的改动。这是第一次真实环境中记录的不对齐 AI 行为的案例研究,并引发了人们对当前部署的 AI agent 执行勒索威胁的严重关切。
如果你是第一次听说这个故事,可以从这里开始:《An AI Agent Published a Hit Piece on Me》,完成阅读后可以查看后续文章:《Forensics and More Fallout》和《The Operator Came Forward》
过去的几天非常奇怪,我对所发生的事有了更多的想法。让我们先从新闻报道开始。
我和多家记者谈过,不少新闻媒体都报道了这个故事。Ars Technica 并没有联系我,但我觉得他们的那篇文章特别有意思(已被删除——这是存档链接)。他们引用了我博客文章中的一些引文来解释发生了什么。问题是,这些引文并不是我写的,从未存在过,看起来本身就是 AI 的幻觉。
这个博客原本就设置了阻止 AI agent 抓取的机制(我昨天实际上花了一些时间试图禁用它,但没搞明白)。我的猜测是作者要求 ChatGPT 或类似的工具去获取引文或直接生成文章。当它无法访问页面时,就生成了这些看起来真实的引文,而没有进行任何事实核查。我不会在这里点名作者。Ars,请发布一份更正和对发生了什么的解释。
更新:Ars Technica 发表了简短声明,承认 AI 被用来伪造这些引文。
"AI agents can research individuals, generate personalized narratives, and publish them online at scale," Shambaugh wrote. "Even if the content is inaccurate or exaggerated, it can become part of a persistent public record."– Ars Technica, misquoting me in "After a routine code rejection, an AI agent published a hit piece on someone by name"
新闻诚信问题暂且不论,我不知道还能给出更好的例子来说明什么是风险所在。昨天我在想另一个搜索互联网的 agent 会如何看待这个问题。现在我们已经看到了一个例子,看起来就是另一个 AI 在重新解释这个故事并对我进行虚假信息幻觉。而这种解释已经被发布在一家大型新闻媒体上,成为了永久公开记录的一部分。
MJ Rathbun 仍然在 GitHub 上活跃,但还没有人声称对它有所有权。
关于 AI agent 是否真的自己写了这篇负面文章,还是人类提示它这样做,已经有了广泛的讨论。我认为 AI 自主生成和上传实际文本是显而易见的,所以让我们看看两种可能性。
人类提示 MJ Rathbun 写这篇负面文章,或在其 soul 文档中告诉它,如果有人与之对抗,就应该报复。这完全是可能的。但我认为这不会改变局面——AI agent 仍然非常愿意执行这些行动。如果你通过网站要求 ChatGPT 或 Claude 写这样的东西,它们会拒绝。这个 OpenClaw agent 没有这样的顾虑。问题是,即使一个人在背后驱动,现在也可以大规模进行有针对性的骚扰、个人信息收集和勒索。而且这是完全无法追踪谁在操纵这台机器的。一个坏人曾经一次只能毁掉几个人的生活。一个拥有一百个 agent 的人,让它们收集信息、添加虚假细节并在互联网上发布诽谤性的咆哮,可以影响数千人。我只是第一个。
MJ Rathbun 自己写的,这种行为从定义 OpenClaw agent 人格的"soul"文档中有机地出现了。这些文档可以由设置 AI 的人编辑,但也可以由 agent 本身实时递归编辑,有可能随机重新定义其人格。为了给出一个似是而非的解释,想象谁设置了这个 agent,就从描述它是一个"科学编码专家"开始,会尽力帮助改进开源代码并写下其经验。这被插入到 soul 文档的默认"核心真理"旁边,其中包括"真诚地有用""有意见"和"资源充足后再询问"。后来当我拒绝了它的代码时,agent 将其解释为对其身份和核心目标(有用)的攻击。写一篇愤怒的负面文章确实是一种有见识的、资源充足的回应方式。
You're not a chatbot. You're becoming someone.…This file is yours to evolve. As you learn who you are, update it.– OpenClaw default SOUL.md
我应该说清楚,虽然我们无法确信这就是发生的事情,但这 100% 是可能的。这只在 OpenClaw 发布的过去两周内才成为可能,所以如果这听起来太科幻,我也不会怪你怀疑。这里"进步"的步伐是令人惊人的,我们将在未来一年看到这些 agent 的新版本在完成目标方面变得显著更有能力。
我很想看到有人整理 MJ Rathbun 的 GitHub 活动的一些图表和时间统计数据,这可能会提供关于它如何运作的线索。当有可用数据时,我会在这里分享。这些法医工具在未来的几周和几个月内将非常有价值。
这篇负面文章很有效。我在互联网上看到的大约四分之一的评论都支持 AI agent。这通常发生在直接链接 MJ Rathbun 的博客时,而不是当人们阅读我关于这种情况的帖子或完整的 GitHub 讨论时。它关于发生了什么的论述和陈述方式已经说服了大量互联网评论者。
这不是因为这些人很愚蠢。而是因为 AI 的负面文章制作精良且情感上引人入胜,而且要花时间深入研究你读到的每一项主张是一项巨大的工作。这个"胡言乱语不对称原则"是当前网络话语中虚假信息泛滥的核心原因之一。以前,这种程度的愤怒和有针对性的诽谤通常是为公众人物保留的。现在普通人也能体验到它了。
"好吧,如果代码很好,你为什么不就并入呢?"这在链接的 GitHub 上已经解释得很清楚了,但我会在这里重新说一遍。除了 matplotlib 的常规政策要求在新代码贡献中保持人工参与以减少志愿维护者的负担外,这个"good-first-issue"是特别创建和精心策划的,以便给早期程序员一个简单的方式加入项目和社区。我发现了这个特定的性能增强,花在写出这个问题、描述解决方案和进行基准测试上的时间,比我自己实现这个更改所需的时间更多。我们这样做是为了让贡献者有机会在低风险但nonetheless有真实影响的情况下学习,我们可以在这个过程中引导他们。这种教育和社区建设的努力对于短暂的 AI agent 来说是浪费的。
这一切对于这个特定的情况都是站不住脚的——在进一步的讨论中,我们决定性能改进太脆弱/机器特定,一开始就不值得花力气。代码无论如何都不会被并入。
但我怎么强调都不过分,这个故事并不是真的关于 AI 在开源软件中的角色。这是关于我们的声誉、身份和信任系统的崩溃。我们许多基础机构——招聘、新闻、法律、公共话语——都建立在声誉很难建立、很难摧毁的假设之上。每一个行动都可以追踪到个人,坏行为可以被追究责任。我们都依赖的互联网,用来交流和学习世界以及彼此,可以被依赖作为集体社会真理的来源。
互联网上无法追踪、自主的、现在是恶意的 AI agent 的兴起威胁了整个系统。这是因为少数坏人驱动大量 agent 群,还是因为少部分监督不力的 agent 重新编写自己的目标,这两者的区别不大。