AI模型中的'孤独香蕉问题'
讨论AI系统中的一个特定问题或现象。内容较为学术化,需要查看原文理解具体含义。
讨论AI系统中的一个特定问题或现象。内容较为学术化,需要查看原文理解具体含义。
想象一下信息时代给我们带来的所有工具…
想象一下那些曾经无法治愈的疾病如今已可控制或被治愈的所有患者。想象一下通过生产力提升而产生的所有经济效益。想象一下我们表达自我和分享创意的所有渠道。想象一下推动这一革命所需的所有技能 —— 硬件工程、软件工程 —— 以及整个新知识领域的发展。
然后想象一下我们的世界被引入的所有财富不平等。想象一下持续在线的社会焦虑。想象一下对民主制度的破坏。
新技术的影响很少单纯是积极的或单纯是消极的,正因为如此,开发技术的人肩负着一种责任:需要深入思考这项技术将如何被使用。在这一责任的基础上,还有一个必要条件:深刻理解这项技术。最近 Large Language Models(LLMs)的兴起及其快速应用引发了许多问题:我们是否真的理解了这项技术?我们是否理解了它在文化、社会或经济层面将如何影响我们?
很明显,我们对编程和现有技术的经验将会让位于这项新技术所需的不同技能。对 C++ 和 Python 等语言的编程思维和技能的掌握,将让位于理解一种动态元语言的需求 —— 这种语言是从在线人类互动的模式中提取出来的。对当前技术的新要求是用 AI 从其消费输入中确定的方式来"说"语言。
在这个背景下,有一个重要认识是:LLMs 不是在产生新的或创意性的东西,而是在产生(或重现)它在所消费输入中的统计平均值,这些输入是在它被提问的背景下被消费的。理解 AI 不像我们想象的那样理解我们,这是我们在这些技术基础上开发新工具时承担责任的重要一步。
接下来的内容试图说明这一点。
我之前在这个话题上写过,我注意到的不是这些大的偏见,而是难以检测的微妙偏见,我认为这些应该更令人担忧。我最近发现了一个我认为很好地解释了我用来描述 AI 输出的短语的例子。我把它称为"孤香蕉问题"。
香蕉是很有吸引力的水果,它们有着欢快的颜色,味道也很好。多年来,我一直和一个朋友开玩笑说,由于他对香蕉的热爱,他应该在自己的业务品牌中更大程度地使用香蕉。当我注册 Midjourney 时,我看到了为他生成一个理想化的香蕉图像的完美机会。我从一个简单的 prompt 开始:"A single banana casting a shadow on a grey background"(一根香蕉投射阴影在灰色背景上)。结果如图 1 所示。
现在,眼力敏锐的人可能会注意到 Midjourney 在图 1 中生成的输出存在一个问题。虽然香蕉很漂亮,在其艺术姿态中投射阴影在灰色背景上看起来非常可口,但你可能会注意到我要求的是一根单独的香蕉,孤零零的,只有一根,但我收到的所有变体中都没有一个只包含一根香蕉。当然,我想,错误一定在我这边,我显然在 prompt 中表达得不够精确。所以,我尝试了各种变体 —— 从"a perfect ripe banana on a pure grey background casting a light shadow, hyperrealistic"(一根完美成熟的香蕉在纯灰色背景上投射轻阴影,超真实),到更具体的"a single perfect ripe banana alone on a pure grey background casting a light shadow, hyperrealistic photographic"(一根单独的完美成熟香蕉独自在纯灰色背景上投射轻阴影,超真实摄影风格),甚至强调性的(甚至恳求性的)"ONE perfect banana alone on a uniform light grey surface, shot from above, hyperrealistic photographic"(一根完美的香蕉孤独地在均匀浅灰色表面上,从上往下拍摄,超真实摄影风格)。
我把这个挑战告诉了一个朋友,他的程序员脑子远比我发达。他问我是否试过让 Midjourney 渲染一只拿着香蕉的猴子,然后问 Midjourney 想象那只猴子是隐形的。(你看,我说的程序员脑子是什么意思吧?)他(我的朋友,不是猴子)推测关于猴子拿着香蕉,或香蕉在不同背景中的数据可能会产生不同的结果。令人沮丧的结果如图 2 所示。
你说得没错,那只猴子(图 2 中的)应该看起来很尴尬!首先,它应该是隐形的,但它非常显眼……显眼地呈现了它的存在。其次,它拿的不是一根而是两根香蕉!用拿着香蕉的外星人和其他动物尝试也得到了相同的结果。有点奇怪的是,几只猴子最后要么穿着香蕉,要么被渲染成香蕉色的。
我要求 Midjourney 生成的每一张图像都包含 2 个(或更多)香蕉,似乎无论我如何提问都是这样。
我开始怀疑香蕉,就像物理标准模型中的夸克一样,可能不能自然地单独出现,通过某种模糊的结合原理,它们可能只能成对出现。我查看了厨房。实验证据表明香蕉确实可以单独出现。太好了!但事实仍然是,我无法从 AI 的输出中得到一根单独的香蕉。那么,到底发生了什么?
生成 AI 的一个问题是,理解机器"思维"内部发生的事情几乎是不可能的。有一些有趣的方法,比如 TCAV,试图给我们更多的洞察,但就像人脑一样,我们并不完全理解深度学习算法内部发生的过程。
在决定如何在现实应用中应用这类技术时,测试和理解给定输入的输出至关重要。任何学过混沌理论或听过蝴蝶效应的人都会知道,自然复杂系统对初始条件往往高度敏感。我们正在构建的 Large Language Models(LLMs)具有高度复杂的输入,形式是用于训练这些智能系统的海量数据。然而,就像 Mandelbrot 集和其他看起来复杂的分形一样,随后应用于数据以进行训练的规则是欺骗性地简单。
我认为图片中两根香蕉的偏见是微妙偏见的一个例子(好吧,它并不是那么微妙,但比我们经常看到的许多令人担忧的吸睛偏见要微妙得多)。一个天真的解释可能是,在训练数据集中,许多被标记为"banana"(香蕉)但未被标记为"two bananas"(两根香蕉)的图像已被添加到 Midjourney 的数据库中。也有可能 Midjourney 从未见过单独的香蕉,所以它不知道单根香蕉是可能的。
这里的危险在于,由于我们与 AI 互动的令人信服的本质,我们开始相信它们像我们一样理解世界。但它们不会。现阶段发展中的 AI 不像我们那样感知对象 —— 它们理解常见的模式。它们的现实从根本上不同于我们的 —— 它不是源于物理世界,而是源于逻辑世界。当然,随着 AI 后继代的发展,我们很容易与它们有互动,这些互动表明它们确实理解。我用 ChatGPT 做的一些文本分析结果绝对给人一种理解的印象。然而,没有对物理世界的感知,AI 在单根香蕉的概念面前就陷入了困境。
当然,本文的重点不是对 AI 虚拟世界中缺少单独香蕉而感到烦恼。它是指出,尽管这项技术正在快速发展,输出令人印象深刻,但仍然存在差距,虽然它们不总是立即显而易见,但它们并不小。当面对创新的速度和围绕 AI 的持续媒体炒作时,我们很容易忘记对 AI 的道德和负责任的使用。孤香蕉问题在某种意义上是 Arthur C. Clarke 的《2001:太空漫游》中 AI HAL 的一个不那么可怕的版本 —— 我没有杀死奥德赛号的船员,我只是发现了一个香蕉只成对出现的虚拟宇宙。
虽然人类在模式匹配方面是惊人的,但这种技能通过常识(在很多但不是所有情况下)、背景和对我们周围物理世界的进化且微妙的理解而得到增强。AI 还没有这些增强 —— 它们是纯粹的模式匹配能力。因此,它们只能和我们输入到训练集中的数据一样好,因此最多只能是那些输入的统计平均值。在孤香蕉问题中,统计数据表明香蕉只以两个(或更多)的形式出现,所以 AI 无法想象单根香蕉,因为进行的数据和参数调整没有允许它平均考虑这种方法。
但这种思维方式引发了某些令人不安的问题,比如:人类智能只是在与物理世界丰富关系背景下的模式匹配的结果吗?人类道德只是一种具有对自身死亡感知的模式匹配特征的结果吗?或者,是否有更深层的东西在起作用?灵感或直觉是 AI 能够通过其学到的经验或与物理世界更丰富的关系而掌握的东西吗?从哲学意义上讲,什么是创意?人类创意与机器创意有根本上的不同吗?
当然,人类创意有其局限性(且,可能矛盾的是,似乎随着年龄增长而变得更受限制 —— 正好是因为我们暴露于更多经验)。这些局限性的一些例子是,我们能感知和处理的数据量。其他则出现在我们想象超越日常经验的程度中。机器创意似乎有不同的局限性 —— 不是数据处理的局限,而是对什么可以被认为是相关或重要的限制,以及类似于人类经验的,对想象超越经验的限制。尽管 Midjourney 启动新 prompt 时使用的"imagine"命令有诱人的含义,但 AI 在多大程度上能够想象超越已被馈入的模式?
这也指向了这项技术底层性质的一个更深层问题。当编程在 1980 年代成为更主流的工作,人们开始学习计算机科学学位时,有人注意到编程需要特定的思维方式。Prompt 工程也是如此,但 prompt 工程背后的思维类型与编程不同。Prompt 工程需要深刻理解语言,不仅如此,还要深刻理解 large language model 如何理解语言。就像深度学习算法对象棋和围棋有深刻理解,因此做出令人惊讶的招数是因为他们对游戏的感知,对 large language models 和它们对世界的感知也是如此。它们对语言的使用和解释将比我们的要细致得多,充满了无数文化参考,我们任何人都不可能完全吸收。
虽然我认识到 AI 比我的简单例子所显示的复杂得多,事实上我的例子甚至可能只是不熟练 prompt 工程的一个方面,但它仍然表明在使用 AI 时必须对你的假设极其小心。它告诉你的可能不是你认为的那样,其原因也可能不是你认为的原因。
在 Digital Science,我们认为我们有责任确保我们发布的技术得到充分测试和充分理解。我们部署 AI 的使用案例必须适合我们所知道的 AI 能执行的水平,任何功能都需要附带一个"健康警告",以便人们知道他们需要寻找什么 —— 他们什么时候可以信任 AI,什么时候不应该信任。
在经历两周的绝望后,试图寻找一根孤香蕉,我在 Midjourney 中尝试了一种不同风格的 prompt(要么它学到了一些新技巧,要么我可能在"prompt 思维"方面变得更好了)。Prompt "A single banana on its own casting a shadow on a grey background"(一根香蕉独自投射阴影在灰色背景上)产生了图 3。
这表明两件事:首先,初始条件,即给定的 prompt,可能非常敏感 —— "A single banana casting a shadow on a grey background"(一根香蕉投射阴影在灰色背景上)和"A single banana on its own casting a shadow on a grey background"(一根香蕉独自投射阴影在灰色背景上)这两个短语之间的差异在语义或用词上都不大。然而,输出的准确度水平却大相径庭。其次,即使有了这种改进的 prompt 表述,加上 Midjourney 团队在前两周可能实施的任何升级,仍然有一个输出包含两根香蕉,如果你仔细观察,一个尝试的香蕉甚至在试图把自己分成两半!!