AI智能体自反思机制显著提升环境适应性
斯坦福研究证明具备自反思能力的AI agents在动态环境中表现更优。这对设计更智能、更鲁棒的自主系统有重要启示。
斯坦福研究证明具备自反思能力的AI agents在动态环境中表现更优。这对设计更智能、更鲁棒的自主系统有重要启示。
在现实世界中,变化发生得很快。Stanford研究人员基于对小鼠的研究,发明了"curious replay"训练方法,帮助AI agents成功地探索和适应不断变化的环境。
在一场对决中,你会选择谁获胜——一个最先进的AI agent还是一只小鼠?Wu Tsai神经科学研究所的跨学科博士后学者Isaac Kauvar和Stanford的机器学习研究员Chris Doyle决定让他们竞争一下来找出答案。在Stanford教育研究生院助理教授Nick Haber的实验室中,Kauvar和Doyle基于他们长期以来对动物自然擅长的技能——探索和适应周围环境——的兴趣,设计了一项简单的任务。
Kauvar把一只小鼠放在一个小的空盒子里,同样地把一个模拟的AI agent放在一个空的3D虚拟竞技场中。然后,他在两个环境中都放置了一个红球。Kauvar测量了哪个会更快地探索这个新物体。
测试表明,小鼠迅速接近球,并在接下来的几分钟内不断与其互动。但AI agent似乎没有注意到它。"这是出乎意料的,"Kauvar说。"我们已经意识到,即使使用最先进的算法,性能上也存在差距。"
这些学者思考:他们能否以这些看似简单的动物行为作为灵感来改进AI系统?
这个问题促使Kauvar、Doyle、研究生Zhou Linqi和Haber设计了一个新的训练方法,称为curious replay,该方法使AI agents能够对它们最近遇到的最新颖和最有趣的事物进行自我反思。只需添加curious replay,AI agent就能以更快的速度接近和与红球互动。此外,它在一个基于Minecraft的游戏Crafter上显著提高了性能。该项目的结果目前发表在预印本服务arXiv上,将在7月25日的国际机器学习会议上发布。
也许看起来好奇心只提供智力上的好处,但它对我们的生存至关重要,包括避免危险情况和寻找食物和住所等必需品。实验中的那个红球可能在泄漏致命毒物或遮盖营养丰富的食物,如果我们忽视它,就很难找出是哪一个。
这就是为什么像Haber这样的实验室最近一直在添加好奇心信号来驱动AI agents的行为,特别是基于模型的深度强化学习agents。这个信号告诉他们选择将导致更有趣结果的行动,比如打开一扇门而不是忽视它。
查看完整研究:Curious Replay for Model-based Adaptation
但这一次,团队以一种新的方式将好奇心用于AI:帮助agent学习它的世界,而不仅仅是做出决定。"我们不是想选择做什么,而是想选择思考什么——我们想从过去的哪些经历中学习,"Kauvar说。换句话说,他们想鼓励AI agent以某种方式对其最有趣或最奇特(因此与好奇心相关)的经历进行自我反思。这样,agent可能会被促进以不同的方式与物体互动以了解更多,这将引导它对环境的理解,也许还会鼓励对其他项目的好奇心。
为了以这种方式实现自我反思,研究人员修改了一种常用的训练AI agents的方法,称为experience replay。在这里,agent存储其所有交互的记忆,然后随机重放其中一些来再次从中学习。它受到了睡眠研究的启发:神经科学家发现一个称为海马体的大脑区域会"重放"当天的事件(通过重新激活某些神经元)来加强记忆。在AI agents中,experience replay在环境很少改变且对正确行为给予明确奖励的场景中导致了高性能。
但要在变化的环境中成功适应,研究人员认为,AI agents优先重放最有趣的经历——比如新红球的出现——而不是一次又一次地重放空虚拟房间会更有意义。
他们将新方法命名为curious replay,并发现它立即工作。"现在,突然之间,agent与球的互动速度快得多,"Kauvar说。
但他们没有止步于此。他们还将curious replay添加到玩名为Crafter的游戏的AI agents中,这是AI agents创意问题解决的标准测试,其中——很像在Minecraft中一样——agents必须通过学习如何收集木材和石头、制造镐子和收集铁来制造额外工具来解决如何生存和适应的问题。curious replay方法将当前最先进的成绩从大约14提高到19(人类通常得分约50)——仅通过"这一个改变",Kauvar说。
curious replay方法在简单和复杂任务中的成功表明,它对于今后的大量AI研究将很重要。"这项工作的总体目标——制造能够利用先前经验并通过有效探索新的或不断变化的环境来很好地适应的agents——将导致更多的自适应、灵活的技术,从家用机器人到个性化学习工具,"Haber说。
Kauvar的博士后工作由Haber和神经科学家Karl Deisseroth共同指导,Deisseroth是生物工程和精神病学系的D.H Chen教授,他很兴奋能够继续从动物行为中获取灵感来改进AI系统的主题——他计划继续在更复杂的任务上测试小鼠和AI agents,以比较它们的行为和能力。"很多人嘴上说受到动物启发,但我们在这里建立了一座直接的桥梁——不是模糊的桥梁。我们试图做完全相同的[任务],"他说。
Kauvar希望这样的工作将帮助"闭合"AI研究和神经科学之间的循环,并益于我们对动物行为和底层神经过程的理解。"你可以想象,这整个方法可能会产生从未想过的假设和新的实验,"他说。
Stanford HAI的使命是推进AI研究、教育、政策和实践,以改进人类状况。