ARC Prize 百万级奖金 AGI 竞赛公开招募
面向全球开发者的前沿 AI 能力竞赛,奖金规模大。对有志参与 AGI 研究的程序员有吸引力。
面向全球开发者的前沿 AI 能力竞赛,奖金规模大。对有志参与 AGI 研究的程序员有吸引力。
为开放 AGI 进展而举办的超过 100 万美元的竞赛。
现代 AI(LLM)被证明是优秀的记忆引擎。它们能够记忆训练数据中的高维模式,并将这些模式应用到相邻的上下文中。这也是它们表观推理能力的工作原理。LLM 实际上并不进行推理。相反,它们记忆推理模式,并将这些推理模式应用到相邻的上下文中。但它们无法基于新颖的情况生成新的推理。
更多的训练数据让你能在基于记忆的基准测试(MMLU、GSM8K、ImageNet、GLUE 等)上"购买"性能。但仅有记忆并不是通用智能。通用智能是有效获得新技能的能力。
更大的规模不会让 LLM 学习新的技能。我们需要新的架构或算法,使 AI 系统能够在测试时学习。这就是人类能够适应新颖情况的方式。
除了 LLM,多年来我们已经有 AI 系统能够在扑克、国际象棋、围棋和其他游戏中击败人类。然而,没有为一款游戏成功训练的 AI 系统可以简单地针对另一款游戏进行再训练。相反,研究人员必须为每款游戏重新架构和完全重新构建新系统。
这是泛化能力的失败。
没有这种能力,AI 将永远受到循环中人类通用智能的速率限制。我们想要能够与人类一起发现和发明的 AGI,以推动人类向前发展。
考虑到过去 4 年 LLM 的成功和已证实的经济效用,上述观点可能看起来像是过分大胆的主张。强有力的主张需要强有力的证据。
由 François Chollet 在其有影响力的论文《论智能的衡量》中引入的 ARC-AGI 是唯一衡量通用智能的 AI 评估:一个能够有效获得新技能并解决新颖的、开放式问题的系统。
ARC-AGI 创建于 2019 年,当时的最先进(SOTA)高分是 20%。如今只有 34%。
然而人类——甚至儿童——可以快速掌握任务。
ARC-AGI 对人类来说很容易,对现代 AI 来说是不可能的。
大多数 AI 基准测试快速饱和到人类性能水平,因为它们只测试记忆,而 AI 在这方面是超人类的。
ARC-AGI 没有饱和,实际上当前的进度在放缓。它被设计用来抵抗记忆化,并且已被证明对最大的基础 Transformer 模型以及专门设计用来击败 ARC-AGI 的定制 AI 系统都极具挑战性。
ARC-AGI 的解决方案至少开启了一个全新的编程范式,其中程序可以从任意一组先验知识中完美且可靠地泛化。我们还相信这个解决方案是通往 AGI 的关键路径。
如果你认同需要新的想法,让我们考虑一下如何增加新想法的产出率。不幸的是,AI 的趋势走错了方向。
从 GPT-4 发布开始,前沿 AGI 进展转向了闭源。GPT-4 技术报告令人惊讶地不包含任何技术细节。OpenAI 表示"竞争"原因是首要原因。谷歌的 Gemini 技术报告也对长上下文窗口前沿创新没有技术细节。
LLM 还将大部分研究关注力转移到了新架构和新算法之外。2023 年超过 200 亿美元投入了非通用 AI 公司,许多前沿 DeepMind 研究人员被重新安排到 Gemini(以便与 OpenAI 竞争)。
领先的实验室有强烈的动机大声宣称"规模就是一切"和"不要试图在前沿研究上与我们竞争",尽管他们都在私下里相信需要新想法才能到达 AGI。他们的赌注是他们可以在自己的实验室内发现所有必要的新想法。
但让我们看看 LLM 的历史。具体来说是 Transformer 架构。Transformer 是从多年的机器翻译研究(如英文到西班牙文)后出现的。
2014 年:Sutskever 等人(谷歌)发布了使用 RNN 和 CNN 进行序列到序列学习的论文,用于变长输入 vs 输出(英文和西班牙文单词的长度不同)。
2016 年:Bahdanau 等人(雅各布大学)推广了"注意力"的概念,使系统能够考虑输入的不同部分来预测输出(英文形容词在名词之前,西班牙文在之后)。
2017 年:Vaswani 等人(谷歌)意识到"注意力就是你所需的一切",放弃了 RNN 和 CNN,优化了架构,实现了新的规模。
2018 年:Radford 等人(OpenAI)在 Transformer 架构的基础上创建了在前沿规模上的 GPT-2,展示了涌现能力。
Transformer 的故事就是科学的故事。来自不同实验室和团队的研究人员发布论文并在彼此的工作基础上进行构建。
虽然一个实验室可能单独发现 AGI 是可能的,但可能性极小。如果我们接受现状,全球发现 AGI 的机会已经降低,并将继续降低。
在过去的一年里,我与许多年轻学生和有志研究人员进行了交谈。许多人感到沮丧。有一种恐惧感,即一切都已经被想出来了。但这并不是真的!AI 生态系统在故意讲半真半假的故事,以提升其相对竞争地位,而损害了 AGI 的实际进展。
更糟的是,不准确的"规模就是一切"信念现在影响了 AI 监管环境。监管机构在错误的假设下(即 AGI 迫在眉睫)考虑对前沿 AI 研究的障碍。事实是没有人知道如何构建 AGI。
我们应该尝试激励新想法,而不是减缓它们。互联网和开源是世界上最强大的创新引擎。
通过激励开源,我们增加了新想法的产出率,增加了我们发现 AGI 的机会,并确保这些新想法广泛分布,以建立小型和大型 AI 公司之间更平衡的竞争环境。
我们希望 ARC Prize 能帮助抵消这些趋势。
由 Mike Knoop 和 François Chollet 主持。由 Infinite Monkey 和 Lab42 呈现。
增加从事前沿 AGI 研究的人数。
推广 AGI 进展的客观衡量标准。
解决 ARC-AGI 并学习关于智能本质的新东西。
准备好在多年来首次取得重大进展了吗?无论你是谁,来自哪里,做什么工作,欢迎你加入这个竞赛。新想法可能来自任何地方。可能是你?
在此查找 ARC Prize 2024 的竞赛格式和奖励细节。
有关如何开始解决 ARC-AGI 的更多信息,请访问指南。
要了解有关 ARC-AGI 如何衡量通用智能的更多信息,请访问 ARC-AGI。
在 X/Twitter、YouTube、Email 和 Discord 上了解 ARC Prize 进展和 SOTA 解决方案的最新信息。你也可以在 team@arcprize.org 与我们联系。