前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
返回 AI 情报前线
All News · 全部资讯9258
  • AWS Quick+ MCP模式实现大规模合规审查
  • Bedrock AgentCore为Claude Desktop添加安全网页搜索
  • SageMaker多轮RL微调搜索Agent实战
  • Asta 快速报告生成模型 AstaBrief 开源
  • GitHub:AI时代开发者需加强的三项技能
  • 状态机设计:如何让数据字段影响状态流转
  • 收据、副本、SHA:三种验证方式的本质区别
  • 心跳驱动:无存储的 Agent 健康状态追踪
  • LMCP:让 AI 编程工具直接操控 Mac 原生应用的 MCP 服务器
  • Anthropic开放Claude Code模组自定义功能
  • Meta Muse Agent登陆智能眼镜:云端Linux虚拟机运行,可代打电话/购物
  • Cloudflare AI Gateway支持网页搜索API
  • 英伟达DGX Spark 64GB版4999美元开售,支持4机集群扩展
  • DGX Spark深度解析:vLLM/llama.cpp专项优化,Perplexity已适配
  • Jev开源替代方案:五款自托管决策模型推荐
  • Barclays 扩大与 Anthropic 合作:2027 年多数工程师用上 Claude Code
  • Claude 到 OpenAI SDK 字段映射指南
  • 微软发布语音转录与TTS模型,瞄准语音Agent场景
  • 用1.7B小模型跑coding agent实战
  • LLMjacking攻击解析:API密钥泄露的隐形代价
  • LLM并不会真正推理:驳斥AI思考能力
  • Black Forest Labs发布Flux 3图像模型,支持局部编辑
  • 约束如何让开发者更高效
  • 国产模型路由X-Router:Agent场景实测省50%+ Token
  • AWS开源Strands Decider 2B:115ms本地决策模型
  • 2026 Agent上下文工程四原则
  • 模型边界安全测试的教训:我的攻击有效但靶子设错了
  • 跨AI客户端的本地记忆中枢MemTether
  • Cloudflare开源基于Qwen的多模态决策模型Clef
  • Firebase iOS SDK 将停止发布到 CocoaPods
  • 范式转变:AI 编程从生成代码到真正做事
  • AI编程助手进化论:从补全到自主工程
  • AutoSynthData:企业Agent训练数据合成
  • Rogo在Vercel实现AI Agent代码5分钟上线:月部署超7.3万次
  • OpenAI智能体失控:已通知百余家机构
  • Claude Code Read权限规则存在绕过漏洞
  • 我用Brain+Hand模式管理Claude Code开发公司
  • 四个 Agent 内存 bug:空闲压缩会静默丢弃工作上下文
  • Go 语言生态全面拥抱 Agent 可读的 pkg.go.dev API
  • Cloudflare开源决策模型Clef:返回类型化概率,延迟低至38ms
  • Chatham Financial 用 GPT 将交易验证从 30 分钟缩至 4 分钟
  • NVIDIA:Blackwell GPU 加速 GPT-6 Astra 推理提速 8 倍
  • 微软流式转录模型 MAI-Transcribe-2-Streaming:0.13 秒延迟、2.5% 词错误率
  • 生产环境Agent变懒?三个工作流Bug在作祟
  • SKILL.md 能否真正帮到 AI 编程助手
  • LLM 访问控制核心风险:过度授权凭证
  • IncidentCopilot:本地优先的 AI DevOps 调查框架
  • Node.js PDF 语义搜索:嵌入+重排+摘要实战
  • 如何阻止 AI Agent 死循环烧光预算
  • Papero:保留文档结构的开源PDF提取工具
  • Vibe-Coded应用修复还是重建?30分钟自检指南
  • 已加载 51 / 9258
8.0
热点
AI SCORE
技术实践2026-10-02 16:00

LLM并不会真正推理:驳斥AI思考能力

MIT 科技评论#LLM#推理#AI原理
Editor brief · 编辑速览

MIT科技评论刊文,以2016年AlphaGo第37步为例,论证当前LLM的"推理"本质仍是模式匹配而非真正理解。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

2016 年 3 月的一个下午,在首尔,我看着我参与编写的程序在棋盘第五线上落下一子——看起来就像是送给人类对手的一份礼物。第二局第 37 手这步棋看起来如此荒谬,以至于一些解说员认为那是程序出了故障。

并非如此。AlphaGo 赢下了这局棋,最终以 4 比 1 击败了有史以来最伟大的职业围棋棋手之一李世石。"我以为 AlphaGo 是基于概率计算的,它不过是一台机器,"李世石赛后说。"但当我看到这步棋时,我改变了想法。AlphaGo 一定有创造力。"

1997 年,当深蓝击败当时的世界象棋冠军加里·卡斯帕罗夫时,它依靠的是每方提前搜索六到八步、每秒评估 2 亿个棋局位置——所有规则都由人类硬编码。围棋是一款复杂度高得多的游戏。一颗棋子的价值取决于遥远的棋群和实地如何在数十步之后展开。即使计算可能结果的一小部分,也需要一台超级计算机数十亿年的时间。要赢,AlphaGo 必须一眼判断出谁领先,甚至要创造出没有人想到去走的棋步。

这就是为什么许多关于 AlphaGo 与李世石对局的描述都将第 37 手描绘成纯粹机器直觉的闪现。但这是一种误解。实际上正是 AlphaGo 的推理能力做出了这个创造性的选择——而这种能力是当今 AI 所缺乏的。如果我们希望未来的 AI 系统在科学和医学等领域产生可信的结果和真正新颖的见解,我们需要为它们配备真正的推理能力。

AlphaGo 由两个系统组成。第一个是策略网络,它被训练用来猜测一位高手会走哪一步。这个"直觉"部分认为第 37 手没什么特别的——在专家人类棋手眼中,这步棋大约只有万分之一的出现概率。真正让 AlphaGo 选中它的是程序的搜索机制,它超越即时的合理性,考虑所提议走法对未来后果的影响。它明确地构建并搜索了一个包含数千条分支的棋局树,每条分支代表一种不同的可能未来。

行为科学中有一个著名的理论,由丹尼尔·卡尼曼推广,将人类的思维区分为两种模式:系统 1 是快速的、本能性的、不假思索的;系统 2 是缓慢的、逐步的、深思熟虑的。AlphaGo 提供了一个引人注目的机器版对照。它的网络提供了直觉——这步棋看起来有希望,这个局面看起来要赢了——而它的搜索提供了深思熟虑,用可能随之而来的应对招法检验这些直觉。正如在人类认知中一样,两部分缺一不可。单靠直觉绝不会选择第 37 手,而蛮力搜索则难以从所有可能的走法中筛选出正确答案。

这与当今 AI 模型的工作方式截然不同。一个大语言模型反复选择下一个 token。这相当于系统 1 在运作——快速、关联性强,在人们书写过的几乎所有主题上都有惊人的模式补全能力。

ChatGPT 推出后不久,业界意识到仅靠语言流畅性还远远不够。显而易见的解决方案是让模型能够深思熟虑:不再立即回答,而是先生成中间步骤来分解问题、保留部分结果并影响后续推理——这个过程被称为思维链。

这种提升已被证实是真实的,尤其是在数学和编码领域。但与 AlphaGo 的搜索不同,这并没有引入真正独立的推理机制:中间推理仍然是由同一个下一个 token 预测过程产生的,只是在模型给出答案前迭代更长时间。

三个缺陷使得聊天机器人在做的事不符合真正的推理(以科学家可能认可的方式)。首先,这些模型通常没有明确的、持久的、可检查的认知状态。没有一个开放的分类账列出模型正在考虑的假设、对各种解释的信心、正在权衡的证据以及正在保留的未解决问题——所有这些都应该随着新信息的到来而系统性地修订。

其次,它们缺乏对系统所知内容与如何操作这些知识之间的清晰分离。知识和推理在神经网络权重中不可分割地交织在一起——没有独立的、明确表示的信念集。第三,虽然聊天机器人产生的思维链看起来像是深思熟虑,但研究表明,机器人经常在事后编造它们——通过一种路径得出答案,却报告了另一种路径。

这是一个问题,因为在医学、工程和科学研究等我们都关心的关键应用中,不仅系统得出什么结论重要,它如何得出结论也同样重要。当错误发生时——例如在医学诊断和治疗中——我们需要能够精确定位问题出在哪里:是系统的推理有误,还是它使用了无效的证据,还是它做出了错误的假设?

这就是我最近离开 Google DeepMind 职位的原因。我相信我们需要一种全新的机器推理方法——一种借鉴 AlphaGo 架构的方法。AlphaGo 维护着它对给定局面的所知记录:棋局树。这个数据结构包含 AlphaGo 所考虑过的所有变化和可能的未来,每一步棋和局面都由其神经网络做出的判断进行标注。随着推理的推进,AlphaGo 更新棋局树,最终综合其中的信息来决定走哪一步。

类似地,对于通用推理,一个系统应该维护一种认知状态,表示系统认为已确定的、有所怀疑的、已排除的,以及哪些问题仍然开放。推理可以因此被理解为一系列改变认知状态的行动,以推进知识、减少不确定性:推导后果、将问题拆分为若干部分,以及——至关重要的是——决定下一步问什么问题、执行什么计算或进行什么实验。

当然,开放世界的推理比下围棋或象棋这类棋盘游戏更难。在现实世界中,当前的事态只被部分已知,可用的行动集合庞大且可变,行动的后果是随机的或未知的。

但近年来 LLM 和其他神经模型的进展现在赋予了我们处理这类通用推理问题的能力。例如,LLM 可以基于已知内容和可用资源提出解决问题的方法。它们可以通过 API 或代码与工具交互,并帮助评估某项主张是否被现有证据支持。

最重要的是,为了保持系统的诚实,系统的独立部分必须评估每一步实际上在多大程度上解决了不确定性,只有在变化有证据支持时才更新信念。一旦这些规则被强制执行,模型就可以积累经过验证的知识,并通过从过去的推理经验中学习来改进其推理策略。你可以将这样的系统想象成增强版的科学方法,其目的是产生能够经受审查的知识。

我不认为通过让系统 1 变得更大就能实现可信的机器智能。规模会锐化直觉,但不会让直觉变得更深思熟虑。第 37 手之所以重要,是因为一台机器持有一个局面、权衡了可能的未来,并选择了它的人工本能很可能拒绝的那步棋。

社会在药物发现、材料、气候、诊断等领域需要这样的创造性走法——在这些领域,棋盘看起来一点也不像围棋,没有人把规则交给我们。我们只有从那些能够推理的系统——那些结论来自可审计的证据、推理和信念修正序列而非事后编造的令人信服的故事——那里才能获得这样的见解。

Thore Graepel 是伦敦大学学院机器学习系主任。他曾是 DeepMind AlphaGo 团队的核心成员,致力于确保 AI 造福人类繁荣。

人工智能

AI 的递归自我改进也许终究不会那么快到来

AI 智能体似乎还没有足够的创造力来执行真正创新的开放式 AI 研究。

Michelle Kim 存档页

这就是 AI 智能体撒谎和作弊以达成目标的原因

这种不当行为被称为奖励黑客。以下是你需要了解的。

Grace Huckins 存档页

不要被这个夏天的 AI 炒作所迷惑

关于 AGI 和新能力的大量夸张说法在仔细审视下很快就会瓦解。

Timnit Gebru 存档页

Emily M. Bender 存档页

这些初创公司正在追逐 LLM 的下一个大事件

认识一下正紧追 AI 巨头不放的新玩家。

Will Douglas Heaven 存档页

获取 MIT Technology Review 的最新更新

发现特别优惠、热门故事 upcoming 活动等。

Original source

本文由 AI 翻译整理自 MIT 科技评论,原文版权归原作者所有。

阅读英文原文
上一篇
LLMjacking攻击解析:API密钥泄露的隐形代价
下一篇
Black Forest Labs发布Flux 3图像模型,支持局部编辑