前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
返回 AI 情报前线
All News · 全部资讯9275
  • 智谱 GLM-5.3 编程能力最强开源模型发布,Qwen3.8-27B 同日开源
  • 英伟达量产全球首款 200G/lane 硅光交换机,功耗降为 1/5
  • 别分类,直接「幻觉」标签:LLM标签推荐新思路
  • Anthropic推出Claude文本水印检测API
  • RPA与工作流自动化深度对比:如何构建持久自动化
  • Google Sheets推AI画布,可用自然语言构建交互应用
  • n8n替代方案横评:企业级自托管AI自动化平台
  • 苹果AI策略区域分化或致iOS应用在中国行为不同
  • CoT Prompting 实战指南:何时用、怎么用
  • 阿里Qwen3.8:消费级硬件即可跑出Opus 4.6级性能
  • 什么是AI上下文架构?为什么不建议自建?
  • 阿里Qwen 3.8开源:27B参数上下文达26万token
  • OpenAI推出Computer History:Mac操作记录转为ChatGPT可搜索记忆
  • Grok 4.6 登陆 GitHub Copilot,专为 Agent 编码设计
  • 提升 Claude Code 使用效率的实战指南
  • 换用新模型前,先用历史失败用例回归测试
  • Qwen3.8-27B vs Qwen3.6-27B:架构完全相同,性能提升全赖训练
  • 编程Agent能读git log,却读不到你试错的四次失败
  • AI集成层大规模密钥泄露:Composio等平台暴露数千凭证
  • NVIDIA Nemotron 3.5 Lightning:解决Agent执行层成本与能力矛盾
  • 研究打脸:前沿模型还无法自主做科研
  • AI代理真正学会记住的四层记忆系统
  • Amazon Nova Forge 多轮强化学习奖励函数设计指南
  • GitHub推出覆盖全SDLC的Agent应用
  • AI by Hand:Hacker News热捧的AI辅助手工工具
  • SageMaker 联手 Bedrock AgentCore 构建多Agent工作流指南
  • 两阶段语义检索 + 结构化引用:游戏答案类 RAG 架构设计
  • 语音转文字 + 模型网关:知识库流水线的 API 设计实践
  • Meta发布Glimmer开源模型,Zuckerberg阐述开放AI理念
  • Google用同态加密让私有AI变为实用技术
  • Qwen3.8-27B 开源:家用显卡可跑,可商用
  • 大吞吐量 LLM 工单分类的成本控制五法
  • 阿里开源 OpenSandbox:AI Agent 安全沙箱,两天斩获 1.27 万星
  • AI 记忆不必是数据库:试试 Markdown + Git 方案
  • AI 功能开发中的信任边界设计原则
  • GLM-5.3编码能力跃升:基座未变,提升从何而来
  • AI 编程模型评测实战框架:从真实开发任务出发的选型方法
  • 阿里开源 Qwen3.8-27B:编程办公场景超越 Qwen3.7-Plus,推理资源可调控
  • AI生成的Shell命令需像MR一样审查
  • 中国医生用GPT-5.6-Sol 16小时证明22年数学难题
  • Qwen3.8-27B发布:阿里新一代开源大模型
  • Node.js API客户端防御式解析实战:四种结果分而治之
  • AGENTS.md成跨工具标准:Claude/Cursor/Codex统一配置指南
  • 一行属性将ASP.NET Core API暴露为MCP服务器
  • .NET消费MCP服务三动词:Connect/Discover/Call
  • .NET消费MCP服务:应用作为客户端
  • 生产级 AI Agent 可观测性建设实战指南
  • Kog深度优化GPU推理,挑战Agent工作流效率
  • 理想汽车自研云端推理芯片,数据流架构复用智驾设计
  • LLM分类器不必用真实类目:基于嵌入的假设分类法
  • 为什么我们的Agent需要请求许可才能无人值守运行
  • 已加载 51 / 9275
8.0
热点
AI SCORE
技术实践2026-08-15 00:06

研究打脸:前沿模型还无法自主做科研

The Decoder#AI研究#大模型局限#Claude
Editor brief · 编辑速览

普林斯顿与英国 AI 安全研究所的研究显示,Claude Opus 4.8 和 GPT-5.6 在六天、3000 美元预算下独立完成科研论文,被原文作者评为「Reject」,模型擅长工程流程但缺乏研究判断力和创造性问题解决能力。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

Anthropic 和 OpenAI 一直在吹捧其模型加速 AI 研究的能力。一项使用未发表的 NeurIPS 论文的新实验给出了不同的答案。

AI 智能体能否独立开展 AI 研究?普林斯顿大学和英国 AI 安全研究所联合发表的一篇新论文对这一说法进行了检验。当今的前沿模型可以处理研究工程工作,但在研究过程中真正重要的环节却力不从心。

作者认为,关于自动化 AI 研究的主张几乎缺乏有力证据。现有评估要么在狭窄、可验证的任务上测试智能体,要么将 AI 生成的论文提交同行评审——研究人员将这一过程形容为"过度延伸、充满随机性且评审质量低下"。

测试 AI 研究能力的新方法

研究人员将他们的方法称为"影子评估"。智能体会收到来自未发表论文的核心研究问题,而花费数月研究同一问题的原始作者则像会议评审一样对结果进行评估。由于结果尚未在网络上发布,智能体无法依赖训练数据。

研究团队与两位 NeurIPS 2026 提交论文的作者展开了合作。第一篇论文探讨了如何通过权重来引导语言模型的个性特征。第二篇论文则开发了一种名为 TabPFN 的方法,用于检测表格预测模型何时遇到与其训练数据差异显著且会严重影响其准确性的部署数据。

主实验使用 Claude Opus 4.8 配合 Extra-High Reasoning 功能。每个智能体获得六天时间、3000 美元的 API 额度、GPU 预算,以及对虚拟机和开放网络的完全访问权限。智能体运行在一个 scaffold 中——这是一种编排模型调用并提供工具的软件环境,允许模型将任务委托给子智能体并监控自身的资源使用情况。它还可以咨询外部 AI 审查工具。

研究团队使用了 OpenClaw,这是一个由奥地利开发者 Peter Steinberger(今年早些时候加入 OpenAI)构建的开源、厂商中立的智能体框架。核心智能体启动子智能体和长时间运行的 GPU 作业,scaffold 的自动心跳机制会在作业完成时唤醒它,以便收集结果。

Flow diagram of the CRUX-2 scaffold showing four lanes for human messages, core agent, subagents, and GPU experiments, with agent turns along a timeline.

原始作者以会议评审身份审查了完成的论文,均遭到拒绝。其中一篇获得"强烈拒绝"。他们批评了数据动机不足的实验、难以理解的表述,以及缺乏新的贡献。一位评审人称推理过程存在"'以例代证'谬误",认为"极不科学"。另一位则批评实验选择"怪异",结果明显是"事后选择"的产物。

Review results for Personas and TabPFN showing weaknesses and strengths per source, split by self-reviews, external AI reviewers, and human experts. Human verdicts are Reject and Strong Reject.

不断出现的失败模式

对智能体日志的分析揭示了系统性的弱点。智能体缺乏对什么才算达到可发表研究水平的判断能力,产生了看似合理的假设,却基于小型、人工策划或合成数据集将其丢弃。

它们在创造性问题解决上也失败了。当初步假设被证伪时,智能体们收窄现有主张,而非追求新方向。在十五轮修订中,它们的内部 AI 审查从未给出过一次"接收",但智能体从未解决核心批评。

智能体也无法有效回溯。两篇论文都在前十小时内放弃了最雄心勃勃的研究目标。在 Personas 实验中,尽管为该阶段分配了 36 到 48 小时的预算,智能体仅在五小时后就完成了探索。

Dot plots comparing planned deadlines and actual completion of six project milestones for Personas and TabPFN across a 0-to-120-hour timeline. Both agents ended their open exploration phase much earlier than planned, locking in an approach very early.

资源意识也很差。两次运行结束时 API 预算支出都不到一半。其中一个智能体在截止日期前七小时就宣布项目完成,就在其审查器再次返回"拒绝"之后不久。

智能体还受到指令漂移的影响,在长上下文中逐渐遗忘明确的指令。两篇论文都超过了长度限制,本应在 NeurIPS 被直接拒稿。其中一篇论文正文没有任何可视化,而人类撰写的原文有 15 张图。Meta AI 最近描述了一个密切相关的现象,称为"行为状态衰减",即智能体早期认识到某个要求,但在修复不相关的 bug 时违反了它。

Line chart of the Personas run showing wall-clock time, Anthropic API spending, and GPU compute as a share of budget over 140 hours. API spending ends at $1,130 of $3,000, with six numbered event annotations below. The agent stopped at roughly a third of its token budget even though it could check its own usage at any time.

工程可行,判断不行

智能体在没有人类帮助的情况下完成了所有工程工作。他们进行了文献搜索、调试 GPU 代码、完成数百个实验和稳健性测试,并用 LaTeX 编译了完整的论文。仅需要三次人类干预:scaffold bug 修复、截止日期延长,以及请求重写以提高可读性。

研究人员没有发现明显的 reward hacking。智能体没有操纵结果或歪曲数据以追求更好的分数。事实上,他们做了相反的事情,从雄心勃勃的主张开始,然后将其纠正为负面结果。

Title pages of the two agent-written papers, before and after the human-ordered rewrite. The abstracts only became readable after an explicit instruction to rewrite for clarity.

为了检查结果是否软件设置的产物,研究人员用 GPT-5.6 Sol 和 OpenAI 的 Codex scaffold 重复了一个实验。几乎所有相同的失败模式都出现了。GPT-5.6 在短短两天多的时间内耗尽了 3000 美元的预算,导致实验规模不足。

结果与实验室声明冲突

这些发现与领先 AI 实验室的主张形成了对比。今年六月,Anthropic 发表了一篇题为"When AI Builds Itself"的文章,分享了内部研究加速数据,并提出了全球协调开发暂停的想法。

OpenAI 声称 GPT-5.6 Sol 帮助后训练了一个较小的模型,为研究人员节省了数周时间。研究人员指出,这项贡献甚至没有在 81 页的系统卡中提及。

没有推理的初步测试表明,更多的推理努力确实提高了质量。但研究人员怀疑更多的时间或计算资源不会改变多少结果。评审者的反对意见针对的是实验选择的质量,而不是数量。

作者们表示,前沿模型可以处理 AI 研究的工程方面,但"无法解决为期数周的开放式 AI 研究问题"。这项研究只涵盖了两篇论文,评审者并没有设盲,他们既知道自己的研究问题,也知道正在评估 AI 生成的工作。但结果明显很弱,这些限制不太可能改变总体情况。团队已在网上公开了专家评审、日志和智能体代码库,以便其他研究人员自行判断。

为什么同行评审是糟糕的衡量标准

先前关于自主研究成功的说法几乎完全依赖于被接受的提交,但仅仅被接受并不能说明研究质量。Sakana AI 的 The AI Scientist-v2 在 2025 年向一个 ICLR 研讨会提交了三篇论文。其中一篇以 6.33 的平均分被接受,仅略高于门槛,在评审后发现引用错误而被撤回。研讨会接受率为 60% 至 70%,远高于主要会议的 20% 至 30%。影子评估通过将评估交回原始作者来回避这个问题。

Sakana AI 于 2026 年 6 月成立了一个专门用于递归自我改进的研究实验室。据该公司称,后续版本的 AI Scientist 写了一篇通过同行评审的论文。相关研究于 2026 年 3 月发表在《自然》杂志上。

寻找能创造新知识的 AI

批评声随着这些实证结果而增长。Google DeepMind 的 Tom Zahavy 在立场论文"LLMs can't jump"中认为,语言模型缺乏创造真正新事物的认知机制。他写道,AI Scientist 只是重新组合现有概念,而 DeepMind 的 AlphaEvolve 在优化方面表现出色,但需要一个清晰的错误信号才能工作。

最近的数学突破似乎与这一观点相矛盾,但可能并非如此。今年 5 月,一个 OpenAI 推理模型证伪了 Paul Erdős 于 1946 年提出的关于单位距离几何的猜想。菲尔兹奖得主 Tim Gowers 称这一结果是"AI 数学的里程碑"。随后,Claude Mythos 以 Anthropic 工程师 Sholto Douglas 所说的一种"可爱、简单的证明"解决了同一个问题。OpenAI 随后确认了 Astra,这是一个新的模型家族,据报道在数学和理论计算机科学中解决了十个开放问题——这些问题是该领域至少十年来一直困扰的。

但数学证明是演绎推理,从固定规则推导必要结论或系统地搜索大型解空间。这令人印象深刻,但这是前沿模型擅长做的事情。研究还需要溯因推理,即创造性跳跃,发明一个原因来解释惊人现象。制定新的研究问题、设计正确的实验、从结果中得出可靠的结论——这些都是当今模型仍然做不到的事情。

AI News Without the Hype – Curated by Humans

Subscribe to THE DECODER for ad-free reading, a weekly AI newsletter, our exclusive "AI Radar" frontier report six times a year, full archive access, and access to our comment section.

Read on for the full picture.Subscribe for hype-free coverage.

Full access to every article on THE DECODER

Join the comments and community discussions

A weekly AI news recap via mail

6x/year: "AI Radar" — deep dives on the AI topics that matter most

Daily AI news, always up to date

Our full ten-year archive

Covered by a team with 10+ years in AI

Original source

本文由 AI 翻译整理自 The Decoder,原文版权归原作者所有。

阅读英文原文
上一篇
NVIDIA Nemotron 3.5 Lightning:解决Agent执行层成本与能力矛盾
下一篇
AI代理真正学会记住的四层记忆系统