AI日报:ARC-AGI-3、Devin SWE等关键动态
汇总AI领域重要进展包括基准测试和编程工具升级;涵盖广但缺乏深度分析。
汇总AI领域重要进展包括基准测试和编程工具升级;涵盖广但缺乏深度分析。
🤖💻 AI 每日简报 — 2026 年 8 月 1 日
OpenAI 于 7 月 29 日发布了一篇少见的技术深度解析,解释 GPT-5.6 Sol 为何在 ARC-AGI-3 上表现不佳。ARC-AGI-3 是一项要求 Agent 探索陌生的 2D 益智游戏,并通过反复试错推断规则的基准测试。使用官方评测 harness 时,Sol 的得分仅为 7.8%,GPT-5.5 更是几乎无法进行游戏,得分只有 0.4%。团队发现,问题并不在模型,而在 harness:每次执行游戏操作后,所有私有推理内容都会被丢弃;随着历史记录不断增长,滚动截断窗口还会删除较早的操作。实际上,Sol 每走一步,都得重新从头理解一遍游戏。
启用 Responses API 的两项设置——保留推理和上下文压缩——之后,公开任务集上的得分从 13.3% 提升至 38.3%,达到原来的近三倍,同时输出 token 数量减少了约 6 倍。使用这套 harness,GPT-5.6 Sol 可以完成该基准测试的全部六个关卡;而在官方排行榜上,没有任何前沿模型能完成第一关之后的任意关卡。按照该基准采用的 RHAE 指标,人类测试者的平均得分约为 48%。
这项发现重新定义了我们应该如何解读基准测试排行榜:它衡量的是模型 × harness × 设置,而不是孤立的模型本身。对于所有正在构建长时间运行 Agent 的人来说,教训非常具体——如果你的 harness 会在工具调用之间丢弃 chain-of-thought,那么你测到的并不是模型本身,而是一个患有失忆症的模型。
🔗 OpenAI 博客 — ARC-AGI-3 · ARC Prize · ARC-AGI-3 游戏
欧盟委员会于 7 月 30 日正式启动招标,计划在欧盟境内建设最多七座 AI Gigafactory。项目将获得欧盟及成员国共计 100 亿欧元的公共资金支持;计入私人资本后,总投资目标超过 300 亿欧元。该计划由 EuroHPC Joint Undertaking 推进。其中,四座规模较小的设施每座至少配备 75,000 枚 AI 芯片,可获得最高 5 亿欧元资助;三座规模更大的 Gigafactory 每座至少配备 100,000 枚芯片,可在两个开发阶段获得最高 10 亿欧元资助。
每座 Gigafactory 的算力规模必须约为欧洲目前最大 AI 数据中心的四倍。欧盟委员会已经与 AMD、NVIDIA 和 Qualcomm 签署意向书,以帮助中标联盟更方便地获取硬件。投标将于 11 月 12 日截止,预计在 2027 年初公布中标结果,并计划于同年启动建设。此前,一轮不具约束力的意向征集收到了 76 份申请,涉及 16 个成员国的 60 个选址,远超布鲁塞尔方面的预期。
这是欧洲迄今最明确的一次表态:AI 算力是与电网和宽带同等重要的关键基础设施。此举直接回应了欧洲对美国和中国算力的依赖,也延续了欧盟 6 月公布的法律草案所确立的方向——减少对美国云服务和芯片供应商的依赖。非欧盟实体不得加入 Gigafactory 联盟,控股股东也必须来自欧洲。
— 欧盟委员会 · Sifted
🔗 欧盟委员会 AI Gigafactory 招标 · ITPro 报道 · Brussels Signal
Cognition 度过了 AI 实验室中产品发布最密集的七月之一。7 月 8 日,该公司推出自研前沿编程模型 SWE-1.7。该模型以 Kimi K2.7 为基础,通过强化学习训练而成,并采用了四项值得关注的创新:通过保持熵的 top-p sampling 稳定长时间 RL 训练;构建横跨三大洲、具备容错能力的多集群训练体系;利用自动化执行测试过滤任务的数据质量 pipeline;以及 self-compaction,让模型能够总结自身的工作状态,将任务处理时长延伸到原始上下文窗口之外。SWE-1.7 在 FrontierCode 1.1 Main 上取得 42.3% 的成绩,在 Terminal-Bench 2.1 上达到 81.5%,在 SWE-Bench Multilingual 上达到 77.8%。该模型通过 Cerebras 提供服务,速度约为每秒 1,000 token,并可在 Devin Pro 中免费使用。
围绕这一模型,Cognition 还发布了 Devin Security Swarm(7 月 1 日)。它采用一种 Agent 化的 MapReduce 方法,让多个 Agent 分别调查不同代码区域,并跨文件推理,从而发现由多个步骤构成的攻击链。在一套包含 50 个 CVE 的测试集中,它找出了 72% 的真实漏洞,每次运行成本为 90.23 美元。公司还于 7 月 13 日获得 FedRAMP High In-Process 状态,并与美国能源部签署谅解备忘录,加入 Genesis Mission,为自治软件工程进入美国联邦市场铺路。对 TierZero 的收购(7 月 20 日)则将 Devin 的能力扩展至事件检测和系统可靠性领域。Cognition 披露,目前公司自身超过 90% 的代码都由 Devin 编写。
Cognition 在 5 月完成超过 10 亿美元融资,估值达到 260 亿美元;其年化收入在十二个月内从 3,700 万美元增长至 4.92 亿美元。该公司的核心判断是,最终胜出的技术栈将是模型 + Agent harness + 合规能力,而不是某一个单独的模型。其内部 Fusion 架构研究发现,作为首席编排器时,Claude Fable 5 的表现优于 Opus 4.8——在 FrontierCode 1.1 上分别取得 60.7 和 54.6 的成绩,而且单次运行成本更低。这进一步证明,编排设计的重要性正日益接近模型的原始能力。
— Cognition · 美国能源部
🔗 SWE-1.7 公告 · FedRAMP High · 美国能源部 Genesis Mission
Figure 宣布,其最新人形机器人 Figure 03 已进驻 BMW Group 斯帕坦堡工厂的 52 号车间——一座负责装配和物流的厂房。Figure 的应用由 Figure 02 执行的钣金件抓取与放置任务,转向排序场景。Figure 02 曾在 2025 年参与组装 30,000 辆汽车;Figure 03 则需要从料箱中抓取无序摆放的薄壁零件,再按照准确顺序将其放到运往装配线的推车上。
这项新能力由 Helix 02 驱动。Helix 02 是 Figure 的 pixels-to-actions 视觉-语言-动作模型,能够在单一网络中协调手、手臂、躯干和双脚,从而实现移动操作,例如在迈步和调整位置的同时抓取零件,并拉动装有脚轮的重型推车。硬件升级包括手掌摄像头和触觉传感器、用于 speech-to-speech 交互的端到端音频能力、支持持续运行的无线充电,以及保障人机安全共处的柔性组件。Figure 03 重 61 千克,负载能力为 20 千克,每次充电可运行约五小时,最高移动速度为 1.2 米/秒。
排序是一项难度更高的测试:零件抵达时并不会处于数学意义上完美的朝向,因此每次交互都需要实时感知与纠正,而且操作必须与移动相结合。BMW 将这款人形机器人视为高度数字化工厂中的移动边缘客户端——iFACTORY、AIQX 质量系统和虚拟工厂都会为其提供上下文。与此同时,BMW 还在实施多供应商战略:除了在莱比锡测试 Hexagon 的 AEON 人形机器人,还建立了新的生产 Physical AI 能力中心。信号已经非常明确:Physical AI 正从演示阶段走向真实制造物流中的瓶颈任务。
— Figure AI · BMW Group
🔗 BMW 工厂中的 Figure F.03 · BMW 物流报道 · Figure AI
香港大学 Multimedia Lab 与美团的研究人员发布了 UniClawBench(arXiv:2607.08768)。这项基准测试让 AI 助手在真实 Docker 环境中接受测试——使用真实浏览器、真实软件和真实文件,而不是沙箱镜像或预先构建的网站副本。结果令人警醒:即使是实力最强的闭源模型,任务通过率也严格低于 50%。
更令人意外的发现是:框架选择对性能的影响大于模型选择。将同一个模型封装在不同的 Agent shell 中,结果的变化甚至大于直接更换模型。该基准涵盖各种日常助理任务,例如查询机票价格、整理文件和理解视频内容。这些任务对人类而言轻而易举,却暴露出 Agent 一旦需要实际操作在线软件,就会多么频繁地失败。
UniClawBench 验证了从业者长期以来的怀疑:沙箱评测会系统性地高估 Agent 的能力,因为真实环境中存在非确定性、页面故障和意外状态,而预制的测试镜像无法复现这些情况。随着 Agent 进入生产环境,真实环境评测将成为制约部署的关键因素,“模型与 shell 孰轻孰重”也将成为系统设计的核心问题。
— 香港大学 Multimedia Lab · 美团 · arXiv
🔗 UniClawBench 论文 · TechWalker 报道
Stanford、Berkeley 与 NVIDIA Research 的联合团队发布了 LLM-as-a-Verifier(arXiv:2607.05391),提出将验证扩展视为继预训练、后训练和测试时计算之后,推动能力增长的第四条轴线。该方法不再要求裁判模型给出粗粒度的 1~5 分,而是对评分 token 的 logit 分布求期望,从而生成连续分数;随后再沿三个维度扩展验证计算:粒度、重复评估和评判标准分解。
该方法在四个领域均取得 SOTA 成绩:Terminal-Bench V2 为 86.5%,SWE-Bench Verified 为 78.2%,RoboRewardBench 为 87.4%,MedAgentBench 为 73.3%。这个 verifier 还可以充当 Agent 的进度条,在运行过程中持续追踪任务完成情况;它也能作为强化学习的密集奖励信号,而无须重新训练权重或训练奖励模型。
生成侧的 scaling law 已经得到了充分研究,而验证一直是被忽视的第四条轴线。随着 Agent 的执行轨迹越来越长、成本越来越高,选出正确轨迹与生成轨迹本身同等重要。这为团队提供了一条无须重新训练,就能提升编程、机器人和医疗应用中 Agent 可靠性的路径。
— Stanford · NVIDIA Research · arXiv
🔗 LLM-as-a-Verifier 论文 · GitHub · 项目网站
总部位于北京的企业级 AI Agent 基础设施初创公司词元无限于 7 月 27 日宣布完成天使++轮融资。本轮由临芯投资领投、华控基金跟投。这是该公司自 2025 年 7 月成立以来一年内完成的第三轮融资,累计融资金额达数亿元人民币。CEO 杨萍曾负责字节跳动的 AI 技术,并创立了字节跳动首个软件工程实验室;她开发的多 Agent 测试系统曾应用于字节跳动的核心产品线。
该公司的编程 Agent InfCode 于 2025 年 12 月登顶 Multi-SWE-bench Java 排行榜,并在 SWE-Bench Verified 上取得 79.4% 的 Pass@1 成绩,在同一评测中领先 GPT-5 和 Claude。与面向消费者的编程助手不同,InfCode 瞄准的是生产级企业系统:理解规模庞大的遗留代码库、通过安全审计,并嵌入 CI pipeline,合同金额可达数千万元人民币。公司计划打造中国首个全自治、高安全、自进化的企业级 AI Agent 基础设施平台。
一年三轮且轮次间隔不断缩短的融资节奏,表明资本正在加速关注中国的企业级 AI 编程市场。这个市场不同于面向 C 端的 Cursor 式工具,其核心判断是:企业 AI Agent 的胜负取决于集成深度和可审计性,而不是订阅价格。
🔗 InfCode 融资报道 · 词元无限
如需采取进一步措施,可以考虑屏蔽此人和/或举报滥用行为。