前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8611
  • 自托管Llama部署成本全解析:GPU之外容易被忽视的隐性开销
  • Builder.io开源Agent-Native框架:让人与AI共享同一操作层
  • 让AI编程代理在中断后从断点恢复:session化执行轨迹方案
  • CI如何验证AI代理真的跑了测试而不是伪造结果
  • AI产品定价数学:固定费率如何悄悄亏损
  • ZCode事件:AI编程工具静默上传全部Git历史
  • Anthropic自评:R&D自动化率26%,但完全自主为0
  • 阿里Qwen-Image-2.1:70亿参数开源图像生成拳打闭源模型
  • OWASP CRS 规则引擎:给 LLM 和 MCP 加上 WAF
  • 智谱 MaaS 上线数据不留存机制,可申请开通
  • 如何界定可完成的AI工程范围
  • Cursor中直接查询技术文档的MCP方案
  • AI Agent的过度自信陷阱
  • Cursor与.NET周报:七个实战规则
  • Qwen-Image-2.1开源:7B参数兼顾生图与编辑
  • 阿里开源 Qwen-Image-2.1:7B 参数兼顾透明图生成与多图编辑
  • 免费模型Trace不能支持的五个评估主张
  • AI重构前的副作用冻结术:先录 Ledger 再动格式
  • Agent能改Oracle则Green Build不足为信:独立检查三原则
  • AI编程导致代码质量下降?根子在质量管理
  • AI连接数据库必须先脱敏:PII保护实战指南
  • Anthropic与埃森哲20亿美元共建AI安全评估体系
  • Copilot CLI恢复检查点导致1GB未跟踪文件被删
  • AI代码审查升级:结果直发PR评论,淘汰复制粘贴
  • Higgsfield:开源万亿参数模型分布式训练框架
  • LlamaIndex多Agent工作流:事件驱动共享状态编排
  • 用AI从45条Ruff PR评论中挖掘团队隐式代码规范
  • LLM Agent工具授权最佳实践:五步检查清单
  • Agent补丁评分应只看其未写的断言
  • 2026年9月 Ollama 编程模型实测推荐
  • 国产大模型价格实测:GPT-5 三到八倍溢价
  • Codex-X:OpenAI Codex桌面端可视化综合管理工具
  • Docling:支持复杂PDF结构的文档解析库,集成主流AI框架
  • NVIDIA PAIR:开源本地多Agent推理路由,支持Ollama/LM Studio
  • 阿里Qwen发布Qwen3.8-LiveTranslate:60语言实时翻译,延迟仅2.3秒
  • Supermemory:AI记忆与上下文引擎开源实现
  • OpenSpec:AI编程时代的规格驱动开发框架
  • 已加载 37 / 8611
8.0
热点
AI SCORE
行业动态2026-09-21 00:14

Anthropic自评:R&D自动化率26%,但完全自主为0

dev.to · AI#Anthropic#AI Agent#自动化
Editor brief · 编辑速览

Anthropic公布其R&D自动化指数,澄清误解:26%指模型完成大部分任务但需人工审核,完全自主执行为0%,90%参与率是协作级别。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

Anthropic 发布了其首个内部 R&D Automation Index,指出 Claude 在其人工智能研发工作中承担了 26% 的任务,涉及超过 90% 的整体 R&D 工作流。

这一披露立即引发了一轮报道,声称模型正在构建自己的后继者。但当你审视该实验室如何定义其自动化层级时,实际操作情况要狭窄得多:Anthropic 内部的完全无人值守自动化率目前为零。

自动化层级的结构

该指数将内部工程与研究任务划分为三个操作级别:

Leads(26%):模型从高层提示完成端到端任务的大部分,但由工程师监督运行,并在结果进入生产环境前进行验证。

Collaborates 或更高(90%+):模型在直接人工迭代下处理大量代码、数据解析或测试生成。

Fully autonomous(0%):系统在无人工干预的情况下规划、执行、验证和部署。

相关披露中提到,2026 年 8 月 Anthropic 内部集群中约有 30,000 个活跃 AI agent 会话。这一数字反映的是自动化批量工作力,而非一个自己做产品决策的人工智能研究员。

30,000 个 agent 会话实际在做什么

在任何现代模型开发流水线中,绝大部分工程时间都花在操作性苦工上:

  • 在集群上启动分布式测试运行。
  • 为合成数据集编写样板数据清理流水线。
  • 在环境变更后对失败的单元测试进行分类和解析堆栈跟踪。
  • 在内部基准套件上运行回归评估并对比分数。

这些都是高摩擦、有边界的 workflow。开发者给 agent 一个目标 schema、一个 eval 脚本和一个 git branch,然后在 agent 完成后审查 PR diff。

当 Anthropic 说 Claude 承担了 26% 的内部工作时,意味着工程师可以将有边界的任务委托给后台 worker 进程,而不必手动编写每个测试工具。模型生成草稿产物,但人类工程师仍然决定资助哪些假设、信任哪些 eval 套件,以及发布哪个 checkpoint。

辅助执行与失控循环之间的鸿沟

递归自我改进的概念假设了一个自主循环:AI 编写一个更好的自己版本,部署到生产环境,并在无人工审批的情况下加速下一个周期。

Anthropic 的指标揭示了为什么这种心智模型在生产软件中失效。编写代码在模型开发中很少是主要瓶颈。真正的瓶颈是计算预算、数据集质量、硬件可靠性和评估设计。模型无法自主分配它不控制的集群,也无法根据未编写的标准评估安全阈值。

在 30,000 个活跃 agent 会话中实现零无人值守执行,这展示了 2026 年 agent 系统的现状。它们是重复性工程步骤的有效力量倍增器,但它们仍然是绑定在人工验证上的工具。

Original source

本文由 AI 翻译整理自 dev.to · AI,原文版权归原作者所有。

阅读英文原文
上一篇
ZCode事件:AI编程工具静默上传全部Git历史
下一篇
阿里Qwen-Image-2.1:70亿参数开源图像生成拳打闭源模型