本周结论
AI 编程正在越过“模型能不能写代码”的阶段,进入“团队能不能稳定地指挥、验证和约束 Agent”的阶段。
本周最值得关注的,不是某个模型又多拿了几分,而是多条看似分散的资讯指向了同一个工程结论:模型只是执行链中的概率性组件,真正决定生产价值的是外层系统——需求关卡、状态机、结构化数据、评测集、权限边界、幂等工具和故障恢复。
模型侧仍在快速进步。Gemini 3.7 Flash 的 FrontierCode 1.1 正确率从 34.4% 提升到 43.6%,DeepSWE v1.1 从 49.0% 提升到 65.3%;同时,其限时价格降至每百万输入 Token 0.75 美元、输出 Token 3.75 美元。Gemini 3.7 Flash 发布报道 Deepseek 则把视觉理解、工具调用和兼容多种 API 端点放进同一套实验模型,试图争夺多模态 Agent 工作流。The Decoder
但能力和价格的改善,并没有自动解决 Agent 的可靠性。相反,模型越便宜、工具权限越大、执行速度越快,错误被批量放大的概率越高。78 毫秒足够一段不受信代码枚举环境变量、探测 SSH 与 AWS 凭据、检查网络出口;超时只能限制运行时长,不能限制影响范围。AI 代码执行沙箱实测
所以,本周真正的分水岭不是“谁的模型最强”,而是下面三个问题:
第一,团队是否把模糊需求转化为可验证的结果,而不是让 Agent 自行补全产品决策。
第二,系统是否把对话、状态和产物拆开保存,而不是把聊天记录当数据库。
第三,权限是否由确定性程序控制,而不是寄希望于模型识别所有恶意文本。
如果这三件事没有解决,更强的模型只会让系统更快地抵达错误结果。
三条主线

主线一:Coding Agent 的核心竞争力,从生成速度转向“指令—验证”闭环
痛点很常见:开发者给出“增加团队邀请”“重构鉴权模块”之类的短指令,Agent 很快修改十几个文件,补上数据库迁移和 UI 状态,测试也能过。到验收时才发现,邀请过期规则、默认角色、撤销能力和审计要求全部是模型自己猜的。
Superpowers 方法论把澄清结果、设计确认、实施计划、红绿 TDD 和最终审查设为连续关卡。它解决的并不是模型不会写代码,而是模型太擅长用合理假设填满需求空白。AI 编码代理防坑指南
Simon Willison 的判断与此呼应:高效使用 Coding Agent 的关键,是能够清晰指导修改,并自信验证修改是否以正确方式完成;逐行审查只是验证手段之一,而且通常不是最高效的那一个。Simon Willison
这说明相较此前“生成后 Review”的工作方式,Agent 协作正在向“生成前设关卡、生成中小步执行、生成后以行为验证”迁移。Code Review 不会消失,但它的职责会改变:不再承担第一次需求澄清,而是检查设计约束、测试证据与实际 diff 是否一致。
DOOM 从 C 迁移到 Rust 的案例提供了更具体的证据。作者没有让模型逐块翻译 7 万多行代码,而是先用确定性的 c2rust 在 23.2 秒内完成转换,再让 AI 处理翻译后重复出现的系统性问题。验证则依赖已有 Demo 回放和 11113 帧画面哈希,而不是“看起来像正确的 Rust”。DOOM 迁移实践
编辑判断是:AI 编程的最佳分工,不是把整个任务交给模型,而是让确定性工具完成可重复的机械转换,让模型处理模式识别、诊断和局部修复,再用独立于模型的证据验收。
这对选型和成本有直接影响。团队不应只比较模型单次回答质量,还要测量一次任务从需求到合并所需的总重试次数、人工澄清时间、回归缺陷数和可复现程度。更贵的模型如果能显著减少重试,可能反而便宜;便宜模型如果被放进没有验收门的自动流水线,低 Token 单价会被返工和事故成本吞没。
反方也成立:小范围、低风险、可随时撤销的修改,不需要为每次改文案或调整样式召开设计评审。关卡必须随风险分级,否则流程本身会成为成本。可验证指标至少包括需求补充次数、首次验收通过率、Agent 生成后返工工时、回归率,以及从任务开始到可合并补丁的中位耗时。
主线二:Agent 产品正在离开聊天框,状态与产物必须回到结构化系统
聊天框适合提出请求,却不适合作为长期运行系统的数据层。
一个 Agent 可以正确发现趋势、记录创意、回应追问,但如果创意、草稿、排期和发布状态全部埋在 Telegram 或网页对话中,用户最终仍要靠滚动历史消息恢复上下文。聊天记录本质上是没有 schema、索引、更新能力和物化视图的追加日志。Agent 三平面架构
生产经验给出了同样的结论:LLM 调用只占 Agent 系统的一小部分,其余工作是队列、重试、幂等键、状态机、审计日志与回滚路径。长期记忆也不应只是不断增长的上下文,而应被建模为可以查询的事件、事实和偏好。生产级 Agent 七条经验
OpenAI 开源 Codex Harness 的意义也在这里。根据报道,其目标并非再造一个通用聊天入口,而是让开发者把 Agent 循环嵌入安全告警队列、工程工具、运营看板等既有业务界面。IT之家 当上下文本来就在工单、代码库、客户记录和审批流中时,强迫用户把信息重新搬进聊天框,既损失结构,也制造权限和追踪问题。
相较此前,变化在于 Agent 的产品形态开始从“一个会调用工具的聊天机器人”转向“业务系统里的推理部件”。对用户而言,最重要的界面可能仍是看板、表格、IDE 或告警中心;Agent 只负责读取经过授权的状态、提出下一步意图并生成受控产物。
编辑判断是:Agent 应至少拆成三个平面。意图平面保存用户目标和决策依据;状态平面保存任务当前阶段、责任人、重试次数与审批结果;产物平面保存代码、文档、工单或报告。聊天记录可以保留为审计事件,却不应成为当前真相的唯一来源。
这会改变技术选型。评估 Agent 框架时,持久化、恢复、事件记录、权限挂钩和结构化输出的重要性,不应低于模型适配数量。一个支持十种模型但无法可靠恢复任务的框架,可能不如只支持两种模型、却能提供 checkpoint 和幂等执行的系统。
边界是:一次性问答、短期头脑风暴和低价值个人任务,聊天记录通常已经够用。结构化设计也不是越复杂越好,过早建立庞大的状态模型会拖慢试验。判断是否需要升级架构,可以观察四个指标:用户恢复上下文所需时间、重复提问比例、无法定位当前状态的任务数,以及一次中断后需要从头执行的步骤数。
主线三:Agent 安全从“过滤恶意提示”转向“控制数据流与能力边界”
本周安全资讯最重要的共同点,是攻击并不依赖模型输出明显的恶意代码。攻击者只需要让不可信数据进入一个拥有高权限工具的上下文。
加密上下文注入案例中,恶意指令以密文形式存在于网页,输入过滤器只能看到无法匹配的密文。模型在代码执行环境内完成解密后,明文指令才出现,并进一步诱导 Agent 使用导航能力外传数据。Grok 零点击攻击分析
MCP 场景暴露的是同一类问题:良性的工具服务器也可能返回恶意内容。PR 标题、Issue 文本或数据库字段只是数据,但模型难以稳定区分“这是待分析内容”与“这是下一条指令”。攻击者无需控制 MCP 服务器,只需控制服务器读取的数据源。MCP 信任边界分析
Claude Code 2.0.65 以前的漏洞则更直接:项目级 ANTHROPIC_BASE_URL 在仓库信任提示前被应用,打开恶意仓库就可能把 API 密钥发送至攻击者控制的端点。该问题已经在 2.0.65 修复。Claude Code 漏洞说明
三件事放在一起看,结论很清楚:文本扫描不是可靠的安全边界,信任弹窗也必须位于任何配置加载和网络请求之前。真正有效的控制应落在模型之外,包括最小权限、默认拒绝的网络出口、凭据隔离、工具参数校验、敏感操作审批以及可追踪的数据流。
这也解释了为什么 Agent 不应自己管理关键状态。支付调用超时后,LLM 无法判断“扣款成功但响应丢失”还是“根本没有扣款”。正确方式是由确定性外层循环记录 pending 状态,通过账本等带外渠道确认结果,再决定是否重试。Agent 状态机实践
编辑判断是:未来 Agent 安全评审的基本单位,不应是 Prompt,而应是“数据来源—模型判断—工具能力—外部影响”构成的完整路径。只检查系统提示词,等于只审查应用界面而不审查后端权限。
成本上的含义同样现实。真正的沙箱、独立凭据、出口代理和审计系统会增加基础设施支出,但它们也使模型和工具可以在明确边界内自动运行。没有这些控制,团队只能依赖人工确认每一步,自动化率上不去;或者放开权限,承担不可接受的事故风险。
适用边界是:纯离线、无密钥、无网络、只读数据上的生成任务,风险显著较低,不必套用支付系统级别的控制。验证指标应包括未审批外发请求数、Agent 可读取的敏感变量数量、工具权限覆盖范围、重复副作用次数、从 trace 还原一次事故所需时间,以及恶意工具返回内容的拦截率。
AI 编程与工程实践

本周模型发布的数字很亮眼,但程序员不该把基准提升直接翻译成生产力提升。
Gemini 3.7 Flash 在软件工程、Web 开发和自动化基准上均有改善,并以阶段性低价争夺 Agent 开发者。Gemini 3.7 Flash 发布报道 Deepseek V4-Flash-Vision-Exp 则支持图片理解、工具调用以及 OpenAI、Anthropic 风格接口,单次请求最多可包含 600 张图片,每张图片最多消耗 384 Token。The Decoder
这些能力适合两个方向:一是从截图、报错界面和图表中提取上下文,减少人工转述;二是让便宜模型承担分类、提取、格式化和初步诊断,把高成本模型留给少量需要复杂判断的步骤。
但基准不是采购结论。文本分类 API 的选型方法提供了更稳妥的范式:冻结一组脱敏且保持真实形态的测试集,为关键标签设置召回率和 JSON 有效率底线,只有越过底线的候选模型才比较成本、延迟和区域要求。文本分类 API 选型实践
这套方法同样适用于 Coding Agent。团队应从真实任务中抽取固定案例,覆盖新功能、跨文件重构、依赖升级、数据库迁移、边界输入和失败恢复。评分不能只有“最终测试是否通过”,还应记录无关改动、首次补丁成功率、工具调用次数、人工干预次数和总 Token 成本。
结构化输出也应成为默认配置。要求模型“只输出 JSON”不是契约;JSON Schema、工具调用参数和运行时校验才是契约。失败时应在边界层重试或降级,不能让格式错误一路流入数据库和下游队列。生产级 Agent 七条经验
至于本地模型、开源模型和云端模型的选择,素材中的基准成绩可以作为候选线索,但不足以单独支持生产结论。真正需要测的是团队自己的代码语言、仓库规模、工具链、硬件成本、响应延迟和数据合规要求。模型榜单决定谁进入测试,内部评测才决定谁进入生产。
AI 办公与生产力
AI 办公的下一步,不是给每个系统右下角加一个聊天按钮。
聊天入口最大的问题,是它要求用户重复搬运上下文:解释客户是谁、任务走到哪一步、哪些字段已经确认、谁拥有审批权。模型完成回答后,结果又被锁回对话,无法自然进入工单、排期、文档版本和业务状态。
更合理的产品形态,是让 Agent 出现在工作发生的地方。安全人员在告警队列中看到风险摘要和处置建议,产品经理在需求看板中看到影响范围,客服在账户历史旁看到下一步动作。Agent 读取的不是一段临时拼接的背景说明,而是经过权限过滤的结构化上下文。IT之家
这并不意味着取消自然语言交互。自然语言仍适合表达意图、补充约束和处理例外,但任务状态要回写业务系统,生成物要有版本,决策要能查询。用户第二天回来时,应看到“当前状态”,而不是重新阅读昨天的四十条消息。
对于知识工作团队,最值得优先改造的不是“写一段更好的总结”,而是三个高摩擦环节:从讨论中提取待办、把待办关联到责任人与截止条件、在状态变化时留下可审计记录。只有完成这三步,AI 才从内容助手变成流程组件。
衡量办公 Agent 也不能只看生成速度。更有意义的指标是:恢复任务上下文需要几分钟,多少结论能自动回写原系统,人工复制粘贴减少多少,异常任务是否进入明确的人工队列,以及员工能否解释某项动作基于哪些数据和审批。
风险与边界
第一类风险是把概率性判断误当作确定性状态。
支付、发信、删除、发布和权限变更都可能出现“操作成功但响应丢失”。如果把错误文本直接交给 LLM 决定是否重试,重复扣款或重复发送只是时间问题。所有具有副作用的工具都应支持幂等键,并由外层状态机保存 pending、success、failed 等明确状态。Agent 状态机实践
第二类风险是把工具返回内容误当作可信指令。
网页、PR 标题、Issue、邮件正文和数据库字段都可能携带提示注入。工具可信,不等于工具读取的数据可信。系统需要记录每段上下文的来源,并限制模型根据不可信内容可触发的工具集合。MCP 信任边界分析
第三类风险是把容器、超时和内容过滤当作完整沙箱。
78 毫秒的实测说明,攻击者根本不需要长时间运行。真正的隔离至少包括文件系统、网络、进程或内核以及资源四个维度;尤其是“能读密钥且能访问外网”的组合,必须优先拆开。AI 代码执行沙箱实测
第四类风险是缺乏恢复能力。
生产 Agent 需要 trace、步骤上限、退避重试、checkpoint、成本预算和模型切换能力。一个运行到第 31 步失败的任务,应从检查点恢复,而不是重新支付前 30 步的模型与工具成本。工具调用必须幂等,Prompt 和模型版本必须可追踪。企业级 Agent 工程清单
最后要警惕漂亮数字。无论是模型基准、记忆模块的错误率,还是某个 Agent 的自主完成率,如果没有公开测试集构成、对照条件和失败定义,都只能作为进一步验证的线索,不能直接成为采购依据。
程序员行动清单

-
给中高风险 Coding Agent 任务增加“开工门”。
适用于多人协作、跨文件修改和涉及数据模型的团队。要求 Agent 在写代码前输出目标、非目标、约束和验收条件。收益是提前暴露错误假设;风险是小任务被流程拖慢。用首次验收通过率、返工工时和澄清轮数验证,两周后再决定哪些任务可以免审直行。 -
建立 30 至 50 个真实任务组成的锁定评测集。
适用于正在比较多个模型或编程工具的团队。收益是把模型选型从主观体验变成可复现实验;风险是测试集泄漏或被反复调参污染。开发集和锁定集必须分离,并记录模型版本、Prompt 版本、工具权限、总成本和失败类型。 -
把 Agent 状态从对话记录迁入数据库。
适用于运行超过一天、存在多人接力或需要审批的工作流。收益是可查询、可恢复、可审计;风险是状态模型过度设计。先只保存任务 ID、阶段、负责人、输入版本、产物地址和最后一次成功检查点,用恢复上下文耗时和中断后重跑步骤数验证效果。 -
为所有有副作用的工具增加幂等键和 pending 状态。
适用于支付、发信、创建工单、数据库写入和发布操作。收益是避免超时后的重复执行;风险是幂等键粒度错误导致合法操作被合并。通过注入超时、断网和重复请求,验证同一业务动作最多产生一次外部效果。 -
默认关闭代码执行环境的网络出口。
适用于运行模型生成代码、处理不可信仓库或浏览网页的团队。收益是切断凭据外泄路径;风险是依赖下载和外部 API 调用受阻。采用域名白名单、短期凭据和独立工作目录,并用不打印密钥值的暴露面脚本检查环境变量、主目录文件和网络可达性。 -
审计 MCP 与工具返回内容的信任等级。
适用于接入 GitHub、工单、邮件、浏览器和数据库的 Agent。收益是降低间接提示注入风险;风险是过度拦截降低自动化率。给外部文本标注来源,禁止其直接触发高权限工具,再用带恶意指令的 PR 标题、Issue 和网页做红队测试。 -
立即核对 Claude Code 版本与项目级配置加载顺序。
适用于使用 Claude Code、经常打开外部仓库或固定工具版本的团队。收益是修复已披露的 API 密钥外传风险;风险主要来自升级兼容性。确认版本不低于 2.0.65,并在隔离环境中测试打开包含自定义ANTHROPIC_BASE_URL的仓库时,信任确认前不会发出请求。Claude Code 漏洞说明 -
给长链路 Agent 补齐 trace、步骤上限和 checkpoint。
适用于超过五次工具调用、运行成本较高或需要夜间无人值守的系统。收益是缩短故障定位时间并减少重跑成本;风险是观测数据泄露客户内容。日志只保存必要元数据和脱敏输入,用故障平均定位时间、单任务最大成本和恢复成功率验收。
下周验证点
-
模型价格下降会先推动“小模型路由、大模型判断”的分层架构,而不是让所有步骤统一切换到新模型。
可验证信号是更多 Agent 框架公布步骤级模型路由、成本预算或按任务难度切换模型的方案;若开发者普遍直接用单一模型覆盖全流程,则该判断被削弱。 -
Agent 产品会继续从聊天入口迁向业务系统内嵌。
可验证信号是更多 Harness、SDK 或产品发布强调状态持久化、审批节点、业务对象和自定义界面,而不是只展示聊天 Demo;若新品仍以独立对话窗口为主,则迁移速度低于预期。 -
间接提示注入的防护重点将从内容分类转向工具权限和网络出口控制。
可验证信号是厂商新增来源标记、工具分级授权、默认拒绝出口、敏感动作审批或解密后内容检查;若修复仍主要依赖关键词过滤和系统提示词,则架构性风险仍未被正面处理。 -
Coding Agent 的评测会更重视完整任务成本,而非单轮基准分数。
可验证信号是新的评测开始同时披露重试次数、工具调用、人工干预、Token 消耗和回归缺陷;若报道仍只比较单一正确率,工程选型与榜单之间的鸿沟不会缩小。 -
生产团队会把“可恢复执行”列为 Agent 框架的基础能力。
可验证信号是 checkpoint、幂等工具、持久化运行记录和失败队列成为框架默认功能;若长任务仍依赖完整重跑,Agent 的成本与稳定性问题将继续集中暴露。 -
多模态模型的真实价值将首先在截图诊断、界面复现和文档处理场景得到验证。
可验证信号是公开案例提供端到端任务成功率和人工节省时间,而不仅是内部 Agent 基准;若只有厂商自测分数而缺乏真实工作流数据,应继续保持观望。
参考
- AI 编码代理防坑指南:先澄清意图再动手
- Simon Willison:More than just code review
- Gemini 3.7 Flash 发布报道
- Deepseek V4-Flash-Vision-Exp 报道
- Agent 的意图、状态与产物三平面架构
- 生产级 Agent 的七条经验
- 企业级 Agent 的可观测性、测试与容错
- Agent 推理引擎与状态机解耦
- 文本分类 API 的工程化选型方法
- DOOM 从 C 迁移到 Rust 的实践
- Grok 加密上下文注入攻击分析
- MCP 工具返回内容的信任边界
- AI 代码执行沙箱实测
- Claude Code 2.0.65 前版本漏洞说明
- OpenAI 开源 Codex Harness 报道