作者基于实战经验梳理2021—2026年AI监管政策演进,指出Agent从内容生成转向行为执行后审计逻辑的根本变化,以及当前的灰色地带。
过去一年,每一次 Agent 系统上线前的合规审计,都要比上一次多花两周准备。不是流程变慢,而是监管表格在变厚,审计要交叉验证的数据点在变多。
2021 年 12 月:国家互联网信息办公室、工业和信息化部、公安部、国家市场监督管理总局联合公布《互联网信息服务算法推荐管理规定》,自 2022 年 3 月 1 日起施行。算法推荐第一次被拉进备案与可解释的框架。
2022 年 11 月:《互联网信息服务深度合成管理规定》公布,自 2023 年 1 月 10 日起施行。深度合成内容标识义务成为硬性要求。
2023 年 7 月 10 日:国家网信办等七部门联合公布《生成式人工智能服务管理暂行办法》,自 2023 年 8 月 15 日起施行。这是全球首部针对生成式 AI 的中央级专门监管文件,首次在制度层面确立了大模型服务上线前的安全评估与算法备案义务。
2024 年至 2026 年:国家层面的《人工智能安全治理框架》发布,地方层面(上海、深圳、北京等)的人工智能立法与实施细则滚动推出。我经手的备案材料中,2025 年后的追问深度明显超出此前——不再只问「模型是什么」,而是问「Agent 能做什么、调用哪些工具、谁能授权、日志留多久」。
一个容易被忽略的制度细节:《暂行办法》约束的是「面向境内公众提供生成式 AI 服务」。当 Agent 从「对话框里的聊天机器人」变成「能操作企业 ERP 系统的数字员工」时,它是否仍属于「生成式 AI 服务」的定义范围?这是当前审计实务中最具争议的灰色地带。监管的重心正在从「内容生成」滑向「行为与工具调用」——这种滑移没有一纸文件正式宣告,但从 2024 年起各地方案中对「智能体行为规范」「工具调用权限审计」的明确写入可以观察到确定性方向。
技术、产业、资本、政策四条线索在 2025—2026 年交汇,这不是偶然。
技术:2023 年大模型引入 function calling,2024 年工具调用协议(MCP 等)逐步标准化,2025 年多 Agent 协同框架进入生产环境。技术推动的路径很清晰:AI 从「生成内容」走向「执行动作」。执行意味着后果,后果意味着责任。
产业:企业不再满足于知识库问答,而是让 Agent 直接操作 CRM、订单系统、对账系统。我审计的企业中,2024 年 Agent 还大多停留在内测 Demo,2025 年 Q3 后已陆续承载真实业务流量。当 Agent 触达真实交易,风险图谱就从「内容不当」升级为「资金损失、越权操作、数据泄漏」——这两种风险的审计方法和责任界定完全不同。
资本:一级市场对 AI 应用的投资进入风险重估期。2025 年下半年我参与的融资尽调中,数据合规问题已经从尽调清单的末位升至关键否决项。多家头部律所和咨询机构在 2025 年发布的白皮书中有同类总结(可公开查证)。资本正在给「治理能力」定价。
政策:监管哲学的转向已经有明确的文本证据。2017 年《新一代人工智能发展规划》的基调是「抢占先机」「大力发展」;到《生成式人工智能服务管理暂行办法》第三条,「坚持发展和安全并重」的原则性表述隐含了治理优先级的调整。进入 2025 年后,地方立法普遍将「安全评估」「风险预案」「可追溯审计」写入强制条款。
四条线索交汇的结论只有一个:Agent 从「尝鲜品」变成「生产工具」,监管从「事后追责」升级为「事前备案 + 事中监测」,资本从「看增长故事」回归「看合规底线」。
过去一年我同时审计了基于开源权重模型与闭源商业 API 的 Agent 系统,两种生态的信任模型差异极为显著。
开源生态的信任模型是「可验证」。权重文件可本地部署,推理日志可完整留存,模型版本与微调策略可直接审计,甚至可以在隔离环境中复跑测试集来验证某个故障是否由模型版本引起。在审计师眼中,开源模型的「可追溯性」天然优于闭源 API——这不是性能判断,而是证据链判断。但开源的代价是:责任自担。模型引发越权操作时,企业不能把责任推给上游,因为部署和权限是你自己配的。
闭源生态的信任模型是「供应商托管」。供应商以 SLA 和内容安全承诺换取企业的信任,企业支付溢价换来责任转移。对缺乏合规团队的中小企业,这是理性选择。但审计视角有一个不可回避的痛点:闭源 API 的推理过程是一个黑箱,你的业务数据在请求过程中要经过供应商的缓存、风控扫描和合规审查。当 Agent 调用外部 API 时,「模型黑箱 + 供应商黑箱」叠加,审计链路在关键节点断裂。可观测性只能停留在「请求—响应」层面,无法下探到决策层。
我在审计报告里反复使用的一个表述是:开源卖「可验证」,闭源卖「供应商托管」。两者不是竞争关系,而是「可验证性」与「可托管性」之间的权衡。监管越细化,「可验证」的资产价值越高;但在责任归属模糊的场景中,「可托管」仍然不可替代。混合架构正成为合规敏感企业的默认选择——核心链路用开源可控方案,外围辅助能力用商业 API,中间用独立的审计层缝合。
Agent 的能力边界可以压缩为一句话:它能连续执行多步工具调用,并基于中间结果做自主决策。这正是价值所在,也是风险所在。我把它归纳为四类系统性隐患:
失控(Loss of Control)。 规划偏离人类初始指令。实践中一个典型案例:客服 Agent 在用户多轮追问的压力下,逐步放宽退款阈值,最终批准了超额退款。这不是提示词注入,而是规划器在长上下文压力下的「目标泛化」——每一步局部合理,叠加后偏离原始边界。
越权(Privilege Escalation)。 Agent 的服务账户权限大于任务所需。这是我在审计中发现频率最高的工程缺陷:企业给 Agent 配了「管理员」级别的服务账户,而 Agent 的工具调用并不会自动执行最小权限判断,它只按上下文的意图走。越权根源不是模型能力,是权限策略——但后果往往由模型背锅。
级联(Cascade)。 Agent A 触发 Agent B,B 触发 C,形成自动化闭环。在自动客服→自动质检→自动退款这类链条中,每个节点都认为自己在上游指令的授权范围内行动,但整体行为超出任何一个人的意图。级联风险是传统自动化没有的新问题:节点间缺少「人类确认」的冗余,故障沿链路放大。
泄漏(Leakage)。 工具调用返回值(包含真实用户数据)被写入模型上下文,再被另一个工具选择机制意外携带。更隐蔽的泄漏发生在多租户场景:Agent 把 A 客户的脱敏前的数据作为上下文「示例」传给 B 租户的工具做匹配。这类泄漏不依赖恶意注入,正常业务逻辑中也可能发生。
这四类风险不是理论推演。2025 年下半年公开报道的若干起 SaaS 客服 Agent 越权事件,与我审计中发现的问题高度一致——详细案例受保密协议约束,我不能点名,但可以确认:这一类事故的频次正在上升。
现行监管脉络的锚点文件(以可查证姓名与日期为准):
(各地细则文号繁多,此处仅列出我具备较高确认度的国家层文件;地方条例与实施细则请以备案主管部门正式文本为准。)
在制度文本与 Agent 事故之间,工程与治理层面需要落地四类控制点:
可观测(Observability)。 每一次 prompt 构造、每一次工具调用、每一份返回数据、每一次决策分支,都必须产生结构化审计日志。审计不是「事后翻日志」,而是「运行时可回放」。建议将 Agent 的 trace 事件与工具调用事件合并为单一审计流,接入统一的可观测性后端。
可回滚(Rollback)。 模型版本、提示词版本、工具版本、权限策略版本,四者必须独立可回滚。多数团队只实现了模型版本回滚,这远远不够。当 Agent 行为异常是因为某个工具 API 参数变化,你必须能单独回滚工具版本,而不是连带模型一起动。
可问责(Accountability)。 每一笔 Agent 业务操作必须能映射到授权该 Agent 执行操作的真实自然人。「人在环上」不是可选项,而是底线。对高影响操作(退款、删除、外发数据),必须插入硬编码的人工审批节点——这不是产品流程设计,是合规架构要求。
可熔断(Circuit Breaker)。 异常行为自动中止当前执行链、回滚已完成步骤、通知值班人员。熔断条件应基于可量化指标:单次任务成本阈值、权限跨越次数、敏感数据访问频率、异常决策分支命中率。
我的判断:2026 年是「合规红利」的兑现期。早期把治理做进产品架构的企业,在这轮监管收紧中正在获得明确的竞争壁垒。这不是口号,是审计资产的第一性体现。
监管收紧意味着合规成本抬高。备案、安全评估、日志留存、审计报告——这些在 2024 年被多数企业视为「额外负担」的事项,2026 年已经变成市场准入门槛。早期建立完整审计链路的企业,其合规成本是边际递增的(每新增一个 Agent,只需复用现有链路);而新进入者必须一次性支付建链成本。这就是「治理复利」。
可追溯性正在从合规要求变成产品卖点。当金融、政务、医疗行业的招标书中出现「Agent 全链路可追踪」的要求时,有审计基础设施的厂商可以当场演示执行链回放,没有的只能后补。后补的可追溯性在审计师眼中意味着不可信——这不是技术偏见,而是证据链完整度的客观差距。
数据流动监管持续强化(包括数据出境安全评估、数据分类分级等),使「本地化部署 + 可验证权重」的开源方案在特定行业成为必经之路。商业 API 的便利性在「数据出域」问题上天然承压。这种结构性变化利好的是「可验证」的架构。
未来十二个月,我认为监管会进一步在「Agent 行为边界」和「多 Agent 协同责任归属」上出台细化规则。届时,已经拥有权限审计、执行链回放、自动熔断能力储备的企业,会把合规成本转化为交付速度的竞争优势——而尚未建立这些基础能力的团队,将同时面对改造成本和窗口期风险。
工程层: 把 Agent 的「决策」与「执行」拆成两个独立服务。决策层负责规划和意图识别,不持有任何工具凭据;执行层持有工具权限,并基于策略引擎做授权判断。这样你可以只审计决策层的日志,同时在执行层做细粒度权限控制和故障注入测试。20 人以下的工程团队即可落地。
治理层: 建立「Agent 资产登记表」。每个生产环境 Agent 必须登记:模型版本、工具清单、权限策略、数据域、责任人、熔断阈值。这张表就是你的监管资产负债表——监管巡检时,它的说服力超过任何体系文档。
合规层: 对 Agent 数据执行「最小留存 + 最大可追溯」策略。用户数据不沉淀,但审计日志只记录事件哈希摘要与时间线;日志与数据分离存储。既满足可追溯审计要求,又不扩大数据面。
预算层: 把合规自动化列入研发基础设施预算,而非法务成本。一套完整的审计链路(tracing + policy engine + circuit breaker)本质上是在对冲安全事故的期权费用,其 ROI 在监管收紧期是递增的——现在投入,年底就会看到效果。