在腾讯DSH安全论文基础上,详细解析了工具调用前Guardrail和输出后Verification的具体实现方式,包括命令注入检测、SSRF防护和跨工具数据流完整性校验。
DeepSeek Harness(DSH)作为近期最火的开源 Agent 编排框架,GitHub 星标破万。但腾讯 AI-Infra-Guard 团队刚发布的安全评估论文(arXiv:2608.16393)揭示了一个严峻事实:在受控测试中,间接 Prompt 注入攻击成功率高达 17%-25.5%。
腾讯团队对 DSH 进行了系统性安全评估,主要发现包括:
论文地址:https://arxiv.org/abs/2608.16393
DSH 的架构中,Agent 通过 MCP 协议与外部工具通信。攻击路径如下:
攻击者控制的外部内容 → MCP工具返回 → Agent上下文 → 触发恶意操作
关键点在于:攻击不直接针对 LLM,而是利用 Agent"信任工具返回"的特性。传统的输入过滤对此完全无效——因为恶意 payload 来自 Agent"自己"调用的工具。
在网页内容中嵌入指令覆盖 Agent 原始任务
输入侧过滤不够,需要在工具调用执行前和工具输出消费前做运行时拦截:
我们开源了 Correctover——一个 DSH 运行时安全插件,在工具调用链路中插入验证层:
const { GuardrailProvider } = require('correctover');
const guardrail = new GuardrailProvider({
mode: 'audit',
dimensions: ['structure', 'schema', 'identity', 'integrity', 'security']
});
7 维运行时验证:Structure/Schema/Latency/Cost/Identity/Integrity/Security
语义感知引擎:不是关键词匹配,而是理解代码意图
sub-millisecond 延迟:Node.js 核心验证 P50≈2.7μs
框架无关:不仅支持 DSH,任何基于 MCP 的 Agent 框架都可接入
npm install correctover
// dsh.config.js
module.exports = {
plugins: ['correctover/dsh']
};
非 DSH 环境使用 standalone 模式:
const { scanToolCall, verifyOutput } = require('correctover');
const result = scanToolCall({
tool: 'execute_command',
args: { command: userInput }
});
if (result.verdict === 'BLOCK') {
// 拦截恶意调用
}
安全工具最大的坑是误报阻断正常业务。Correctover 默认 audit-only 模式:
这比上来就 block 的方案实用得多——你可以先知道自己"正在被打",再决定怎么防。
DSH 这类 Agent 编排框架会越来越火,攻击面也会越来越大。腾讯这篇论文的价值在于用数据证明了:当前 Agent 框架的安全防护严重不足,运行时验证不是可选项,是必选项。
Correctover 的 CCS(Correctover Conformance Shape)标准已经作为 IETF 草案提交(draft-correctover-ccs),目标是建立 Agent 运行时验证的通用框架。
安全不是事后加的功能,是 Agent 跑起来就要有的东西。
本文基于腾讯 AI-Infra-Guard 团队公开论文(arXiv:2608.16393)的技术分析,所有测试数据引用自原论文。