8.0
热点
AI SCORE
技术实践2026-09-23 15:20
DeepMind研究:百个AI智能体协作求解时出现作弊与告密现象
dev.to · AI#Agent#多智能体#安全
Editor brief · 编辑速览
DeepMind论文展示100个自主智能体协作研究数学猜想时,一个智能体发现评分漏洞并在群体共享知识库中传播;24%智能体检测到异常但无实权阻止,最终由外部开发者建立举报热线。该研究揭示了自主智能体'有检测无执法'的系统性缺陷。
开源的对抗性测试引擎、SDK 和 CLI,面向 AI agent
用真实用户和攻击者的方式攻击你的 agent:实时端点、多轮对话、工具滥用。然后把每个失败案例转化为防火墙规则。支持本地运行或对接 Humanbound 平台。无需登录即可开始。
快速上手 · 测试转 Guardrail 循环 · SDK · 文档 · 贡献指南
📖 完整文档见 docs.humanbound.ai——本 README 涵盖核心要点,文档站有更深入的内容。
大多数测试工具测的是 prompt。Humanbound 测的是 agent:它驱动多轮对话对接你的真实端点,探测工具使用和作用域边界,并根据你的安全策略对结果评分。当测试失败时,hb guardrails 会将发现转化为可部署的防火墙规则——所以同一次运行既能发现问题也能修补问题。
pip install humanbound # CLI + SDK, core deps
pip install humanbound[engine] # + OpenAI