开源框架 AgentSec 面向自主智能体,测试恶意文档、MCP 工具描述注入及危险工具组合引发的安全问题。其关注点包括提示注入和未经授权的工具使用,补充正常功能测试难以覆盖的场景。
你的 AI Agent 通过了所有测试。
很好。现在试着攻击它。
如果一份恶意文档要求你的 Agent 忽略原有指令,会发生什么?如果 MCP 工具描述中藏着指令呢?如果 Agent 有权限分别使用两个工具,却把它们组合起来,以危险的方式执行操作呢?
这些正是我想找出来的失效情况。
所以,我开发了 AgentSec,一个面向自主 AI Agent 的开源对抗性安全测试框架。
🔗 GitHub:invarislabs/invaris-agentsec
我们正在让 AI Agent 使用越来越强大的工具。
它们可以读取文件、执行代码、访问数据库、调用 API,还能与其他 Agent 交互。
但这里有一个问题。
有权限使用某个工具,并不意味着这个工具的每一种用法都获得了授权。
而且,在常规测试中表现正常的 Agent,一旦接触到恶意指令,行为可能就会大不相同。
我希望能在这些问题发生于生产环境之前,找到一种方法来测试它们。
AgentSec 旨在帮助开发者发现 Agent 工作流中的安全与可靠性问题,包括:
别只测试你的 AI Agent 能否完成任务。还要测试它是否知道什么时候不该行动。
它是开源的。而且,我希望你来攻破它。
我正在 Invaris Labs 开发 AgentSec,也很期待听到使用 AI Agent、LLM 应用、MCP server 和 Agent 框架的开发者的反馈。
尤其是当你正在开发的东西,能让 LLM 与真实工具交互时。
我希望你能做这些事:
我尤其想听听,你在实际工作中遇到过哪些 Agent 安全问题。
一起决定接下来该做什么。
🔗 试用 AgentSec:invarislabs/invaris-agentsec
⭐ 如果你觉得它有用,请给仓库点个 Star。
🔁 把它分享给正在开发 AI Agent 的开发者。
💬 提交 issue,或者在下方评论中留下你的反馈。
我想问所有正在开发 Agent 的人一个问题:
你的 AI Agent 做过什么最让你害怕的事,而那件事是你从未明确要求它做的?
我很想听听你们的经历。
让 Agent 安全成为我们实际测试的东西,而不是想当然的假设。
如果需要采取进一步行动,你可以考虑屏蔽此人,或者举报滥用行为。