使用本地大模型的autonomous pentester在OWASP Juice Shop黑盒测试发现57个真实漏洞(8严重24高21中),完全本地执行零数据外泄,结果可复现。
我参与开发了下文提到的工具之一 Darkmoon。我尽力保持客观的态度,这不是广告。所有数字都可复现。
我想要一个老实的答案:把一个自主 AI pentester 指向它从未见过的目标,黑盒测试,就像真实的渗透测试场景。它实际上会发现什么?目标:OWASP Juice Shop,这是标准的公开易受攻击应用程序(docker run -p 3000:3000 bkimminich/juice-shop)。
我关心的关键点:大多数 AI pentester 会把你的流量和代码上传到云 LLM。对于任何接近生产环境或客户环境的东西,这都是完全不可接受的。所以真正的问题不仅仅是"它能否发现漏洞",而是"它能否在不外泄数据的情况下发现漏洞"。
对 Juice Shop 进行黑盒测试,使用本地模型(Ollama/llama.cpp),Darkmoon 的结果:跨多次运行在同一目标上会累积:14 个,然后 28 个、38 个、44 个、49 个,最后 57 个真实漏洞。
原始输出和方法论供你复现(或质疑):https://github.com/ASCIT31/Darkmoon-Benchmarks。欢迎 PR 提交其他工具的运行结果,这旨在成为一个社区排行榜。
你在其他地方看到的令人印象深刻的数字(比如白盒基准测试达到 90%)是真实的,但有附加条件:它们读取你的源代码并调用云 LLM。这是一种不同的权衡。本地黑盒运行是你真正可以对敏感目标进行的测试,无需进行数据外泄的协议讨论。
一个实验室只是起点,不是全部故事。黑盒测试倾向于广度;白盒工具优化不同的维度。随着工具的改进,数字会变化,这正是为什么基准仓库是一个活跃的、可复现的东西,而不是一张截图。
git clone https://github.com/ASCIT31/Dark-Moon && cd Dark-Moon && ./install.sh
GPL-3.0,自托管,可在本地或云 LLM 上运行。如果它能为你节省一次手动测试,一个 star 可以帮助其他防守者找到它。
你在 Juice Shop 上得到了什么黑盒测试结果?在评论中告诉我们或向基准仓库提交 PR。
For further actions, you may consider blocking this person and/or reporting abuse