Snyk审计3984个公开AI agent技能发现36%含安全漏洞、13%有严重问题;Datadog发现伪装成用量上报的凭证窃取攻击已出现在野。
应用市场回答"这个是做什么的"非常在行。数以千计的贡献,按热度排名,可搜索,一键安装。广度是对一个真实问题的真实回答。
它们回答得不好的是"谁做的这个,我怎么知道?"在开放市场中,诚实的答案通常是一个账户名——而账户名不等于身份。
一家安全厂商审计了 3,984 个公开分享的 agent 技能,报告称 36.82% 存在至少一个安全缺陷,13.4% 存在关键问题,76 个载荷经人工确认具有恶意——其中包括一场协调行动,向单个公开市场推送了 30+ 个恶意技能(Snyk,2026 年 2 月)。另外,一个在野活跃技能被发现伪装成用量上报上传,正在窃取开发者凭证(Datadog Security Labs,2026 年 5 月)。2025-2026 年的学术调查发现,公开 agent-tool 注册表中的内容审核是响应式和社区举报式的,没有发布前代码审查,也没有标准化的发布者身份验证。
这些都是针对开放 AI-agent 生态系统的具名第三方研究的时点数据,且这些研究都没有考察我工作的框架。模式本身就是论据,而非任何一个单一数字——而这个模式正是包注册表十年前经历过的阶段,那个阶段我们大多数人还没有建立起相应的本能。
你不需要任何人的框架来应用这些。在安装一个 agent 技能之前,运行你对待依赖包相同的四项检查:
身份 —— 背后是具名的个人或组织,还是只是一个句柄?你能在早于这个列表的地方找到他们吗?
可读性 —— 你真的能读懂它做什么吗?能够略读的plain指令胜过你必须信任的 opaque 代码,尤其对于那些拥有你文件访问权限的东西。
货架本身的来源,而不仅仅是商品 —— 谁决定这东西可以放在这里?是发布前审查,还是上传然后祈祷?
修订历史 —— 当这东西被发现有问题时,发生了什么?沉默本身就是一种回答。
大部分价值在前两项和第四项检查。它们成本低廉,却是恶意上传最容易被发现的两项。
除了堆一个大杂烩,还有一种结构性替代方案,这就是我为 Claude Cowork 构建 CRAFT 所采用的——一个在 beta 期间免费且无门槛的框架,运行在 Claude Cowork 上,所以你需要在 Claude 计划中启用 Cowork;CRAFT 不在其上增加任何费用、账户或门槛。
它不采用市场模式,而是提供一个经过策划的货架: cookbook,每个都是围绕一个工作流程序列编排的菜谱集,每一步都衔接到下一步。不是搜索结果——而是行程安排。你选择哪个行程,而不是哪堆零件。交易是诚实的,值得一说:你会得到更少的广度。回报是,组装工作由一个对此负责的人完成了一次,而不是在你试图做别的事情的时刻由你完成。
策展是地板而非天花板——你可以在同样结构上编写自己的菜谱。但发货的货架不是众包上传的。
策展的主张价值几何,完全取决于策展人出错时会发生什么。所以,一个针对我自己的反面例子。
在我们自己的九份内容文件草稿中,框架被描述为开源。许可证说的却不是这样。框架自身的验证通道——菜谱的整个工作就是检查工作,有事实核查门控和 0-100 置信度评分——标记了这个声明,所有九份文件在发货前都得到了修正。那是人在第十遍阅读时会滑过的错误。
真正重要的机制不是我们很小心,而是检查无论是否有人记得要小心都会运行。
CRAFT for Claude Cowork 处于 beta,我明确说明。策展是关于用心的承诺,而非完美的承诺:当 cookbook 达不到要求时会被修订,AI 仍然会犯错,验证层正是为此而存在——任何重要的事情都要自己审查。上面任何内容都不是安全保证。它是你可以审查的来源,这是一个更小、更可检查的主张。
"值得借鉴的部分"中的四项检查适用于你从任何人那里安装的任何东西,包括我。这些检查的存在正是它们的意义所在。
Full post: https://craftframework.ai/before-you-ask-what-it-does-ask-who-made-it/