重要的实证研究,系统揭示AI代理在企业应用中存在的安全隐患。对开发者设计和选择AI系统具有关键参考价值。
学术研究人员开发的新基准表明,基于 LLM 的 AI agents 在标准 CRM 测试中表现低于平均水平,未能理解保护客户机密的必要性。
由 Salesforce AI 研究员 Kung-Hsiang Huang 领导的团队表明,使用依赖合成数据的新基准,LLM agents 在可于单个步骤中完成的任务上达到约 58% 的成功率,无需后续操作或更多信息。
使用基准工具 CRMArena-Pro,该团队还表明当任务需要多个步骤时,LLM agents 的性能会下降到 35%。
LLM agents 对机密信息的处理突显出另一个令人担忧的问题。上个月底发表的一篇论文表示:"agents 表现出较低的保密意识,虽然可以通过有针对性的提示进行改进,但通常会对任务性能产生负面影响。"
Salesforce AI 研究团队主张,现有基准未能严格衡量 AI agents 的能力或局限性,并且在很大程度上忽视了对其识别敏感信息和遵守适当数据处理协议能力的评估。
BT 首席执行官称 AI 可能带来更多裁员,暗示 Openreach 可能出售
专家称大型推理模型在压力下会失效
ChatGPT 的推出像首次原子武器试验一样永久污染了世界
由于推理成本困扰云客户,企业 AI 采用停滞不前
研究部门的 CRMArena-Pro 工具被输入逼真的合成数据管道来填充 Salesforce 组织,该组织用作沙箱环境。agent 接收用户查询并在 API 调用或对用户的响应之间决定,以获取更多澄清或提供答案。
"这些发现表明当前 LLM 能力与现实世界企业场景的多层面需求之间存在显著差距,"该论文表示。
这些发现可能会让 LLM 驱动的 AI agents 的开发者和用户感到担忧。Salesforce 联合创始人兼首席执行官 Marc Benioff 去年告诉投资者,AI agents 对这家 SaaS CRM 供应商来说是一个"利润率非常高的机会",因为它在客户使用 AI agents 帮助每名员工完成更多工作所产生的效率节省中获得了一部分。
英国政府表示,它将通过数字化和效率驱动在 2029 年前实现 138 亿英镑(187 亿美元)的节省,该驱动在一定程度上依赖于 AI agents 的采用。
AI agents 可能确实有用,但是,组织应该谨慎地在好处得到证实之前依赖它们。