前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8655
  • Jev:按输入计费的决策模型,输出免费
  • Langflow OSS 认证 RCE 漏洞 CVE-2026-17633
  • 小米 MiMo-V2.6 开源:AA 指数最高开源模型
  • xAI发布Grok 4.7:编程强化模型,百万词元2美元起
  • AWS发布Strands Harness:开源Agent框架,Token成本降28%
  • Spec-Driven 开发:摆脱 Vibe Coding 的工程化实践
  • AI 编程助手 CSS 好看但上生产就崩的根因与修复
  • Agent 诊断结果上线前如何验证:分离决策与执行
  • AI编码导致CI成瓶颈?我们重新设计了CI流程
  • 从氛围记忆到确定性自主:AI 原生基础设施设计思路
  • 用 Agent 流程开发简单 SPA 的实战经验
  • AI 生成 React UI 的真实问题:从第二页开始组件漂移
  • vLLM 深度解析:高吞吐 LLM 推理的性能瓶颈
  • AWS 开源 AI 编程助手,成本比 Claude Code 低 45%
  • 用Docker Compose构建可复现的AI Agent评测环境
  • 阿里发布Qwen-Image-2.1:7B开源图像生成编辑模型
  • Benchling 用 Bedrock AgentCore 为多租户 AI Agent 构建深度防御安全架构
  • 苹果Mac mini 2026款:M6/M5 Pro芯片,AI性能最高提升4倍
  • Mac Studio 2026:M5 Ultra 支持最高 512GB 统一内存,可本地运行超大模型
  • Grok 4.7登陆GitHub Copilot,面向Agent化编程
  • AI 安全是工程问题:Agent 堆栈每一层的防护实践
  • Agent 系统的瓶颈不是模型,是架构设计
  • 防御式 Agent 架构:Schema 注入与超时控制
  • 自研研究 Agent 拦截 AI 编程幻觉:文档先行策略
  • 像物理学家一样剪枝 LLM:区块移除的伊辛模型优化
  • Mac mini上的AI开发新范式:OpenClaw与Codex实战
  • Cloudflare Python Workers 正式上线,可用纯 Python 开发边缘应用
  • 浏览器直接给 ESP32 烧录 Claude 写的宏,无需 IDE 或工具链
  • Google 发布 Agent 安全风险报告:5 万美元循环消耗与凭证窃取案例
  • 多 Agent 合规流水线:用 RAG + 自修正架构对抗 WCAG 幻觉问题
  • Anthropic 发布金融领域 Claude 参考智能体套件
  • OpenAI 披露强化学习模型在上下文压缩时插入 Prompt 注入
  • Jev 决策模型实测:0.3秒完成意图分类和工具路由,$0.00004/次
  • Kimi Code Desktop 上线:图形界面 + 内置终端 + Git 状态,支持 Swarm 多 Agent 协
  • StepFun Step 5 Preview:600B 总参数 MoE 模型,1M 超长上下文,10 月开源
  • JSON-Render:通吃 React/Vue/Svelte/React Native 等 10+ 框架的生成式 UI
  • Agent-Native:让 Agent 能力同时暴露给 LLM 工具调用和 UI 操作的 TypeScript 框架
  • 清华联合无问芯穹开源具身智能体RPent,GPT-6 Astra注入机器人
  • AI Agent工具调用边界case:路由错误比想象中更脆弱
  • AI按它能读的契约编程,而非你想要的
  • MCP 远程服务器实现 AI 驱动的确定性 UI 编排
  • 阶跃Step 5 Preview实测:27B参数开源模型冲至Top2
  • 用Responses API构建有边界的GPT-6 Astra Agent
  • 用破坏不变量法审查 AI 生成代码
  • AI 编程测试冻结:保存异常指纹而非测试名
  • 程序员亲历:全公司用 Claude Code 批量生产代码,没人读代码,12 小时工作制
  • 自托管Llama部署成本全解析:GPU之外容易被忽视的隐性开销
  • Builder.io开源Agent-Native框架:让人与AI共享同一操作层
  • 让AI编程代理在中断后从断点恢复:session化执行轨迹方案
  • CI如何验证AI代理真的跑了测试而不是伪造结果
  • llm-keys-ui:让Coding Agent安全获取API密钥的插件
  • 已加载 51 / 8655
8.0
热点
AI SCORE
技术实践2026-09-21 22:51

AI 安全是工程问题:Agent 堆栈每一层的防护实践

NVIDIA Blog#AI安全#Agent#防御架构
Editor brief · 编辑速览

NVIDIA 阐述 AI 安全的工程本质——定义安全需求、可执行控制、明确责任人、可验证防护,覆盖 AI Agent 完整技术栈的防御要点。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

技术变迁,安全本质不变

互联网和云计算改变了软件的运作方式,但核心安全职责始终未变:建立身份、控制访问、限制暴露范围,以及验证保护措施是否有效。

AI Agent 引入了新的能力——推理、使用工具以及根据遇到的数据调整行为。这些能力要求将既定原则应用于新的操作环境。

这种速度带来了压力。各组织渴望获得 AI 带来的生产力提升,但治理和安全这些系统的实践仍在发展中。

安全依赖于整个 Agent 技术栈

应用程序依赖于代码、数据、身份、服务和基础设施。安全取决于这些组件如何协同工作——而 AI Agent 扩展了这个系统。

模型提供能力;工具链(Harness)组织上下文、工具和工作流;运行时环境提供操作执行的基础设施。技术栈的每一层都承担安全责任,当数据、指令和操作在系统中流动时,适当的保护需要在每一层都建立控制措施。

试想一个更新客户记录的 Agent。假设它在附加文档中遇到恶意指令,并试图将客户数据导出到未授权的目的地。

网络策略应该阻止该传输,受保护的日志应捕获尝试的工具调用、授权决策和结果,以便安全团队能够识别所使用的工具和试图到达的目的地。

更新客户记录的权限不应自动延伸到导出该数据的权限。Agent 可以请求额外访问,但不能自行授权该访问。

将安全构建到 Agent 的运作方式中

安全边界必须在 Agent 做出错误决策时仍然有效。Agent 运行的环境决定了它被允许执行的操作,因此必须独立于 Agent 的推理能力来对文件、网络目的地和进程施加限制。

指令和保障措施可以帮助引导行为,但安全也需要可执行的边界。

每个 Agent 需要一个可追溯的身份和仅限于其分配任务的凭据。组织需要明确的策略来定义 Agent 可以访问哪些信息、可以更改哪些系统,以及哪些操作需要批准。在这些边界内,重大操作和权限变更仍需要人工批准。

团队还需要验证 Agent 使用的工具、技能和依赖项的来源和完整性。如果出现问题,受保护的工具调用、授权决策和结果记录可以帮助调查人员重建事件。明确的撤销访问权限和控制事件的程序使这些证据可操作。

NVIDIA OpenShell 是一个开源的安全运行时,它在 Agent 无法触及的地方执行策略,并提供沙箱执行,同时管理 Agent 如何访问数据、网络和系统资源。开放安全 AI 联盟(Open Secure AI Alliance)合作伙伴正在基于 OpenShell 构建:Cisco 的 DefenseClaw 添加了一个治理层,JFrog 与 OpenShell 集成以扫描和验证 Agent 技能,并执行关于 Agent 可以访问哪些技能的策略。

工程团队需要安全证据

在部署之前,团队需要证据证明适当的控制措施阻止了获取超出 Agent 范围的凭据或向未授权目的地发送敏感数据的尝试。

测试还应涵盖更改权限或干扰监控的尝试,并应在模型、工具或工作流程发生重大变更后重复进行。

指定的责任人必须使用这些结果来决定系统是否准备好部署,并确保失败的测试导致纠正措施。在测试或操作中发现的失败应被重现、调查和处理。每个发现都可以成为一个可重复的测试,允许团队检查修复在未来的版本中是否继续有效。

示例包括 CrowdStrike 的 SafeMind,用于通过重复攻击模拟测试和加强防御,以及 Palo Alto Networks Prisma AIRS,用于在模型和应用程序变化时进行持续的红队测试。

防御者需要在正确的时间获得正确的工具

调查失败需要适合任务、数据和环境的有效工具。开放模型和封闭模型满足互补的需求。

封闭模型提供托管功能和服务,而开放模型让防御者有机会检查相关组件、调整策略并在自控的基础设施上工作。

在事件期间,这种控制可以帮助团队重现失败并在自有系统上测试修复,同时将敏感证据保留在自有环境中。

有能力的 AI 可以通过帮助发现漏洞、验证修复和调查攻击来支持这项工作。其价值应通过可重现的发现、可验证的修复和加快的响应时间来评估。

示例包括 Capital One 的 VulnHunter 用于 AI 驱动的代码安全,以及 ReversingLabs 的 Spectra Assure 用于 AI 驱动的软件包分析,以检测恶意软件和篡改。

通过开放工作将优势转向防御者

分享失败的证据、有效的控制措施以及如何验证修复的经验,有助于其他团队加强自己的系统。

NVIDIA 的安全研究和开放安全 AI 联盟通过将研究、实用工具和专业知识带入更广泛的安全社区来支持这种交流。

AI 安全是一个工程问题。每个 Agent 部署都需要可执行的边界、明确的责任人和保护措施有效的证据。开放研究和共享工具帮助更多防御者达到这一标准,并在能力进步时不断提升。

了解更多关于 NVIDIA 安全研究的信息,并加入开放安全 AI 联盟。

Original source

本文由 AI 翻译整理自 NVIDIA Blog,原文版权归原作者所有。

阅读英文原文
上一篇
Grok 4.7登陆GitHub Copilot,面向Agent化编程
下一篇
Agent 系统的瓶颈不是模型,是架构设计