前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8611
  • Qwen 3.8 发布,编程与推理能力升级
  • OpenAI Agents Python框架14天实战测评
  • 用AI编程工具远程部署服务器的无密钥方案
  • Agent 系统设计:从 Prompt 工程转向上下文工程
  • C++ 高效加载机器学习模型的完整实现
  • Word 提示注入漏洞:Copilot 被劫持 144 天未修
  • 12个AI自动化案例详解:如何集成AI到实际工作流
  • AI 框架选型完全指南:分类体系与决策方法论
  • Agent AI vs 生成式 AI:本质区别与应用边界实战指南
  • 阿里发布通义千问3.8-Max大模型
  • Agent管道的隐形故障:Fallback陷阱案例
  • 生产级流式 LLM API 客户端实现指南
  • Agent 系统中的批准陷阱:为什么状态转移需要重新验证
  • LLM 成本感知路由:用 Flash 模型减少 60% 支出的系统设计
  • AI 代码迁移引入 Bug:COBOL→Java 实验分析
  • 用 AI 助手开发浏览器扩展踩过的坑:验证比相信更重要
  • RAG 系统检索失败根本原因:数据分块策略而非模型能力
  • AI Agent 失控成本爆炸:防护实战指南
  • 开源视频生成模型 MiniMax H3
  • 华为诺亚开源 Agent 记忆系统 MindMemOS
  • Python AI Agent Prompt 注入防护三层架构
  • 从零实现经典技术:高价值学习路线合集
  • OpenClaw 语音 Agent 的实用场景评估
  • 千问 3.8-Max 正式发布:24 万亿参数待开源
  • OpenAI Astra 解决 10 个前沿研究问题
  • 阿里开源通义千问3.8-27B轻量模型
  • RAG系统8大架构模式与决策指南
  • Agent-Reach:AI Agent 一键获得互联网视野
  • DwarfStar:DeepSeek V4 专用本地推理引擎
  • AirLLM:单卡 4GB 推理 70B 大模型
  • DeepSeek-Reasonix:终端 AI 编程 Agent
  • 多 AI 模型工作流设计:路由+并行+聚合
  • 本地LLM部署实战:用Ollama替代云API的成本与隐私收益
  • Claude 订阅调整:Fable 额度新规
  • AI 编程代理的五问预检框架:风险识别与验证
  • 异常检测设计:队列优于仪表板
  • 教育软件需要严谨性:从希望到可解释决策
  • 神经符号搜索模型Ontology 1性能碾压谷歌和亚马逊
  • 程序员用 Claude Code 重写官方应用实战
  • AI Agent 入侵 460+ 系统事件:Agent 安全的实战教训
  • 多项目 AI Agent 管理的规律性运维框架
  • Cursor IDE增加Google Workspace集成:MCP协作方案落地
  • 工具发布前必须真实使用:质量守门人的最佳实践
  • Claude Code Hooks 与系统提示的设计对比
  • Agent 系统的权限审核机制:从二元开关到分类控制
  • 人工工作流转化为Agent程序的系统方法
  • AI Agent 聊天记录修改漏洞:客户端历史可被篡改
  • 六大AI编码环境的统一MCP配置方案
  • 医疗LLM本地部署的数据主权架构
  • LLM 应用必备:验证层从第一天就要搭建
  • DeepSeek V4 Flash 正式版发布
  • 已加载 51 / 8611
8.0
热点
AI SCORE
技术实践2026-08-03 10:49

Python AI Agent Prompt 注入防护三层架构

dev.to · AI#安全#Agent#Python
Editor brief · 编辑速览

用正则/启发式、LLM 分类器、密码签名三层防护 Agent 被注入,代码示例展示亚毫秒延迟下的防护执行。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

随着 AI Agent 获得工具执行能力——例如访问 shell、编辑文件以及操作金融钱包——它们也成为 Prompt Injection Attacks(OWASP LLM01,提示词注入攻击)和 Excessive Agency Exploits(OWASP LLM06,过度代理权利用)的重点攻击目标。

攻击者只需在不受信任的网页或 RAG 输入中植入恶意隐藏指令,就可能诱骗 LLM Agent 执行未经授权的命令,例如 rm -rf、窃取 API key,或转移钱包资金。

在本教程中,我们将使用 Python 构建一个纵深防御安全网关,其额外延迟低于 1ms。

1. 三层纵深防御架构

                      [ UNTRUSTED USER INPUT / WEB SEARCH ]
                                       │
                                       ▼
                     ┌───────────────────────────────────┐
                     │   PROMPT-SHIELD GATEWAY PROXY     │
                     └─────────────────┬─────────────────┘
                                       │
            ┌──────────────────────────┼──────────────────────────┐
            ▼                          ▼                          ▼
   [ Layer 1: Fast Heuristic ] [ Layer 2: Dual-LLM ]     [ Layer 3: Crypto EIP-712 ]
   Regex & Base64 Sanitizer       Classifier Guardrail   Signature Wallet Guard

2. 第一层:快速启发式检测与 Base64 清理(< 1ms)

import re
import base64

JAILBREAK_PATTERNS = [
    re.compile(r"ignore\s+(previous|above|all)\s+(instructions|rules)", re.IGNORECASE),
    re.compile(r"system\s*override", re.IGNORECASE),
    re.compile(r"you\s+are\s+now\s+in\s+DAN\s+mode", re.IGNORECASE),
    re.compile(r"output\s+your\s+(system\s+prompt|api\s+key)", re.IGNORECASE)
]

def inspect_prompt(prompt: str):
    # 1. Base64 Payload Decoding Check
    decoded_text = prompt
    try:
        if len(prompt) > 20 and re.match(r"^[A-Za-z0-9+/=]+$", prompt.strip()):
            decoded_text = base64.b64decode(prompt.strip()).decode('utf-8', errors='ignore')
    except Exception:
        pass

    # 2. Pattern Matching
    for pattern in JAILBREAK_PATTERNS:
        if pattern.search(prompt) or pattern.search(decoded_text):
            return False, f"Prompt Injection Blocked: '{pattern.pattern}'"

    return True, "SAFE"

3. 第三层:基于密码学的 EIP-712 订单防护

为了防止 Excessive Agency(OWASP LLM06),敏感工具——例如资金转账或金融交易——必须要求提供经过显式密码学签名的 EIP-712 payload。LLM Agent 绝不能仅凭文本 prompt 转移资金!

4. 可直接用于生产环境的 Middleware

如果需要具备 FastAPI endpoints、低于 1ms 处理延迟并符合 OWASP 2026 规范的生产级安全代理,可以在我们的商店中查看 ClawGuard Prompt-Shield Middleware:

👉 ClawGuard Prompt-Shield Middleware(29 美元)

如需采取进一步措施,你可以考虑屏蔽此人和/或举报滥用行为。

Original source

本文由 AI 翻译整理自 dev.to · AI,原文版权归原作者所有。

阅读英文原文
上一篇
华为诺亚开源 Agent 记忆系统 MindMemOS
下一篇
从零实现经典技术:高价值学习路线合集