从数据最小化、Token 即敏感、临时上下文窗口等原则出发,给出隐私优先的 LLM 推理管线架构和 GDPR/HIPAA 合规实践。
LLM 部署通常将隐私作为事后考虑。Prompt 跨第三方 API 传输,对话历史积累在数据库中,敏感数据通过微调或反馈循环嵌入模型权重。默认隐私模式颠覆了这一模式。它将每个 token 视为可能敏感的,除非有证据证明不是,并将数据最小化融入架构而非服务条款。对于工程团队而言,这意味着构建推理流水线,使 PII 永远不会到达模型提供商,上下文窗口是临时的,合规性是结构性保证而非勾选框。
大多数托管 LLM API 会记录 prompt 用于调试,保留它们用于滥用监控,并可能使用它们来改进模型。即使提供商提供企业级隐私条款,数据仍然离开你的网络。对于处理医疗记录、财务数据或专有源代码的应用程序,这种暴露默认违反 GDPR、HIPAA 和 CCPA 原则。唯一稳健的修复是假设提供商将看到 prompt,并确保到达的内容包含零敏感标识符。
Data minimization. 只发送模型执行请求所需的数据。剥离元数据、系统日志和用户标识符。
Purpose limitation. 将模型用于单一、声明的任务。禁止对输入进行二次处理或训练。
Storage limitation. 在你的服务器或提供商上保留 neither prompts nor completions。使用临时上下文窗口。
Transparency. 只记录哈希或 token,绝不记录明文 PII。使你的数据流可审计。
对于认真对待隐私的生产部署,三种模式占主导地位。
Privacy Gateway. 在你的应用程序和推理 API 之间部署中间件层。网关清除 PII、强制速率限制,并在响应到达客户端之前检查数据泄露。
Client-Side Tokenization. 在 prompt 离开你的 VPC 之前,将敏感实体映射到不透明 token。反向映射表保留在你的基础设施内。LLM 对假名文本进行操作。
Ephemeral Sessions. 避免服务器端对话历史。在每个请求内发送多轮逻辑所需的完整上下文,或将历史存储在客户端加密,使用提供商永不持有的密钥。
以下 FastAPI 服务演示了一个最小的隐私网关。它从用户消息中清除电子邮件地址和社会安全号码,将清理后的 payload 转发到推理端点,并在不持久化对话任何一侧的情况下返回补全。
import os
import re
from fastapi import FastAPI
from pydantic import BaseModel
from openai import AsyncOpenAI
app = FastAPI()
client = AsyncOpenAI(
base_url="https://api.oxlo.ai/v1",
api_key=os.environ["OXLO_API_KEY"]
)
class ChatRequest(BaseModel):
messages: list
model: str = "llama-3.3-70b"
PII_PATTERNS = {
"email": r"[a-zA-Z0-9._%+-]+@[a-zA-Z0-9.-]+.[a-zA-Z]{2,}",
"ssn": r"\d{3}-\d{2}-\d{4}",
}