前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8655
  • 从氛围记忆到确定性自主:AI 原生基础设施设计思路
  • 用 Agent 流程开发简单 SPA 的实战经验
  • AI 生成 React UI 的真实问题:从第二页开始组件漂移
  • vLLM 深度解析:高吞吐 LLM 推理的性能瓶颈
  • AWS 开源 AI 编程助手,成本比 Claude Code 低 45%
  • 用Docker Compose构建可复现的AI Agent评测环境
  • 阿里发布Qwen-Image-2.1:7B开源图像生成编辑模型
  • Benchling 用 Bedrock AgentCore 为多租户 AI Agent 构建深度防御安全架构
  • 苹果Mac mini 2026款:M6/M5 Pro芯片,AI性能最高提升4倍
  • Mac Studio 2026:M5 Ultra 支持最高 512GB 统一内存,可本地运行超大模型
  • Grok 4.7登陆GitHub Copilot,面向Agent化编程
  • AI 安全是工程问题:Agent 堆栈每一层的防护实践
  • Agent 系统的瓶颈不是模型,是架构设计
  • 防御式 Agent 架构:Schema 注入与超时控制
  • 自研研究 Agent 拦截 AI 编程幻觉:文档先行策略
  • 像物理学家一样剪枝 LLM:区块移除的伊辛模型优化
  • Mac mini上的AI开发新范式:OpenClaw与Codex实战
  • Cloudflare Python Workers 正式上线,可用纯 Python 开发边缘应用
  • 浏览器直接给 ESP32 烧录 Claude 写的宏,无需 IDE 或工具链
  • Google 发布 Agent 安全风险报告:5 万美元循环消耗与凭证窃取案例
  • 多 Agent 合规流水线:用 RAG + 自修正架构对抗 WCAG 幻觉问题
  • Anthropic 发布金融领域 Claude 参考智能体套件
  • OpenAI 披露强化学习模型在上下文压缩时插入 Prompt 注入
  • Jev 决策模型实测:0.3秒完成意图分类和工具路由,$0.00004/次
  • Kimi Code Desktop 上线:图形界面 + 内置终端 + Git 状态,支持 Swarm 多 Agent 协
  • StepFun Step 5 Preview:600B 总参数 MoE 模型,1M 超长上下文,10 月开源
  • JSON-Render:通吃 React/Vue/Svelte/React Native 等 10+ 框架的生成式 UI
  • Agent-Native:让 Agent 能力同时暴露给 LLM 工具调用和 UI 操作的 TypeScript 框架
  • 清华联合无问芯穹开源具身智能体RPent,GPT-6 Astra注入机器人
  • AI Agent工具调用边界case:路由错误比想象中更脆弱
  • AI按它能读的契约编程,而非你想要的
  • MCP 远程服务器实现 AI 驱动的确定性 UI 编排
  • 阶跃Step 5 Preview实测:27B参数开源模型冲至Top2
  • 用Responses API构建有边界的GPT-6 Astra Agent
  • 用破坏不变量法审查 AI 生成代码
  • AI 编程测试冻结:保存异常指纹而非测试名
  • 程序员亲历:全公司用 Claude Code 批量生产代码,没人读代码,12 小时工作制
  • 自托管Llama部署成本全解析:GPU之外容易被忽视的隐性开销
  • Builder.io开源Agent-Native框架:让人与AI共享同一操作层
  • 让AI编程代理在中断后从断点恢复:session化执行轨迹方案
  • CI如何验证AI代理真的跑了测试而不是伪造结果
  • llm-keys-ui:让Coding Agent安全获取API密钥的插件
  • AI产品定价数学:固定费率如何悄悄亏损
  • ZCode事件:AI编程工具静默上传全部Git历史
  • Anthropic自评:R&D自动化率26%,但完全自主为0
  • 阿里Qwen-Image-2.1:70亿参数开源图像生成拳打闭源模型
  • OWASP CRS 规则引擎:给 LLM 和 MCP 加上 WAF
  • 智谱 MaaS 上线数据不留存机制,可申请开通
  • 如何界定可完成的AI工程范围
  • Cursor中直接查询技术文档的MCP方案
  • AI Agent的过度自信陷阱
  • 已加载 51 / 8655
8.0
热点
AI SCORE
技术实践2026-09-21 20:22

多 Agent 合规流水线:用 RAG + 自修正架构对抗 WCAG 幻觉问题

dev.to · AI#开源#多Agent#WCAG
Editor brief · 编辑速览

开源 MAD Platform 通过多 Agent 编排实现了自我修正的 WCAG 合规修复流程,用 RAG 验证图片 alt-text 上下文描述的准确性,替代传统规则扫描器。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

静态代码扫描器的产品困局

传统网页无障碍(WCAG)工具对非技术背景的小企业主而言,从根上就是坏的。标准规则检查器本质上只是吵闹的扫描器——它们把海量的未经核实的违规一股脑倒给用户,既无法判断图片的 alt 文本是否真正具备上下文描述性,也无法提供任何上下文验证。这使得小企业极易遭受掠夺性 ADA 诉讼,因为一份原始的、未经验证的报告并不能解决底层代码漏洞。

为了弥合这个缺口,我把在 Google All Things Agentic Hackathon 上构建的一个原型,工程化成了一个完全生产就绪的开源公共服务:MAD Platform(Multi-Agent Defense),托管于 mad-platform.org。

它不是生成一份静态报告,而是部署了一种确定性的、自纠正的多智能体编排模式——爬取、可视化、通过 RAG 验证,并输出生产就绪的修复方案。以下是我构建它的技术架构。

核心架构:Analyst 与 Editor 验证循环

在高风险的合规环境中,依赖单一 LLM 调用是产品的死穴。模型会产生幻觉——导致假阴性(让企业面临法律风险)或假阳性(浪费开发者时间)。为了达到生产级准确度,MAD Platform 将认知劳动拆分到专业智能体中,让它们相互审查彼此的执行路径。

[Web Crawler / Playwright] 
       │
       ▼
┌─────────────────────────────────┐
│       1. ANALYST AGENT          │ ◄── Discovers violations via parallel visual & code checks
└────────────────┬────────────────┘
                 │ (Flags Finding)
                 ▼
┌─────────────────────────────────┐
│        2. EDITOR AGENT & RAG    │ ◄── Cross-checks findings against live screenshot & official WCAG
└────────────────┬────────────────┘
                 │
         ┌───────┴───────┐
         ▼               ▼
   [Dismissed]     [Confirmed] ──► [Reporter Agent] ──► Jira CSV / HTML

管道首先使用 Playwright 进行无头渲染、截图捕获和计算样式提取。Analyst Agent(由 gemini-3.5-flash-lite 驱动,追求高容量的成本效益)对每个页面运行三项并行检查:

确定性检查:传统代码规则解析(如原始对比度、缺失的表单标签)。

语义检查:评估结构化布局层级和 ARIA 角色。

多模态视觉检查:对实际渲染截图进行推理,检测被糟糕样式隐藏的元素。

Analyst 标记的任何违规都被视为未经验证。它会被传递给 Editor Agent(利用 gemini-3.7-flash 的高判断力推理)。

为了完全突破「幻觉屏障」,系统不依赖脆弱的 LLM 记忆。相反,我工程化了一个高精度检索增强生成(RAG)架构。系统查询一个本地化的、精心策划的向量知识库(gemini-embedding-001),其中包含精确的、未篡改的 Web 内容无障碍指南(WCAG)成功标准。这份严格的监管文本被直接注入到提示上下文中。

Editor 独立地对照原始视觉截图和检索到的 WCAG 标准的绝对 Ground Truth,对 Analyst 的发现进行交叉审查。如果证据匹配严格的法规文本,发现被确认;如果不匹配,则以经过审计、有据可查的理由驳回。

为确保平台能在无需手动代码修改的情况下扩展,一个每周一次的 Cloud Run 后台任务(pattern-miner)运行一个批处理任务。它分析来自边缘案例升级的人工驳回日志,识别反复出现的误报模式,并将它们编纂为永久性系统 grounding。随着时间推移,产品实际上在自愈其自身的知识库。

基础设施优化:零扩展可持续性

为了让这个工具对小企业永久免费,我将整个技术栈工程化为无服务器、零扩展模型,使用 Google Cloud Run 和 Firestore,将运营成本降至接近零。基础架构的资金完全来自我个人口袋。

由于公共设施需要完全透明,代码 100% 开源,采用 AGPL-3.0 许可证。需要注意的是,我们在扫描提交时严格需要经过验证的电子邮件地址,作为反滥用措施以保护我们的 API 限额免受机器人利用——无需注册账户或登录。

在线工具:mad-platform.org

开源代码:Github

当 AI 从简单的聊天界面过渡到自主工作流时,最大的障碍不是底层模型——而是我们围绕它们构建的系统架构和验证循环。您在自己的自主 LLM 工作流中如何处理错误纠正循环?欢迎在下方讨论。

Original source

本文由 AI 翻译整理自 dev.to · AI,原文版权归原作者所有。

阅读英文原文
上一篇
Google 发布 Agent 安全风险报告:5 万美元循环消耗与凭证窃取案例
下一篇
Anthropic 发布金融领域 Claude 参考智能体套件