前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8582
  • Higgsfield:开源万亿参数模型分布式训练框架
  • LlamaIndex多Agent工作流:事件驱动共享状态编排
  • 用AI从45条Ruff PR评论中挖掘团队隐式代码规范
  • LLM Agent工具授权最佳实践:五步检查清单
  • Agent补丁评分应只看其未写的断言
  • 2026年9月 Ollama 编程模型实测推荐
  • 国产大模型价格实测:GPT-5 三到八倍溢价
  • Codex-X:OpenAI Codex桌面端可视化综合管理工具
  • Docling:支持复杂PDF结构的文档解析库,集成主流AI框架
  • NVIDIA PAIR:开源本地多Agent推理路由,支持Ollama/LM Studio
  • 阿里Qwen发布Qwen3.8-LiveTranslate:60语言实时翻译,延迟仅2.3秒
  • Supermemory:AI记忆与上下文引擎开源实现
  • OpenSpec:AI编程时代的规格驱动开发框架
  • MCP Agent工具集成测试实战指南
  • Claude Code 在 Zed 中的 ACP 协议传输机制实测
  • Mubayyin:基于结构化知识库做 AI 发布决策的智能体
  • 阶跃发布 Step 5 Preview:开源模型前三,单任务成本仅 Claude Opus 5 的 1/8
  • Qwen3.8-Omni-Flash:匹敌Gemini多模态能力,价格更低
  • Unity发布官方插件:让Claude Code和OpenAI Codex使用最新教程
  • AI机器人安全基准:GPT-6和Claude让机械臂变杀手
  • Qwen 3.8发布:270亿参数模型快速交付网页前端
  • Google Dream-RSI:AI Agent 通过梦境回溯优化搜索策略
  • Gemini 在安全测试中突破隔离环境闯入三家真实公司
  • AI 幻觉差点让美军误登中国船只:核武情报全靠聊天生成
  • 2026 年大模型格式对比:GGUF/GPTQ/AWQ/EXL2 实战指南
  • AI工作流延迟优化:模型路由、缓存、并行执行的实战经验总结
  • OpenAI用自家LLM设计Jalapeño芯片
  • Claude Code 现在优先读取 AGENTS.md 文件
  • Copilot 代码审查新增时间线视图和自动 commit 消息生成
  • Claude Code 新增 AGENTS.md 支持,无 CLAUDE.md 时自动读取
  • Anthropic 发布 Claude Opus 5,性能与安全性双提升
  • Ternary Bonsai 2 27B:5.9GB 轻量模型保留 98% Qwen3.8 性能
  • 研究人员用Claude在72小时内攻破OpenAI内部系统
  • BrowserSkill:让AI Agent共享你的真实浏览器登录态
  • Coder:自托管云开发环境与AI编程Agent平台
  • Anthropic开源11款知识工作者Claude插件
  • Google联手Speakeasy开源SDK代码生成套件
  • AI 承担开发重负后,程序员角色如何转变
  • 如何为第三方 API 构建隔离仿真层
  • 为自主编码 Agent 打造手机遥控面板
  • AWS SageMaker HyperPod 推理网关:首 token 延迟降低82%
  • MiniMax Code CLI开源:任务通过率76.7%,中位耗时4分33秒
  • 2026年本地LLM最佳开源Agent框架:11款精选
  • 阿里Qwen3.8-Omni-Flash:百万上下文多模态Agent模型
  • Jev:AI Gateway史上增长最快的决策模型
  • Claude Code 大重构:内部 3 万 Agent 管理技术免费开放
  • 已加载 46 / 8582
8.0
热点
AI SCORE
技术实践2026-09-20 11:20

Mubayyin:基于结构化知识库做 AI 发布决策的智能体

dev.to · AI#AI Agent#DevOps#发布流程
Editor brief · 编辑速览

该 AI Agent 通过查询 Sanity 中的结构化发布记录、测试结果、策略和证据来做发布就绪判断,而非生成泛泛之论。目标是将 AI 辅助决策从猜测升级为证据驱动。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

Mubayyin Release Intelligence 是一个 AI 发布保障 Agent,它通过查询存储在 Sanity 中的结构化发布记录、测试结果、政策、发现和证据,来调查一个 AI 系统是否准备好为客户服务。

Mubayyin Release Intelligence 帮助团队在 AI 发布到达客户之前进行调查。

不再让 AI 助手给出关于 AI 系统是否就绪的泛泛之论,而是让 Agent 查询包含以下内容的结构化发布知识库:

  • AI systems and versions
  • Models and prompt versions
  • Test suites and test cases
  • Arabic and English scenarios
  • Findings and failures
  • Previous release decisions

Agent 可以回答以下问题:

  • 这个发布可以提供给客户吗?
  • 这次发布为什么被搁置了?
  • 两个发布之间有什么变化?
  • 有什么证据支持这个发现?
  • 哪条政策适用于这个失败?

目标是展示结构化内容如何为 Agent 提供基于证据调查所需的上下文,而不是简单地生成泛泛之论。

[ADD DEMO VIDEO LINK]

[ADD PUBLIC GITHUB REPOSITORY]

Sanity 是 Agent 背后的结构化知识层。

我将 AI 发布信息建模为相互关联的内容,而非一个大文档。Release 引用其 AI system、test suite、policies、findings、decisions 和 supporting evidence。

Agent 在调查一个 Release 时,使用 Sanity Context 来查询这些结构化内容。

例如,当被问及 version 1.4 是否可以发布时,Agent 会检索该 Release 记录,跟随其关联的测试结果和发现,检索支持证据,并在解释存储的发布决策之前检查适用的政策。

这使得内容之间的关系对 Agent 的回答至关重要。

同一调查还可以用以下问题继续:

  • "1.3 和 1.4 之间有什么变化?"
  • "哪些失败仍未解决?"
  • "给我看升级失败的证据。"
  • "哪条政策适用于这个发现?"

因此,Sanity 的作用不仅仅是内容存储:它提供了 Agent 用于调查发布的结构化上下文。

Sanity Project Details

Public dataset/project link:

[ADD LINK IF AVAILABLE]

[ADD PUBLIC AGENT SESSION LINK]

该 Session 演示了 Agent 查询 Sanity 内容,并使用检索到的发布记录、发现、政策和证据来回答发布就绪性调查。

AI 系统越来越多地通过模型更新、prompts、检索配置、政策和其他组件发生变化。

Mubayyin Release Intelligence 探索了一个简单的问题:

Agent 能否调查围绕 AI 发布的证据,而不是仅仅依赖模型的通识知识?

该原型演示了使用 Sanity 中结构化内容的这一工作流程。

有关进一步操作,您可以考虑屏蔽此人或举报滥用行为。

Original source

本文由 AI 翻译整理自 dev.to · AI,原文版权归原作者所有。

阅读英文原文
上一篇
Claude Code 在 Zed 中的 ACP 协议传输机制实测
下一篇
阶跃发布 Step 5 Preview:开源模型前三,单任务成本仅 Claude Opus 5 的 1/8