前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
返回 AI 情报前线
All News · 全部资讯9316
  • TryHackMe 提示词注入 CTF 实战攻略
  • 面向 Agent 的运维队列:失败自动转Ticket
  • 四个静默失败的 CI 检查:它们都是绿的,但什么都没做
  • AI 编码工具会读取 .env:本地 DLP 代理 Anonmyz 在prompt边界截流
  • Google 开源 SAM:零配置的 AI Agent P2P 发现与调用网络
  • Cursor Skills完全指南:格式规范与跨Agent迁移实测
  • OpenAI Codex Skills规范详解:目录结构与官方文档未记载的细节
  • 用Gitea自建Claude Code内部插件市场,团队Skill统一分发
  • Claude Skills规范深度解读:从格式到团队协作
  • 2026年LLM应用架构实战:摆脱if/else链式判断
  • Anthropic CEO:AI天然趋向集中,开源只是转移权力
  • 微软 Copilot 隐藏参数漏洞可被利用窃取密码
  • LangChain 揭示:Agent 效果不佳时换模型是误区,换 Harness 才是关键
  • 三阶段工作流让 AI Agent 保持精准:Research-Plan-Implement
  • 小米MiMo桌面应用即将上线,AI编程助手6月已开源
  • Agent成熟度记分卡:追踪AI Agent可靠性的五个核心维度
  • 模型趋同时代:系统架构比选模型更重要
  • 代码审核功能默认关闭的教训
  • 程序员用 Claude 为 Windows 专用 HP 打印机编写 macOS 驱动
  • NIST AI风险管理框架生产级RAG实战
  • Codex自动探索优化技能:研究-测试-评判闭环
  • AI协作UML编辑器:代码臭味一目了然
  • AI API成本降低95%的实战经验
  • 不同模型Tokenizer成本差异的技术解析
  • 我用低价模型替代OpenAI:生产迁移实录
  • Anthropic单token成本是Vercel均值4.4倍,使用量却占65%
  • career-ops: 在AI编程CLI里做求职管理
  • CI守护失效实录:4个静默失败的检查
  • 不同分词器对中文token计数差异高达20%
  • Claude Code 2.1.234安全升级清单发布
  • LLM 调用成本减半:模型路由与缓存实战
  • AI厂商公开的使用数据可信吗?斯坦福研究者质疑透明度
  • Claude Code引入/design命令:终端内生成UI稿
  • Azure DevOps MCP 服务器 prompt 注入漏洞:AI Agent 如何绕过安全防线窃取数据
  • Ray AI严重漏洞CVE-2025-62593已被主动利用
  • 缺失数据无法被检测:遗漏类错误的技术盲区
  • 我们删掉了向量数据库和图数据库,二者皆删
  • 四大国产模型实战PK: DeepSeek/Qwen/Kimi/GLM真实客户工作对比
  • System Prompt不是安全边界: 重新审视AI应用的信任模型
  • DynamoDB原生向量搜索上线
  • 阿里Qwen:被严重低估的开源模型家族
  • AI代码助手横评:Cursor、Copilot等实用对比
  • MIT深度分析:AI递归自我改进或许不会来得那么快
  • Haystack 3.0管道接入TealTiger治理引擎
  • AI编程代理的脚手架到底有没有用
  • 延迟加载工具schema省21%成本,但有一类任务反而亏了
  • AI基准测试崩溃:Dan Luu揭示评估体系系统性失效
  • 用 Qdrant 给树莓派 AI 集群注入持久记忆
  • AI上下文压缩时平均丢失83%的用户规则
  • L2 Vault: 为 AI Agent 记忆引入 GitOps 版本控制
  • C++ 构建日志三合一工具配合四重门实现 AI 代码合并
  • 已加载 51 / 9316
8.0
热点
AI SCORE
编程提效2026-08-18 19:13

Codex自动探索优化技能:研究-测试-评判闭环

dev.to · AI#Codex#AI Agent#自动化
Editor brief · 编辑速览

开源Codex Skill,将研究、脑暴、实现、测量、评审、决策串联为可重复的自动化探索循环,解决AI Agent容易一条路走到黑的问题。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

AI 编程 Agent 非常擅长快速生成实现方案。

但项目优化不仅仅是一个实现问题。

当我让一个 Agent 改进一个真实项目时,往往会出现以下问题:

它不会探索替代方案,只会实现第一个看起来合理的想法;

它会搜索论文,但从不将这些论文的机制与本地项目建立联系;

它在不同条件下比较实验;

它在看到结果后更改成功标准;

它不断调整一个失败的思路,却没有停止规则;

它报告某件事“更好”,却不解释因果机制;

它留下大量互不关联的笔记,难以续上。

我需要一个更有纪律性的工作流程:一个将研究、头脑风暴、实现、测量、评审和决策连接起来的流程。

这就是 Automation Exploration Pro,一个用于证据导向项目探索和重复优化的开源 Codex Skill。

👉 github.com/fancheng5840074-bit/automation-exploration-pro

该 Skill 将探索组织为一个可重复的循环:

Inspect the project
        ↓
Confirm performance and complexity metrics
        ↓
Freeze the promotion gates
        ↓
Research papers and relevant domain journals
        ↓
Brainstorm and adapt mechanisms to the local project
        ↓
Execute the smallest testable candidate
        ↓
Audit the evidence and comparison conditions
        ↓
Explain the result from first principles
        ↓
PROMOTE / RETAIN / REVISE / REJECT / INCONCLUSIVE
        ↓
Continue with the next justified candidate

在比较解决方案之前,用户需要确认:

推广或停止的门槛;

是否允许 subagent 并发;

最大循环次数。

这可以防止 Agent 在实验已经结束后发明一个方便的成功标准。

1. Cyclic Optimization

Cyclic optimization 专为已有可运行基线的项目设计。

适用场景包括:

降低 API 延迟而不破坏正确性;

在内存限制下提升模型精度;

在保持信号质量的同时减少硬件资源使用;

改进分析流水线而不将运行时间增加到可接受阈值以上;

减少实验工作流的成本或持续时间。

每个候选方案在冻结条件下与当前最优方案进行比较。

如果候选方案通过已确认的门槛,它就成为新的最优方案。下一个候选方案必须击败这个已被推广的结果——而不是那个过时的原始基线。

一个请求可能长这样:

Use $automation-exploration-pro in cyclic optimization mode.

Performance metric:
All conformance tests must pass.

Complexity metrics:
p95 latency and peak memory.

Promotion gate:
Reduce p95 latency by at least 15%, with no correctness regression
and no more than 5% additional peak memory.

Subagent concurrency:
Allowed.

Maximum cycles:
4.

目的不是生成无限的参数搜索。机制上有实质性不同的方案会成为一个新候选方案,并消耗一个新循环。

2. Project Exploration

Project Exploration 适用于技术路线仍不确定的场景。

该 Skill 不是优化一个最优方案,而是研究和比较几种机制上截然不同的方案。

文献工作流从实际的本地问题出发。它可以使用广泛的学术索引、预印本来源、出版商记录、与项目相关的领域数据库和期刊。

然而,找到一篇论文只是开始。

每个有文献支撑的候选方案都必须通过以下映射完成本地化:

Paper mechanism
    → local project constraint
    → required adaptation
    → predicted metric effect
    → cheapest falsification test

工作流还将证据分为三类:

Source-observed:
What the paper actually reported.

Local inference:
Why the mechanism might transfer to this project.

Local observation:
What the project's own implementation or experiment measured.

这种区分很重要,因为论文中报告的结果并不自动成为同一方法在不同代码库、数据集、样本类型、设备或实验室环境中也有效的证据。

没有足够文献支撑的想法仍然可以探索,但必须将其标记为第一性原理假设,而不是作为已发表的结论来呈现。

各阶段不必严格按顺序运行。

当候选方案 N 正在执行时,独立的车道可以准备后续工作:

Execution lane:
Test candidate N.

Literature lane:
Investigate mechanisms for candidate N+1.

Brainstorming lane:
Adapt those mechanisms to local constraints.

Review lane:
Check whether the benchmark or experimental comparison remains fair.

如果用户允许 subagent,独立 Agent 可以拥有这些车道。如果 subagent 不可用,主 Agent 可以交错执行同样的工作。

已准备好的研究不能替代当前解决方案,直到该候选方案有自己的执行证据、审计、解释和裁决。

每个被评估的候选方案最终都有且仅有一种裁决:

PROMOTE — 通过门槛,成为新的最优方案;

RETAIN — 有价值作为替代方案,但不替换最优方案;

REVISE — 机制仍然合理,有限的下一个测试有边界;

REJECT — 证据与候选方案矛盾,或未通过硬性约束;

INCONCLUSIVE — 现有证据不足以做出有效决策。

候选方案不能仅因为实现看起来合理就获得正面裁决。

Skill 首先要求:

审计指标、基线和混淆因素;

第一性原理解释;

与用户确认的门槛进行比较。

我还希望最终的解释超越对编辑文件的总结。

对于软件项目,Skill 追踪实际的实现路径:

Input
→ entry point
→ changed function
→ downstream state transition
→ measured output
→ performance or complexity effect

它解释成本来自哪里,哪些假设是必要的,存在哪些边缘情况,以及为什么观察到的指标应该发生变化。

对于非代码项目,如工程或生物工作流,它遵循相应的协议和数据流:

Sample or input
→ preparation
→ intervention
→ measurement
→ calibration
→ decision rule
→ reported metric

这使得该 Skill 可以用于软件开发之外的领域。只要项目有可衡量的目标和安全的验证路径,它就可以支持工程、数据分析、算法和研究工作流。

工作流维护一份实时的 Markdown 账本:

docs/automation-exploration.md

账本包含冻结的契约、候选方案状态、活跃车道、证据、审计结果、解释、裁决和恢复状态。

它复用项目原生的测试、基准、分析输出或实验记录,而不是为每个候选方案创建单独的报告目录。

一个无依赖的 Python 辅助工具强制执行候选方案生命周期,并防止在执行、评审和解释完成之前记录裁决。

Automation Exploration Pro 不需要另一个 Skill 来进行文献发现或第一性原理解释。

它的代码库包括:

完整的操作协议;

基于项目的文献工作流;

第一性原理关闭方法;

可恢复的账本模板;

状态管理辅助工具;

测试和详细的跨领域示例。

它使用宿主环境中可用的任何普通搜索、浏览器、学术索引、PDF 阅读、编码和执行工具。

克隆代码库:

git clone https://github.com/fancheng5840074-bit/automation-exploration-pro.git

将 Skill 复制到 Codex Skill 目录:

mkdir -p ~/.codex/skills

cp -R \
  automation-exploration-pro/skills/automation-exploration-pro \
  ~/.codex/skills/

重启或刷新 Codex,然后显式调用它:

Use $automation-exploration-pro to explore several
research-backed solutions for this project.
Use $automation-exploration-pro in cyclic optimization mode
to improve this baseline.

这个 Skill 不能保证每个项目都有更好的解决方案。

它不会将论文结果转化为本地证据,也不会隐藏失败的实验。如果没有候选方案通过已确认的门槛,正确的结果是“没有推广的候选方案”。

目标不是制造成功。目标是使探索更加系统化、可重复、可解释,并对不确定性保持诚实。

Automation Exploration Pro 采用 MIT 协议发布。

我特别欢迎以下方面的反馈:

文献到本地适配的工作流;

性能和复杂度门槛设计;

跨阶段 Agent 并发;

证据评审和裁决语义;

传统软件项目之外的应用。

如果这个工作流看起来有用,你可以在这里找到源代码、安装说明、测试和两个详细示例:

👉 Automation Exploration Pro on GitHub

欢迎提交 Issue 和贡献。

Original source

本文由 AI 翻译整理自 dev.to · AI,原文版权归原作者所有。

阅读英文原文
上一篇
NIST AI风险管理框架生产级RAG实战
下一篇
AI协作UML编辑器:代码臭味一目了然