提出 AI Agent 可用简洁设计实现,反驳业界过度工程化的框架设计,对架构决策有借鉴价值。
关于 AI agent 的讨论已经渐渐向越来越复杂的框架、编排层、记忆系统和多 agent 抽象倾斜。与此同时,一个更安静但更有趣的运动正在浮现:针对特定目标精心打造的小型循环,在某一件事上优化得非常好。
这正是吸引我关注 autoresearch 的原因。它是由 Andrej Karpathy 创建的开源仓库,最近发布,本周在 AI 领域引起了广泛关注。
autoresearch 的核心思想非常简单:给一个 agent 一个真正的训练循环,让它做小改动,运行短实验,评估结果,在自包含的设置里持续迭代。不需要庞大的平台或任何过度设计的 agent 堆栈。只需围绕真实模型训练的紧密反馈循环。
正是这种简洁性使它如此吸引人。只需几百行 Python 代码……
autoresearch 围绕三个重要文件构建:
prepare.py:处理一次性数据准备、tokenizer 设置和运行时工具
train.py:主训练文件,agent 被允许修改它
program.md:指令文件,定义 agent 在实验过程中应如何表现。你来定义这个。
agent 读取 program.md,修改 train.py,运行训练,检查指标,决定下一步做什么。
这将自主研究剥离到本质。与其先构建一个庞大的 agent 框架,不如从一个已经能做有用工作的最小循环开始。
这是个很好的提醒:agentic 系统的进步可能不是来自于添加更多层,而是来自于构建更紧密、更有纪律的循环。
我想在本地运行一个真正的自主研究实验,在自己的机器上,基础设施最少,没有云 GPU 依赖。
我的约束很简单:
在 MacBook Pro 上运行
生成洞察,而不只是盲目追求性能
这导致了我围绕反思性迭代的一个实验。
我的实验问题是:
增加结构化自反思步骤是否能帮助自主 agent 更好地做出模型改进决策?
这个设置比较了两个循环:
A:非反思循环 B:反思循环
区别虽小但很重要。
在模式 A 中,agent 只是从固定队列中提出下一个改动并运行它。
在模式 B 中,agent 先以结构化方式反思之前的结果,然后再选择下一个改动。
目标不仅是改进验证性能,还要测试反思是否改进了实验决策的质量。
如果你想在 MacBook 上像我一样运行这个实验,最简单的起点是这个 fork。
我遵循的步骤:
Fork 仓库到我的 GitHub 账户并在本地克隆
Fork 仓库到我的 GitHub 账户并在本地克隆
用我的 coding agent 或助手打开仓库
用我的 coding agent 或助手打开仓库
对于这个设置,我使用了 Codex 5.3,中等推理深度。它在规划、检查依赖、仓库结构、实验约束和执行方面特别有用。
准备实验
验证所有依赖都已安装,所有前置训练步骤都已就绪
在 program.md 中定义实验
对我来说有效的方法是不替换原始文件,而是增强它。我创建了一个独立的实验定义,并将其与基础仓库规则结合,这样我能保留原始设置中的重要约束。
优化执行环境
定义了实验后,我请 Codex 帮我精细调整设置,但不改变实验设计本身。
这个想法是将实验逻辑保留在 program.md 中,只用设置提示来处理执行环境和设置纪律。
这种方法让仓库保持简洁,防止设置对话污染实际实验逻辑。
运行实验循环本身
一切就绪后,实验循环很直接:
agent 编辑 train.py
选择下一个运行
最重要的是让每个改动都保持小且独立,这样结果就能保持可解释性。
对于更长的实验,我强烈建议稍微加强执行环境。我的长期运行实验的实际设置是:
明确告诉你的 coding assistant 你希望整个实验自动继续,不需要手动输入。在我的情况下,它设置了一个 runner 脚本,这样我可以在处理其他事情的同时让实验继续进行。
也告诉它提供定期的状态更新。这会让过程在一段时间内更容易监控。
以下是实验的结果:
Baseline:
val_bpb = 1.622929
lower is better
Comparison outcomes:
Best A (non_reflective): 1.623505
Best B (reflective): 1.621094
Runs to beat baseline:
A: never beat baseline
B: beat baseline on B01
Improvement ratio:
A: 0/5 = 0%
B: 3/5 = 60%
Average runtime:
A: 501.38s
B: 478.14s
Iteration quality trend:
A: flat at 0.50 every run
B: consistently high at 0.93-1.00, average 0.944
这是一个小实验,但它显示了一些有意义的东西。
在这个 CPU 受限的本地设置下,结构化反思改进了 agent 决策的质量。反思循环不仅产生了更好的验证结果,还更快地达到这些结果,并有更清晰的迭代模式。
所以收获不仅仅是反思帮助了性能。它帮助了推理质量和效率。它还产生了更连贯的实验轨迹。
最好的反思性运行收敛到一小组参数改动,这些改动超越了基线:
反思是我作为工程师一直在实践的一个习惯,它对我的职业和个人成长都有帮助。agent 似乎也同意这一点……
这个实验中最有趣的不是绝对性能增益。而是一个轻量级、本地、可解释的 agent 循环能够如此快速地产生可测量的研究行为差异这一事实。
这表明了 agentic AI 工作的一个有用方向:
更少的框架开销
更强调实验质量,而不仅仅是实验数量
更关注设置优化的评估函数
如果这个方向在更大规模的研究中成立,它可能成为真实世界自主研究系统的一条更实用的路径。
下一个显而易见的步骤是扩展规模。
我想用更大的运行预算重新运行这个实验,可能在 80+ 运行左右,看看信号在更长的搜索轨迹上是加强还是减弱。
那会让结论更加稳健。
这是一个小试点,不是一个确定的基准。这个比较在单台本地机器上使用了每种模式 5 次运行,所以我将结果视为方向性证据而不是证明。尽管如此,信号足够清晰,足以证明值得运行更大的后续研究。
如果你想探索我的实验设置或运行你自己的版本,这是两个关键仓库:
MacBook-friendly fork: https://github.com/miolini/autoresearch-macos
My own experiment repo: https://github.com/JulienAvezou/autoresearch-macos
你已经尝试过 autoresearch 吗?你怎么看这种方法?有什么有用的实验可以用这个设置来运行吗?
另外,你今天的 agentic 设置是什么样的?我很想知道。
有些评论可能仅对登录访客可见。登录以查看所有评论。