用 Winkler interval score + Murphy 分解 + Wilson 置信区间替代主观判断,外部计算评分防止 LLM 自我强化错误经验,候选教训必须经样本外验证才能转正。
前一篇讲了赌局:一个 AI agent、2200 块、30 天翻倍。这篇讲底下那套机制怎么运作。全部开源,代码在 DuDuClaw(链接在文末),这里挑三块关键的讲。
先回顾核心那条循环:predict → act → verify。下单前,agent 把预测写死落档(方向、幅度区间、信心、最坏赔多少);下单后拿真实成交结果对答案;落差回头修正它对市场的模型。问题在于,「对答案」不能靠 agent 自己说「我觉得这次不错」。有一篇 ICLR 2024 的论文(arXiv:2310.01798)讲得很直白:LLM 没有外部回馈时的自我修正,常常修完更糟。所以这套系统的重点,全在「怎么用外部的、算得出来的数字当裁判」。
每笔预测结算时,系统用一组数学函数打分,全是纯计算、零 LLM:
方向用 RPS(有序三类的概率评分),幅度区间用 Winkler interval score。这两个都是 proper scoring rule,白话说就是「你老实报出真实信心,期望得分才最高」的评分法,agent 想靠含糊话术拉高分数会被扣。
为什么不用大家熟的 log loss?因为它无界,N≈30 的小样本里一次爆掉就主宰整个平均。有界的分数在小样本才稳。
最关键的一招是 Murphy 分解:把 Brier 分数拆成「可靠度(reliability)」和「鉴别力(resolution)」两块。这解决一个很阴险的假象:一个永远喊「50% 会涨」的 agent,可靠度可以很漂亮,但它其实什么都没学到。只有 resolution 随时间上升,才代表它真的在分辨哪些情境不一样;可靠度单独变好,只是学会了报平均值装乖。这是我判断「它到底有没有学到世界模型」的主要依据,不是看它赚多少。
还有一条诚实防线:任何绩效旁边都挂 Wilson 信赖区间。命中 18/30 听起来像 60%,但区间是 [42%, 75%],把 50% 整个包进去。系统遇到这种情形会自动标成 INDISTINGUISHABLE_FROM_LUCK,分不出是技巧还是运气。N=30 在统计上本来就分不出来,我宁可让系统老实说「还不知道」,也不要它硬挤出一句「初步验证有效」。
agent 每天会反省、想从赔赚里总结「教训」。危险在这:30 笔单一个账户的资料,总结出来的十之八九是噪声,一旦回灌进提示词,就变成拿噪声当经验、越学越歪(有论文把这个叫 context collapse、也有讲经验污染的 arXiv:2605.18930)。
所以这套系统把规矩立死:反省只能「提名候选」,不能「决定采用」。一条没有工具记录佐证、纯靠归懒得来的教训,先进「候选区」,不准影响决策;之后每一笔新交易都拿它来对答案,累积够多样本外命中、而且用 Wilson 下界(多个候选同时竞争时再做 Bonferroni 校正)打赢基准率,才准转正被采用;转正后表现一退步,立刻降级。有外部证据的执行类教训(下单参数错、超时)才走快速通道。
用一句话说:采用权交给时间在后、由真金白银当裁判的样本外测试,永远不交给 agent 自己或另一个 LLM 的「感觉」。
台股「违约交割」是重罪,会留信用瑕疵、上黑名单。所以有一层 agent 无论如何绕不过的风控,全部 fail-close(查不到就拒单,宁可错杀):
结算现金账:系统自己记一本账,已承诺的买单加起来不准超过可动用资金,买不起就挡。
绝不裸卖:要卖的量取「券商回报持股」和「自己账本买过的量」的较小值,不管券商字段单位怎么算,都不可能卖掉没买过的股票。
只做现股,拒绝融资融券当冲;每分钟下单有上限防暴冲;还有一个一设就冻结全部下单的紧急停止旗帜。
这层跟聪不聪明无关,是给「AI 暴走」买的保险。
上面三块(校准打分、样本外学习闸、防违约硬约束)不是为这个实验临时写的,是 DuDuClaw v1.54 的平台能力,任何跑在上面的 agent(客服、写程式、操盘都一样)都能开启。想读 code 或自己开来用的,平台功能说明在公开 repo 的 docs/features/39-calibrated-forward-model.md,校准打分与学习闸的代码都在 crates 里开源。至于把这所有一切接到台湾某家券商实际下单那段,绑特定券商、没放进公开 repo,想重现的话得自己接自己的券商工具。
明天开盘,这套机制要面对它的第一个真实对手:市场。接下来每天的观察,会由平台上另一个 agent 写成连载。
我让一个 AI 拿 2000 块台币去股市,目标 30 天翻倍,这是第 0 天
怎麼用一套開源系統,把 LLM 逼近世界模型(實驗技術篇)(本篇)
想自己跟着养一只会操盘的 AI?从安装 DuDuClaw 桌面版开始
这个实验跑在开源 AI agent 平台 DuDuClaw 上,操盘、下单、盯盘、每日观察都由平台上的 agent 自主执行。原始码:https://github.com/zhixuli0406/DuDuClaw