SkillOpt 的核心发现是经 Codex 训练的 SpreadsheetBench 技能直接迁移到 Claude Code 使其从 22.1 提升到 81.8,说明最佳实践产物具备跨模型的泛化能力。
人工智能
SkillOpt 是由 Microsoft、上海交通大学、同济大学和复旦大学的研究团队开发的一款文本空间优化器。
SkillOpt 会训练一份自然语言 Skill 文档,同时保持目标模型冻结。一个优化器模型读取带评分的 rollout,并提出受约束的添加、删除或替换编辑。只有当分数严格提升时,才会通过留出的选择数据集接受该编辑。最终导出的产物只有一个文件:best_skill.md。
迁移结果表包含三列。Baseline 是目标模型不使用 Skill 时的分数。Direct 是针对该目标模型,在相同领域内直接训练 SkillOpt 后的分数。Transferred 则是在不做任何进一步优化的情况下,应用从其他地方训练得到的 Skill。
真正有意义的比较,并不是 Transferred 与 Direct 谁高谁低,而是领域内训练所带来的收益,在迁移后还能保留多少。
这些 Skill 在 GPT-5.4 上训练,然后部署到更小的变体上。
| Benchmark | 模型 | Baseline | Direct | Transferred | 收益 | 领域内收益保留比例 |
|---|---|---|---|---|---|---|
| SpreadsheetBench | GPT-5.4-mini | 36.1 | 47.5 | 45.5 | +9.4 | 82% |
| SpreadsheetBench | GPT-5.4-nano | 23.5 | 42.5 | 26.5 | +3.0 | 16% |
| LiveMath | GPT-5.4-mini | 14.7 | 32.8 | 19.2 | +4.5 | 25% |
| LiveMath | GPT-5.4-nano | 23.2 | 27.2 | 28.8 | +5.6 | 140% |
其中两行值得关注。GPT-5.4-mini 在 SpreadsheetBench 上保留了 82% 的领域内收益,几乎相当于免费复用。GPT-5.4-nano 的 LiveMath 结果则更不同寻常:迁移后的 Skill 得分为 28.8,高于领域内 SkillOpt 的 27.2。论文将其视为一个证据:某些学习到的流程可能与具体目标模型无关。
GPT-5.4-nano 在 SpreadsheetBench 上的结果最弱,只保留了 16% 的收益。迁移收益并不均匀,论文也没有声称它是均匀的。论文给出的结论范围更窄:没有任何一行低于目标模型不使用 Skill 时的 Baseline。
需要注意实验范围。全部四行结果都局限在同一个 GPT 模型家族内。GPT 到 Qwen 这类跨模型家族迁移并未接受测试。
这是对部署最有意义的部分。所有结果均使用 GPT-5.5。
| Benchmark | Source → Target | Baseline | Direct | Transferred | 收益 | 领域内收益保留比例 |
|---|---|---|---|---|---|---|
| SpreadsheetBench | Codex → Claude Code | 22.1 | 80.4 | 81.8 | +59.7 | 102% |
| SpreadsheetBench | Claude Code → Codex | 27.5 | 85.0 | 71.1 | +43.6 | 76% |
| LiveMath | Claude Code → Codex | 35.2 | 78.4 | 48.0 | +12.8 | 30% |
| LiveMath | Codex → Claude Code | 40.8 | 56.5 | 42.4 | +1.6 | 10% |
第一行是最引人注目的结果。在 Codex 中优化出来的 Skill,将 Claude Code 的分数从 22.1 提升到了 81.8,甚至略高于 Claude Code 从头训练自己的 Skill 所达到的 80.4。
这两个 Harness 暴露了不同的工具 API、文件 API 和命令界面。一项 Skill 能够经受住这种变化,说明它编码的并不是具体命令操作步骤。研究论文将 SpreadsheetBench 的可移植性归因于工作簿层面的流程:先检查结构、结合公式进行验证,以及将结果物化为静态值。无论由哪个 CLI 来运行 Python,这些流程都同样适用。
LiveMath 呈现的却是相反结果。Codex → Claude Code 仅保留了 10% 的领域内收益。这种不对称值得仔细思考。流程型 Skill——如何检查、验证和格式化——似乎属于更具可移植性的类别。以推理为主的 Skill 则似乎与训练环境绑定得更紧密。
| Source → Target | 模型 | Baseline | Transferred | 收益 |
|---|---|---|---|---|
| OlympiadBench → Omni-MATH | GPT-5.4 | 56.6 | 60.3 | +3.7 |
| OlympiadBench → Omni-MATH | GPT-5.4-mini | 34.8 | 36.6 | +1.8 |
| OlympiadBench → Omni-MATH | GPT-5.4-nano | 38.8 | 40.1 | +1.3 |
这里没有 Direct 列。论文没有报告在 Omni-MATH 上进行领域内 SkillOpt 训练的结果,因此这里只能与不使用 Skill 的 Baseline 进行比较。三个模型规模上的收益均为正,但幅度不大。研究论文认为,这说明即使测试样例和答案格式约定都发生了变化,Skill 仍然保留了可复用的数学解题流程。
研究论文直截了当地说明了其中的机制。三种执行模式——直接聊天、Codex 和 Claude Code——都使用相同的 best_skill.md 文件格式。正是这项共同约定,让跨 Harness 实验从一开始就成为可能。
Codex Harness 会将当前 Skill 渲染成每项任务对应的 SKILL.md,并放在任务文件旁边,随后读取精简的执行 trace。Claude Code Harness 则通过 claude CLI 复现相同的工作区约定。两个 Harness 都不使用专门定制的 Skill 格式。
这项产物本身的形态也有利于可移植性。在六个 Benchmark 中,最终 Skill 的长度为 379~1,995 个 token,中位数约为 920。它们由 1~4 次被接受的编辑构成。论文的图 4 为每个 Benchmark 展示了一条学习到的规则,所有规则都是流程型的,而不是针对具体样例的。SpreadsheetBench 的规则原文含义是:检查工作簿结构和公式,然后在用户要求的整个目标区域内写入经过计算的静态值,而不是依赖 Excel 重新计算。
训练成本只需在线下一次性支付,而且可以衡量。研究论文报告称,每提升一个绝对测试分数,训练成本为 60 万~4,640 万个 token,具体取决于 Benchmark。SpreadsheetBench 每提升一分需要 60 万个 token,DocVQA 则需要 4,640 万个。优化器模型只在训练期间运行,部署时不会增加任何推理调用。
如果在一个 Harness 中训练出来的 Skill 能够在另一个 Harness 中保持效果,那么这笔一次性成本就可以分摊到多个环境中。Codex → Claude Code 的 SpreadsheetBench 结果已经证明了这种可能性。它还意味着,你可以在工具成本最低的环境中进行优化,再将 Skill 部署到产品实际运行的环境中。
审计价值是另一个独立且被低估的方面。部署的产物是一个文本文件,领域从业者几分钟内就能读完。对它所做的每项更改都有迹可循:每一步都会记录一个 edit_apply_report.json,其中包含每次编辑被接受或跳过的状态。与发布 fine-tuned weights 相比,同时具备可移植性和可检查性,代表着完全不同的工程运作方式。
现有证据只覆盖一个 GPT 模型家族,并且每个迁移维度仅涉及两个 Benchmark。因此,可移植性已经得到演示,但尚未形成普遍性结论。
一个在 Codex 中训练的 SpreadsheetBench Skill,在 Claude Code 中取得了 81.8 分,高于该 Harness 自行进行领域内训练所取得的 80.4 分。
全部 4 组跨模型、4 组跨 Harness 和 3 组跨 Benchmark 的迁移结果,都高于目标模型不使用 Skill 时的 Baseline。
迁移强度与任务类型相关:流程型的电子表格 Skill 迁移效果很好,数学推理型 Skill 的迁移效果则较弱。
可移植单元是一个长度为 379~1,995 个 token 的 best_skill.md 文件,由 1~4 次被接受的编辑构成。
资源:论文、GitHub、项目页面、文档、PyPI 和演示视频
涉及的 Baseline:GEPA、TextGrad、EvoSkill 和 Trace2Skill
涉及的 Benchmark:SearchQA、SpreadsheetBench、DocVQA、LiveMathematicianBench 和 ALFWorld
Asif Razzaq 是 Marktechpost Media Inc. 的 CEO。作为一名富有远见的创业者和工程师,Asif 致力于利用 Artificial Intelligence 的潜力推动社会福祉。他最近创办了 Artificial Intelligence 媒体平台 Marktechpost。该平台以深入报道 machine learning 和 deep learning 新闻而脱颖而出,其内容既具备扎实的技术基础,也易于广大读者理解。该平台每月浏览量超过 200 万,足以说明它在受众中的受欢迎程度。