通过量化模型切换推理技能的难度作为训练信号,4B Qwen3在多技能切换基准上从34.4%升至68.4%。
早期的长视野基准将每个步骤视为孤立的技能,仅对最终正确性进行奖励,使得技能转换的成本无法被测量。GSM8K 等数据集在隔离环境下评估数学推导,而 PPO 或 GRPO 等标准 RL 框架没有显式整合中间技能对齐,Skill-Entropy RL 正是对这一点的增强。因此,模型没有动力去规划不同推理模式之间的平滑交接。作者甚至固定了一个参考模型——Claude-opus-4.7——来跨实验一致地计算任务级熵 [1]。
Skill-Entropy RL 将 4B Qwen3 模型的 Skill²-Bench 分数从 34.4% 提升至 68.4%,在需要多次技能切换的任务上将准确率提高了一倍以上 [1]。该奖励在步骤级正确性的基础上增加了一个项,用于衡量预测技能序列与标准技能序列之间的对齐程度,从而鼓励模型选择更容易的转换。经验上,在更高熵的任务上观察到了更大的改进,表明该奖励有助于缓解技能切换的难度。
同样的奖励将 1.7B 变体从可怜的 14.6% 提升至 40.1%,证实了即使是小模型也能从熵项中强烈受益 [1]。在两种规模下,改进都远远超过了标准仅答案奖励在同一基准上达到的效果。这种可扩展性表明,该方法并不依赖于特定的模型规模,而是依赖于训练信号本身的结构。
该方法依赖于标准技能标注,而这些标注仅在精心策划的 Skill²-Bench 和类似数据集中提供;将信号扩展到开放域语料库可能需要昂贵的标注成本。此外,评估仅限于 Qwen3 变体,留下了改进是否能够迁移到其他架构的问题。尽管如此,"标注者-模型一致性接近标注者间的上限,表明熵标度在很大程度上反映了人类对技能切换难度的感知" [1],这验证了该指标在这些约束下的有效性。
现在,需要协调算术、规划或常识步骤的训练流程应该在其奖励函数中附加一个技能熵组件,未来的跨技能基准很可能采用熵分数作为主要难度轴心。由于其添加的简单性——每步预测一个技能标签并奖励对齐——意味着可以用最小的工程开销将其插入现有的 RL 循环中。
Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning