迈向技能原生 LLM:用技能熵评测与训练长程推理
原标题:Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning
近期大语言模型中的长程推理要求模型在推理链中切换不同的技能,例如先进行数学推导,再利用推导结果制定日程安排。我们将此类问题称为跨技能长程任务:这类多步骤任务的各个步骤需要不同的推理技能,并且依赖于前面步骤的输出。现有基准测试通常评估单项技能,缺乏一种衡量模型切换技能能力的原则性方法。我们从评估和训练两个方面弥补这一空缺。我们提出技能熵(Skill Entropy),用于衡量从一种技能切换到另一种技能的难度。随后,我们提出 Skill^2-Bench,这是一个跨技能长程任务基准,涵盖 9 个可验证和开放式领域中的 558 项技能。每个任务都被分配一个任务级技能熵分数,并被归入三个难度等级。在 Skill^2-Bench 上评估 8 个前沿模型和 4 个开源模型后,我们发现了技能切换差距:在熵更高的任务上,准确率会下降。随后,我们将技能熵从基准测试尺度转化为训练信号。我们提出 Skill-Entropy RL,这是一种强化学习框架,模型在每一步不仅预测答案,还预测生成该答案所使用的技能。奖励结合了步骤级正确性和技能熵奖励,后者用于衡量模型预测的技能序列与标准技能序列之间的一致性。在 Qwen3-4B-Instruct 和 Qwen3-1.7B 上,Skill-Entropy RL 将 Skill^2-Bench 得分分别从 34.4% 提升至 68.4%,以及从 14.6% 提升至 40.1%,优于具有竞争力的基线方法。同一流程也可以应用于 OpenR1-Math 等现成训练数据,这表明技能熵是一种可复用的训练信号。代码地址:https://github.com/Gen-Verse/Skill-Entropy-RL
为什么值得读
长程推理评测正从单项能力转向技能组合与切换;这项工作同时提供了新的基准、难度刻度和可复用训练信号。