论文提出“技能熵”指标,用于衡量长程推理中不同技能之间切换的难度,并构建包含558项技能、覆盖9个可验证与开放领域的 Skill²-Bench。对8个前沿模型和4个开源模型的评测显示,技能熵越高,准确率越低。作者进一步提出 Skill-Entropy RL,在 Qwen3-4B-Instruct 和 Qwen3-1.7B 上将基准得分分别从34.4%提升至68.4%、从14.6%提升至40.1%。
最近 24 小时暂无可用热度快照。