论文指出,结构化剪枝后的大语言模型在选择题上可能表现尚可,却会在自由生成中出现贪心 pass@1 崩溃和后缀重复。ShortOPD利用原模型作为冻结教师,在压缩模型自身的在线状态上进行密集监督,并按可用有效长度从短到长安排 rollout。摘要称其在数学、代码和开放生成任务上达到未恢复模型约9倍得分,较常见恢复方法提升1.6至4.4倍;接近8192长度rollout效果时,训练时间从35.9小时降至8.5小时,rollout token减少71%。
最近 24 小时暂无可用热度快照。