论文提出AFTER基准,覆盖382项企业任务、6类职业角色和22种程序技能,用于评估程序记忆在本地改进、跨任务、跨角色及跨模型场景中的表现。摘要显示,单轮技能精炼可提升3.7至6.7个百分点,多模型执行轨迹演化出的技能跨模型测试准确率达到73.1%,但部分技能存在明显的角色专用化。
最近 24 小时暂无可用热度快照。