论文研究4-bit后训练量化对多轮工具调用智能体的影响。在τ²-bench的8个实验单元中,标准得分未出现校正后显著下降,但既有故障量最高放大2.5倍,每任务增加17.6个百分点;十次错误预算掩盖了损伤,缩至两次后暴露出17分差距。
最近 24 小时暂无可用热度快照。