论文系统评估大语言模型在表格任务中的数据引用错误(DRE),涵盖1.7B至20B参数模型。研究发现所有测试模型均会错误引用或遗漏表格值;加入数据引用批评器后,答案准确率最高提升12.0%,一个4B轻量批评器检测DRE的平均F1达到78.2%。
最近 24 小时暂无可用热度快照。