论文指出,面向大模型和智能体的检索不能只独立评估文档并汇总nDCG,还必须处理冗余、冲突与互补关系。作者提出包含约2.8万条评测标准的SetwiseEvalKit,并评测12种重排序器;最佳方法覆盖率不超过45%。无训练方法Rubric4Setwise将评测标准转化为集合选择信号,在短、长文本场景中以更少文档和搜索轮次取得最佳下游生成表现。
最近 24 小时暂无可用热度快照。