该论文指出,深度研究代理需要的不是逐篇相关文档,而是满足多样性、简洁性与权威性等整体要求的文档集合。作者提出分层搜索评 rubric,并以此训练 RubricRanker,结合监督微调与基于 rubric 的强化学习,在四个深度研究基准上较最强基线提升 2.6 分,并泛化至五个 RAG 基准。
最近 24 小时暂无可用热度快照。