该条目讨论大语言模型训练数据中的基准答案泄漏,以及这种污染如何削弱评测结果的可信度。现有材料仅包含标题与 Hacker News 元数据,未提供文章正文、污染检测方法、实验数据或具体模型案例,因此目前只能确认其主题,无法核验作者的论证与结论。
最近 24 小时暂无可用热度快照。