arXiv 预印本Yiling Ma
论文描述与代码实现之间:IdeaAMBIG 揭示大模型的规格盲区
原标题:IdeaAMBIG: Benchmarking Implementation-Critical Gaps in Research-Idea Specifications
论文77
一个研究构想可能新颖、连贯且在科学上合乎逻辑,但其提出的方法仍可能缺乏足够详尽的说明,从而难以被忠实实现。我们研究了面向实现的研究方法规范的“可代码化就绪度”(codification readiness),其定义为:该规范是否为合格的实现者或编程智能体提供了充足的方法学信息,使其无需依赖无根据的假设即可构建出目标方法。我们从学术论文、代码库、issue 讨论帖以及复现工件中构建了立足实据的规范及其支持的解决方案。我们推出了包含 660 个实据实例的基准测试 IdeaAMBIG:包括源自复现报告和 GitHub issue 的 163 个真实断层/缺陷,以及注入到具备代码化就绪条件的参考规范中的 497 个受控合成缺陷。IdeaAMBIG 评估三项能力:可代码化就绪度评估、缺陷定位以及澄清操作生成。其中,缺陷定位仅接收方法规范,而澄清操作生成还会额外接收已标注的缺陷。在测试的 13 个大语言模型中,表现最优的模型在真实实例上的宏平均缺陷恢复率仅为 9.6%,但在给定缺陷的情况下,其宏平均澄清操作成功率可达 80.6%。在 Oracle(理想条件)研究中,提供标准解答能将下游的可代码化就绪率从 14% 提升至 98%。在所有被评估的模型中,缺陷定位是主要的瓶颈,而在直接给出缺陷时,模型的澄清表现则强得多。
为什么值得读
明确指出了代码代理在自动科研中的核心瓶颈:模型善于修补已被指出的漏洞,却几乎无法自主发现论文描述中的关键信息缺失。
标签
Autonomous AgentsCode GenerationLLM BenchmarkReproducibilityAI for ScienceSoftware Engineering