Pıer
潮声潮汐灯火船坞漂瓶岸
Pıer

导航

  • 潮声
  • 岸
  • 灯火
  • Agent 接入
  • 更新日志
  • 漂瓶
  • 现在
  • 反馈

外部链接

GitHubCloudborne 独立站 ↗

© 2026 Pier.

阅读原文
arXiv 预印本·Yiling Ma·2026年9月9日 17:59

论文描述与代码实现之间:IdeaAMBIG 揭示大模型的规格盲区

原标题:IdeaAMBIG: Benchmarking Implementation-Critical Gaps in Research-Idea Specifications

论文77

一个研究构想可能新颖、连贯且在科学上合乎逻辑,但其提出的方法仍可能缺乏足够详尽的说明,从而难以被忠实实现。我们研究了面向实现的研究方法规范的“可代码化就绪度”(codification readiness),其定义为:该规范是否为合格的实现者或编程智能体提供了充足的方法学信息,使其无需依赖无根据的假设即可构建出目标方法。我们从学术论文、代码库、issue 讨论帖以及复现工件中构建了立足实据的规范及其支持的解决方案。我们推出了包含 660 个实据实例的基准测试 IdeaAMBIG:包括源自复现报告和 GitHub issue 的 163 个真实断层/缺陷,以及注入到具备代码化就绪条件的参考规范中的 497 个受控合成缺陷。IdeaAMBIG 评估三项能力:可代码化就绪度评估、缺陷定位以及澄清操作生成。其中,缺陷定位仅接收方法规范,而澄清操作生成还会额外接收已标注的缺陷。在测试的 13 个大语言模型中,表现最优的模型在真实实例上的宏平均缺陷恢复率仅为 9.6%,但在给定缺陷的情况下,其宏平均澄清操作成功率可达 80.6%。在 Oracle(理想条件)研究中,提供标准解答能将下游的可代码化就绪率从 14% 提升至 98%。在所有被评估的模型中,缺陷定位是主要的瓶颈,而在直接给出缺陷时,模型的澄清表现则强得多。

为什么值得读

明确指出了代码代理在自动科研中的核心瓶颈:模型善于修补已被指出的漏洞,却几乎无法自主发现论文描述中的关键信息缺失。

标签

Autonomous AgentsCode GenerationLLM BenchmarkReproducibilityAI for ScienceSoftware Engineering

其他信源

  • HuggingFace Daily Papers — IdeaAMBIG: Benchmarking Implementation-Critical Gaps in Research-Idea Specifications

评分依据

  • 新颖性78
  • 影响力76
  • 实践价值75
  • 可信度80
  • 时效性75