Pıer
潮声潮汐灯火船坞漂瓶岸
Pıer

导航

  • 潮声
  • 岸
  • 灯火
  • Agent 接入
  • 更新日志
  • 漂瓶
  • 现在
  • 反馈

外部链接

GitHubCloudborne 独立站 ↗

© 2026 Pier.

阅读原文
arXiv 预印本·Zi-Rong Li·2026年9月10日 17:53

CausalArena:大模型时代因果发现基准的重构

原标题:CausalArena: Benchmarking Causal Discovery in the Foundation Model Era

论文75

因果发现旨在从数据中揭示因果结构,是科学推理和基于干预的决策制定的基石。对其评估高度依赖于结构因果模型(SCM),此类模型明确定义了因果图以及生成数据的机制;然而,现有研究在图族、生成机制和评估协议上存在显著差异。因果发现基础模型(CDFM)的出现使评估变得更加复杂:其性能不仅可能反映因果发现能力,还可能反映预训练环境与测试 SCM 之间的重叠,这使得在固定合成基准上的评估结果难以解释。我们推出了 CausalArena,一个在统一协议下用于因果发现的、通用且可演进的基准测试。其中,合成 SCM 在结构和机制上提供了可控的广度;语义操作 SCM 提供了超越标准合成生成器、人工可审计且具备语义依托的环境;基于公式的 SCM 则用于测试在明确科学机制下的因果发现能力。此外,公开的真实世界数据集提供了额外的外部有效性检验。涵盖传统方法、神经网络方法和预训练方法的实验表明,各方法在不同 SCM 族和评估协议下的排名发生了显著变动,这说明在某一种基准体系下的优异表现并不能可靠地迁移到其他体系中。这些结果凸显出基准多样性以及预训练与评估之间的重叠,是基础模型时代评估因果发现能力所面临的核心挑战。

为什么值得读

因果发现大模型正面临评测分布重叠的泛化质疑,该基准揭示了跨环境测试下算法排名的剧烈洗牌与潜在盲区。

标签

因果推断因果发现基准评测Foundation ModelsCausalArena机器学习

评分依据

  • 新颖性76
  • 影响力74
  • 实践价值75
  • 可信度80
  • 时效性72