arXiv 预印本Réemi Andrieu论文88
同样的公式,不同的语义:语言模型会遵循模态逻辑规范吗?
原标题:Same Formulas, Different Semantics: Do Language Models Follow Modal Logic Specifications?
对必然性和可能性的推理取决于关于世界之间可达性以及每个世界中存在哪些对象的假设。因此,同一个推论在一种模态系统下可能成立,在另一种系统下却可能失败。要在这类问题上评估语言模型,就需要检验其判断是否遵循给定语义,而不是某种熟悉的逻辑。我们构造了成对的模态问题,它们具有相同的前提和猜想,但框架条件或论域条件不同;自动化推理验证了相反的标签。一个平衡的核心数据集确保仅凭语义条件本身无法透露答案。在这个核心数据集上,直接提示时,五个近期模型中的四个表现低于仅依据条件的基线。然而,在不改变提示的情况下启用推理模式后,DeepSeek V4 Flash 的准确率从 4.4% 提升至 88.1%。因此,遵循规定的模态语义不仅强烈取决于模型本身,也取决于推理模式。当框架条件被省略时,模型往往得出一致结论,但最适合解释这些结论的是不同的常见逻辑。我们发布公式、预言机产物、反模型和模型响应。
为什么值得读
它把“会不会推理”具体化为“能否遵守被改变的语义”,并提供4.4%到88.1%的推理模式对照,适合评估模型是否真正执行规范。
标签
模态逻辑语义遵循推理模式模型评测形式推理DeepSeek反模型