论文构造了前提与猜想完全相同、但框架或对象域条件不同的成对模态逻辑题,并用自动推理验证相反标签。在平衡核心测试中,五个模型中的四个低于仅凭条件猜答案的基线;开启推理模式后,DeepSeek V4 Flash准确率由4.4%升至88.1%。
最近 24 小时暂无可用热度快照。