论文区分思维链的“忠实性”与“推理一致性”:前者需干预实验验证,后者可仅凭评估转录文本检查。作者提出六类不一致 taxonomy,构建包含60条经人工改编并验证的 InstrumentalEval 转录基准,并为 InspectScout 实现扫描器,在4个生成模型和3项 inspect_evals 评估中观察到推理不一致会随模型与任务类型变化。
最近 24 小时暂无可用热度快照。