论文提出CRTBench基准,包含350个问题家族、共1750道题,用受控改写测试模型在逆否命题、双重否定、否定翻转和被动语态下能否保持逻辑不变。结果显示,GPT-5.4-mini基础准确率达98.9%,但家族级一致性仅60.3%;提高推理强度可升至85.4%。
最近 24 小时暂无可用热度快照。