ModelEquivBench将大模型生成优化模型的评测拆分为E0至E6七类关系:从模型构造、表示对齐,到可行域、目标排序、最优值和最优解集等价性。每个结论附可复核证据,并以UNKNOWN、N/A或ABSENT表达不确定性。基于173个问题比较GPT-5.4、Claude Sonnet 4.6和Qwen3.5-397B-A17B,结果显示三者在不同阶段失败,单一准确率难以概括表现。
最近 24 小时暂无可用热度快照。