Opti-Agent-Bench针对现有优化智能体评测过度依赖预结构化数学题的问题,覆盖从业务需求理解、数学建模、算法选择、代码实现到报告生成的完整流程。论文提出反模板陷阱、跨模块一致性检查及ORAC双层有效性框架,并揭示约束遗漏、模型代码不一致和报告实现偏离等常规单指标难以发现的失败模式。
最近 24 小时暂无可用热度快照。