AgentLens提出一种面向交互式编码智能体的生产评估基准,不再只用任务成功或失败衡量一次运行,而是结合形式化验证、LLM轨迹评审和并排比较,分析智能体如何遵循指令、调用工具、自我验证、纠错及与用户沟通,并支持行为诊断、版本比较和夜间回归检测。
最近 24 小时暂无可用热度快照。