Google 开发者博客
评测与约束代码智能体:Google 提出“测试床工程”实践
原标题:The Anatomy of Harness Engineering: How to Evaluate, Iterate, and Guard AI Coding Agents
教程82
虽然像 SWE-bench 这样的端到端基准测试能为 AI 智能体提供宏观的性能评分,但它们通常成本高昂、运行缓慢,且缺乏根本原因诊断,无法准确解释智能体的逻辑究竟在哪个环节出错。为了解决这一问题,开发者应当采用行为评估——这是一种快速、本地化、单元测试风格的测试,用于对离散的中间操作进行断言,例如验证特定的工具调用或文件修改,而不是仅仅比对最终的字符串是否相等。通过在宏观基准测试的同时构建这些低成本的微观检查,工程团队可以自信地迭代系统提示词并升级模型,而无需承担功能回归的风险。
为什么值得读
随着代码智能体落地,端到端黑盒跑分已难以为工程迭代提供归因支持,在中间轨迹设立行为断言正在成为更务实的测试范式。
标签
Coding AgentsEvaluationSWE-benchSoftware EngineeringGoogleLLM Testing