阅读原文
google-dev-blogproducts82

Gemini Enterprise Agent Platform 的智能体与模型评估服务正式 GA

原标题:Agent and Model Evaluations in Gemini Enterprise Agent Platform are now GA

AI 导读

Google 宣布 Gemini Enterprise Agent Platform 的评估服务正式全面可用,可用统一引擎评测本地实验与生产流量中的智能体。服务提供 20 多项预置指标、DeepMind 支持的自适应评分规则,以及自定义代码和 LLM-as-a-judge 指标,并通过版本化注册表、用户与环境模拟器及 SDK、agents-cli、ADK 集成支持多轮测试和 CI。

为什么值得读

智能体正在进入生产环境,这项 GA 服务把多轮模拟、版本化指标与线上评测纳入同一套工程流程,值得平台团队及时评估。

深度解读

1. 发生了什么

原始事实: Google 开发者博客称,Gemini Enterprise Agent Platform 的智能体与模型评估服务已正式 GA。该服务以统一引擎覆盖本地开发实验和线上生产流量的质量测量。

2. 核心技术

原始事实: 服务支持三类评估方式:20 多项预置指标、由 DeepMind 支持的自适应评分规则,以及开发者编写的代码型或 LLM-as-a-judge 指标。评估器存放在集中式、可版本化的注册表中,并可通过 Agent Platform SDK、agents-cli 和 ADK 接入工作流。内置用户与环境模拟器用于自动执行复杂的多轮交互测试。

3. 关键证据与数字

原始事实: 公告明确给出的规模数字是“20 多项预置指标”。其余可核实能力包括本地与生产环境共用评估引擎、版本化指标注册表、多轮用户及环境模拟,以及 SDK、CLI 和 ADK 集成。摘要未提供基准成绩、成本、延迟、支持区域或生产案例数据。

4. 为什么重要

分析: 智能体评估通常分散在离线数据集、人工审查、CI 脚本和线上监控中。统一评估器及其版本管理有助于减少环境间指标漂移,并让团队追踪评分标准变化;但实际一致性仍取决于测试集、评分规则和线上采样设计。

5. 实际影响

分析: 使用 Google 智能体工具链的团队可将回归评估加入 CI,在发布前借助模拟器测试多轮任务,并对生产流量采用相同或受控版本的指标。代码型评估适合确定性约束,LLM-as-a-judge 更适合开放式质量判断,两者通常需要组合使用并保留人工校准。

6. 局限与不确定性

原始事实: 已提供的摘要没有说明定价、配额、数据驻留、隐私控制、评审模型、指标定义或自适应评分规则的具体机制。分析: LLM-as-a-judge 可能受到模型偏差、提示敏感性和非确定性的影响。未验证信息: 所给发布时间为 2026-08-06,相对当前评估语境属于未来日期,因此 GA 状态及产品命名需在原文可核验时再次确认。

7. 原始来源

标签

GoogleGeminiAgent EvaluationLLM-as-a-JudgeADKCI/CDEnterprise AI