该研究评估生产级企业智能体 Leni 在 SpreadsheetBench Verified、BullshitBench v2 和 GAIA 三项基准上的可靠性来源。完整系统相对前沿基座模型分别提升 11.0、7–10 和约 15 个百分点;消融显示,大部分收益来自脚手架、路由和专用模型,验证循环本身仅贡献约 1.5 个百分点,但集中修复高分段任务。
最近 24 小时暂无可用热度快照。