AgentDebugX 将智能体调试组织为“检测、归因、恢复、重跑”闭环,核心模块 DeepDebug 通过全局轨迹理解、结构化调查和交叉质询定位根因。在 Who and When 基准上,qwen3.5-9b 的严格智能体与步骤联合归因准确率为28.8%,高于最佳单次基线的21.7%;在 GAIA 上单次重跑修复73个失败任务中的13个,使总体准确率由55.8%升至63.6%。
最近 24 小时暂无可用热度快照。