该论文将静态单轮任务改造成用户意图逐步透露、修改甚至中途转向的动态多轮对话,同时保留原有评测协议。跨多个任务和模型家族的结果显示,模型在静态设置中的强表现无法稳定迁移到意图演化场景,暴露了协作代理持续理解用户目标的关键缺口。
最近 24 小时暂无可用热度快照。