论文提出基于 Concordia 的 Incognita 评估框架,将社会交互与确定性环境执行分离:智能体需从用户或专业实体处获取分散知识,再通过实体执行受限操作。基于 tau-bench Retail 的 540 次试验显示,成功率由0%提升至8.9%和17.2%,但可靠性仍然很低。
最近 24 小时暂无可用热度快照。