论文提出 IBA-Bench,用含噪声、隐式线索与时间矛盾的长期交互历史,评测智能体能否推断用户约束并在任务执行中遵守,从而研究“知识到行动”鸿沟。作者还提出结合广泛检索与轨迹级对齐的 IBA-Agent,并称其在九个应用领域的复杂场景中显著改善行为对齐,但摘要未提供具体模型、样本规模与数值结果。
最近 24 小时暂无可用热度快照。