论文提出递归式工具链自我改进(RHI):把智能体循环表示为提示级规范,并通过自身修订历史中的成对反馈迭代优化。在涵盖量化金融、机器人和药学的30个合成机器学习研究任务上,少量迭代即可提升低推理强度智能体表现,最高降低推理成本60%。作者认为,收益主要来自更好的任务上下文管理与智能体间信息流,而非更长的思维轨迹。
最近 24 小时暂无可用热度快照。