阅读原文
hf-paperspapers84

Beacon:让智能体视觉推理知道何时以及如何使用工具

原标题:Beacon: Knowing When and How to Perform Agentic Visual Reasoning

AI 导读

论文重新审视多模态大模型的智能体视觉推理,提出模式自适应性(MA)与工具效果(TE)两个分析维度。作者指出,现有方法常在简单问题上因不必要调用工具而引入错误,抵消困难问题上的收益,并提出Beacon及其必要性感知自适应奖励、提示引导能力扩展机制。

为什么值得读

工具调用成本与误用已成为视觉智能体的核心瓶颈,这项工作把“是否该调用”与“调用后是否真正增益”分开量化,值得现在关注。

深度解读

发生了什么

原始事实: 论文《Beacon: Knowing When and How to Perform Agentic Visual Reasoning》提出重新评估智能体视觉推理的方法,并介绍Beacon模型。论文编号为arXiv:2607.28595,来源页面为给定的arXiv摘要页。

核心技术

原始事实: 作者定义了模式自适应性(Mode Adaptiveness, MA)与工具效果(Tool Effect, TE)。Beacon在强化学习阶段使用必要性感知自适应奖励(Necessity-Aware Adaptive Reward)和提示引导能力扩展(Hint-Guided Capability Expansion)。

分析: 前者主要约束工具调用时机,后者主要强化困难任务中的工具使用能力,二者分别对应“要不要调用”和“调用后能否扩展能力”。

关键证据与数字

原始事实: 摘要称,现有智能体视觉推理模型的MA有限;工具在困难样本上的收益,大部分被其在模型本可解决的简单样本上造成的损害抵消。摘要还称,Beacon在多样化基准上取得更强总体表现,并改善MA与TE。

限制: 摘要没有给出具体基准名称、准确率、工具调用率、增益幅度、样本规模或对照模型,因此无法从当前材料核验这些改进的数量级。

为什么重要

分析: 视觉智能体的效率不只取决于工具能力,也取决于路由决策。MA与TE提供了比单一总体准确率更细的评估框架,有助于区分“工具本身无效”和“模型在不该调用时调用”这两类问题。

实际影响

分析: 若论文结果能在独立设置中复现,Beacon式训练目标可用于浏览、图表理解、视觉搜索和GUI操作等场景的工具路由。工程上可重点监控无工具基线、工具调用率、困难样本增益和简单样本回退率,而不只看最终平均分。

局限与不确定性

原始事实: 当前输入仅包含摘要,无法判断训练数据、工具集合、奖励实现、基座模型、计算成本及泛化范围。

未验证推断: 摘要所称“实质性改进”可能依赖特定工具或基准分布;在工具延迟、调用费用、视觉输入分布变化或更强基座模型下,MA与TE的表现仍需额外验证。

原始来源

  • arXiv:2607.28595
  • 来源:hf-papers
  • 提供的发布时间:2026-07-31T04:00:00.000Z

标签

Beacon视觉推理多模态模型智能体工具调用强化学习模式自适应工具效果