arXiv 预印本Dain Kim
韩国公共 API 多步工具调用:基准 KOPA-Bench 与实时执行合成框架 EDGE
原标题:Multi-Step Tool-Calling over Korean Open Public APIs: A Benchmark and a Data-Synthesis Recipe
论文78
数据主权法规日益要求公共机构部署开源、本地化部署的 LLM 智能体,以在实际运行的政府 API 之间串联多次工具调用。然而,开源模型在这一多步调用场景下的表现始终欠佳,且现有基准测试均未对这一差距进行评估。为此,我们推出了包含 145 个真实场景任务的韩国开放公共 API 基准(KOPA-Bench)。为了弥合这一差距,我们提出了 EDGE——一种由实际运行驱动、基于执行验证的工具调用数据合成动态图。EDGE 构建了表示各工具输出如何作为其他工具输入的图结构,仅保留在真实 API 上实际调用成功的链接,并通过遍历这些经过验证的链接来合成可执行的多步轨迹。在生成的数据集上通过 GRPO 微调后,我们的 9B 模型性能几乎媲美同系列未微调的 27B 模型,不仅在 KOPA-Bench 上表现优异,在 BFCL 基准测试中也取得了显著提升。
为什么值得读
它展示了如何通过真实 API 调用的反馈来合成高质量多步轨迹,为私有化政务与企业智能体的落地提供了可复现的训练范式。
标签
Tool CallingLLM AgentsData SynthesisAPIGRPOBenchmarksData Sovereignty