阅读原文
HuggingFace 每日论文Jiahao Zhao论文88

ToolArtist:用于智能体式图像生成的工具调用统一多模态模型

原标题:ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation

ToolArtist通过后训练统一多模态模型,让单一策略统一协调推理、搜索工具调用与原生图像生成。论文提出RAD-GRPO强化学习方法,并发布训练数据及完整后训练基础设施,实验称其优于固定流程或部分智能体化方案。

为什么值得读

图像生成正从单轮提示词走向开放世界任务,ToolArtist把检索、推理和绘图纳入同一策略,值得及时关注其训练与评测方法。

标签

ToolArtist多模态模型智能体图像生成RAD-GRPO强化学习工具调用