ToolArtist通过后训练统一多模态模型,让单一策略统一协调推理、搜索工具调用与原生图像生成。论文提出RAD-GRPO强化学习方法,并发布训练数据及完整后训练基础设施,实验称其优于固定流程或部分智能体化方案。
最近 24 小时暂无可用热度快照。