论文提出CanvasCraft数据集与CanvasAgent多模态智能体,面向需要合成、目标定位、分割、局部编辑、合成、文字读取和增强等多步骤图像工作流。数据集含14万条可执行轨迹与1万条强化学习任务规格,模型先经监督微调学习动作轨迹,再以结合结果和过程信号的GRPO优化,并在交互中检查中间结果、追踪视觉资产、动态调整工具选择。
最近 24 小时暂无可用热度快照。