论文提出用小语言模型联合完成智能体选择与工具参数生成,先通过监督微调、再以基于检索相关性的层级奖励进行强化学习。模型在智能体与查询错配子集上取得0.918的NDCG@10,整体均值为0.771,平均路由延迟120.1毫秒。
最近 24 小时暂无可用热度快照。