这篇综述为机器人学习中的进度奖励建模建立统一框架,从模型接口、信号构造方法、数据与基准三个层面梳理研究。文章比较输入观测、目标规格、输出形式、监督来源和评估协议,并总结当前局限与未来方向。
最近 24 小时暂无可用热度快照。