论文提出元认知反馈强化学习(RLMF)与元认知数据选择,用模型对自身表现的判断改进偏好优化和训练样本筛选,并应用于忠实校准。摘要称,RLMF在多任务上保持准确率,同时较标准强化学习最多提升63%,改善模型识别能力边界及表达不确定性的能力。
最近 24 小时暂无可用热度快照。