论文提出一种面向生成式人工智能的价值学习方法:利用成对提示词—回答偏好数据,同时学习多目标奖励模型中的价值地基实现,以及由加权线性标量化表示的价值体系。算法动态优先学习一致的价值表示,并在偏好数据集上与基线及当代方法比较,在保持竞争力的同时提升可解释性。
最近 24 小时暂无可用热度快照。