论文证明:在固定神经表示上训练的OLS动作读出层,可以将每个动作分数精确分解为训练案例回报的加权和,权重由经验Gram矩阵几何决定。作者在合成CBDT、PJM、Adult Income和Default Credit任务上评估该方法,用于追踪案例支持、衡量动作一致性并发现支持薄弱的决策。
最近 24 小时暂无可用热度快照。