OpenAI Alignment 团队页面讨论一种测量模型奖励寻求倾向的方法:通过植入具有对比性的信念,观察模型行为是否系统性改变。当前可确认信息主要来自 Hacker News 条目,尚缺完整方法、实验设置与结果数据,因此应将其视为待核验的研究预览。
最近 24 小时暂无可用热度快照。