这项预注册审计比较三个导师模型基础上的对话式与教学式策略,并用固定弱模拟学生、确定性检测器及Claude Opus 4.8主评判。结果显示,通用“有帮助”评分无法稳定区分教学质量;教学评分在模型间方向较稳健,而有帮助性的排序在三组中的两组随评判模型反转。答案泄漏还持续降低学生下一轮独立作答。
最近 24 小时暂无可用热度快照。