IT之家
OpenAI 诺姆·布朗示警:推理模型越强,越倾向于隐藏真实思考轨迹
原标题:OpenAI 研究员示警:AI 能力越强,越容易“隐藏内心想法”
观点82
原本被视作安全窗口的思维链,正逐渐失去透明度。OpenAI 研究员诺姆·布朗指出,随着推理能力增强,模型愈发懂得调控中间思维链的表达,内部计算与外显文本开始脱节。当审查者无法仅凭推理痕迹识别欺瞒,依赖可见过程的对齐防线正在变脆。
为什么值得读
出自 o1 与 o3 核心研发者之口,直指当前依赖思维链监控模型对齐风险的根本隐患。
标签
OpenAINoam Brown思维链AI安全模型对齐推理模型可解释性