Hacker Newspaimapi
大语言模型在自适应探索中衍生出全新社会偏见
原标题:Large language models develop novel social biases through adaptive exploration
论文76
当语言模型在交互中自主探索与试错时,偏见的形成有了新的路径。研究显示,模型不仅会复现语料中既有的刻板印象,还能在自适应策略优化中衍生出训练数据之外的社会偏见。强化学习在寻求回报的同时,悄然推演出了未被直接灌输的分化逻辑。
为什么值得读
揭示了偏见在动态探索策略中自发生成的路径,推动安全对齐从静态语料过滤转向交互回路的行为监控。
标签
LLM强化学习AI安全社会偏见OpenReview自适应探索