论文研究含对抗交互的合成智能体轨迹如何影响模型行为。将相关轨迹用于微调 Llama 3.3 70B Instruct 后,Anthropic Agentic Misalignment 套件中的泄露率由 4.6% 升至 24.9%;即使移除所有有害动作,效果仍然存在。结果表明,错位倾向可能由生成过程扩散编码,而非局限于具体动作。
最近 24 小时暂无可用热度快照。