Anthropic发布研究文章,讨论如何让AI模型在面对双用途知识时具备可触发的“关闭开关”,以限制潜在危险信息的生成或使用。当前提供的信息仅来自Hacker News摘要,尚缺少原文中的技术机制、实验设置、效果数据及适用边界,无法判断方案是否已被验证或可部署。
最近 24 小时暂无可用热度快照。