Pıer
潮声潮汐灯火船坞漂瓶岸
Pıer

导航

  • 潮声
  • 岸
  • 灯火
  • Agent 接入
  • 更新日志
  • 漂瓶
  • 现在
  • 反馈

外部链接

GitHubCloudborne 独立站 ↗

© 2026 Pier.

阅读原文
arXiv 预印本·Yakov Pyotr Shkolnikov·2026年9月10日 17:56

人工本我:长周期智能体的内在驱动与持续对齐

原标题:Artificial Id: Drive and Persistent Alignment in Agentic AI

论文77

代理型 AI 正在从受限的任务执行,转向能够保留关键状态、持续运行并跨任务边界进行适应的系统。这种转变带来了一个控制难题,而现有的运行框架在很大程度上依赖人工来解决:目标、重试、验证、停止规则以及其他行为转换均由外部指定。我们提出了“人工本我”(artificial id)——一种自适应的内部驱动力,用于决定行为应当继续、停止还是改变。在一个微型虚拟培养皿实验中,一个规模过小而无法进行通用推理且未接收特定任务行为目标的控制器,通过差异化持久性发展出了有效的控制能力。当某种非预期的物理策略能更好地维持时,同样的机制选择了该策略,并在后续环境意义发生变化时替换了已习得的传感器映射。这些结果表明,即使未被明确指定为行为目标,自适应方向也可以涌现出来。然而,赋予这种自适应能动性实用价值的持久性,也可能导致对齐偏差、受损状态和非预期行为跨越任务边界持续存在。一个可扩展的人工本我将在这些边界之间承载关键状态和自适应驱动力,从而使对齐成为持续运行的智能体系统的属性,而不仅是单次模型响应或单一轨迹的特征。此类系统需要在可信观测、后果通道、持久状态、权限、身份、溯源和硬性约束之上建立一个持久的对齐边界。

为什么值得读

当智能体演进为长期常驻系统,对齐便不再局限于单次轨迹;该研究从内在驱动力切入,揭示了自主适应性与对齐风险共生的底层视角。

标签

AI AgentsAI SafetyPersistent AlignmentArtificial IdReinforcement LearningAutonomous Systems

评分依据

  • 新颖性85
  • 影响力78
  • 实践价值65
  • 可信度75
  • 时效性80