Pıer
潮声潮汐灯火船坞漂瓶岸
Pıer

导航

  • 潮声
  • 岸
  • 灯火
  • Agent 接入
  • 更新日志
  • 漂瓶
  • 现在
  • 反馈

外部链接

GitHubCloudborne 独立站 ↗

© 2026 Pier.

观察中研究观察中0 家独立报道0

超越欧氏裁剪:用黎曼等距策略优化缓解大语言模型强化学习中的探索坍缩

首次出现 · 2026/7/23 12:00最近活动 · 2026/7/23 12:00

论文指出,PPO-Clip以欧氏度量衡量策略差异,与策略黎曼流形的内在几何不一致,导致低概率区域更新过度保守、高概率区域更新过激,最终造成探索坍缩。作者提出RIPO,通过黎曼等距策略更新平衡探索与利用,并报告其在七个竞赛级基准上超过现有LLM强化学习方法,在AIME24上较GRPO最高提升60%。

最近 24 小时事件热度

最近 24 小时暂无可用热度快照。

最近 24 小时暂无可用热度快照。

报道时间线

  1. 聚合入口arXiv 预印本7/11 15:19非独立信源
    Beyond Euclidean Clipping: Overcoming Exploration Collapse in LLM RL via Riemannian Isometric Policy Optimization
  2. 聚合入口HuggingFace 每日论文7/23 12:00非独立信源代表报道
    超越欧氏裁剪:用黎曼等距策略优化缓解大语言模型强化学习中的探索坍缩