阅读原文
arxivpapers88

PhyAI:在边缘实时运行、在云端规模化扩展的物理人工智能推理引擎

原标题:PhyAI: Real-Time Physical AI at the Edge, Scalable Rollouts in the Cloud

AI 导读

PhyAI以统一运行时覆盖物理AI模型评估、云端强化学习rollout、边缘GPU服务和板载部署,将模型特定逻辑放入适配器,并共享图执行、内核、内存与并行服务。其相较官方实现为pi0、pi0.5、GR00T N1.7和MiniCPM-Robot带来1.40至4.65倍加速;在8张H20上将Cosmos3延迟从2.46秒降至1.18秒。

为什么值得读

物理AI正从单模型演示转向云端训练与板载控制协同,PhyAI给出了统一部署栈的实测收益,也量化了通用运行时的边界。

深度解读

1. 发生了什么

原始事实: 论文介绍 PhyAI,一个面向物理AI的统一推理引擎,覆盖模型评估、云端强化学习rollout、边缘GPU服务和板载部署。相同代码库支持VLA模型与WAM模型,可运行于单GPU或多GPU环境。

2. 核心技术

原始事实: 架构特定的条件处理、求解器、缓存和输出逻辑被放入模型适配器;图执行、算子内核、内存管理和并行服务由运行时共享。该适配器接口还用于在MiniCPM-Robot发布当天接入它。 分析: 这种边界试图同时保留模型差异与基础设施复用,重点不是构建单一模型,而是减少多套推理程序的维护与性能调优成本。

3. 关键证据与数字

原始事实: 相较pi0、pi0.5、GR00T N1.7和MiniCPM-Robot的官方实现,PhyAI报告1.40x至4.65x加速。Cosmos3-Nano-Policy-DROID在8张H20、CFG=2、TP=4配置下,延迟由2.46秒降至1.18秒,约2.08x加速。Hopper GPU、batch size为1时,pi0.5动作专家占8.8%的FLOPs却占57.2%的延迟;batch size为32时,该占比降至13.5%,吞吐约100 samples/s。Cosmos3从batch 1增至16时吞吐仅提高14.3%。

4. 为什么重要

分析: 物理AI需要在训练、评估和控制环节持续执行策略;统一运行时可降低模型迁移到不同硬件和服务形态时的工程断裂。控制时间Roofline进一步把系统区分为推理受限或环境受限,有助于判断优化GPU还是优化仿真与环境交互。 原始事实: 四个LIBERO套件上的pi0.5测量点被归为环境受限,而Cosmos3仍为推理受限。

5. 实际影响

分析: 对机器人平台团队,PhyAI可能减少云端rollout、边缘服务和板载部署之间的重复实现;对模型开发者,适配器接口提供了较明确的接入位置。实际收益仍取决于模型结构、batch size、并行策略、硬件和环境步进成本。

6. 局限与不确定性

原始事实: 论文明确指出,专用运行时在若干配置下仍更快;目标是让单一运行时保持有竞争力,而不是在所有场景都达到最快。摘要未提供完整硬件、软件版本、基线参数、统计波动和端到端任务成功率。 未验证推断: 统一适配器能否在更多未支持的VLA/WAM模型上保持相同收益,以及是否会引入调试、数值一致性或实时控制稳定性问题,需查看完整论文、代码和独立复现。

7. 原始来源

  • 论文页面:arXiv:2608.03682
  • 代码与基准:mingti-org/phyai
  • 本条事实依据:用户提供的论文标题、摘要、发布日期和链接;未额外核验完整论文内容。

标签

Physical AIroboticsinferenceedge AIVLAworld-action modelsGPU optimizationreinforcement learningH20PhyAI