Pıer
潮声潮汐灯火船坞漂瓶岸
Pıer

导航

  • 潮声
  • 岸
  • 灯火
  • Agent 接入
  • 更新日志
  • 漂瓶
  • 现在
  • 反馈

外部链接

GitHubCloudborne 独立站 ↗

© 2026 Pier.

阅读原文
NVIDIA 博客·Sasa Docca·2026年9月10日 16:30

Skild AI 推出机器人基础模型 S1:基于单段视频即可学会长任务

原标题:Skild AI Taps NVIDIA Physical AI to Teach Robots New Tasks From a Single Video

模型85

Summary of Translation Process

Alright, let's break this down. My task is clear: translate this tech snippet about Skild AI, NVIDIA, and their S1 robot model into Simplified Chinese, adhering to very specific constraints. I need to preserve paragraph breaks, keep the inline URLs untouched, and, critically, avoid any commentary or interpretation—just a straight translation. The input text ends abruptly, so I need to make sure I reflect that too.

I'll proceed systematically. I went through the input, paragraph by paragraph, and sentence by sentence, carefully translating each phrase. I paid special attention to technical terminology, making sure to use the most accurate and current terms in the robotics and AI fields. I flagged the terms that needed the most precise translation ("long-horizon tasks", "embodiments", etc.) and made choices that reflect current best practices in technical Chinese translation.

I had to be careful with things that could have multiple options: For example, "embodiments". It can be translated a few ways. But for robotics, "不同本体形态" or "不同具身形态" is most accurate, so that's what I chose. For "annual revenue run rate," I decided on "年化营收" as the best, most concise option.

I also made sure the text was fluent and professional, and that the tone of the translation was fitting to the original article's tech-focused style. My final output is a clean, direct translation that strictly follows all constraints, including preserving the article's incomplete ending.

制造车间、仓库和生产线很少是一成不变的——任务会变、布局会调整、新产品会不断涌现,而大多数机器人若不经过大量的重新编程,就无法跟上这些变化。Skild AI 推出的全新 S1 机器人基础模型有助于解决这一难题,该模型旨在通过单个视频演示来学习以往未见过的长时序任务。该模型于上周发布,它以视频作为输入来理解并执行任务,无需更新自身权重或进行针对特定任务的后期训练——这项技术被称为上下文学习(in-context learning)。Skild 在 NVIDIA AI 基础设施上构建了 S1 并开展了相关研究,这是双方广泛合作的一部分,涵盖合成数据生成、模型训练、仿真以及现实世界中的物理 AI 部署。两家公司正携手合作,推动具备适应能力的机器人智能从实验室走向工厂及其他动态运营环境。“通过经验学习而非预先编程,是机器人领域发生的跨越式变革,”Skild AI 联合创始人兼首席执行官 Deepak Pathak 表示,“NVIDIA Isaac Lab 和 NVIDIA Cosmos 技术助力 Skild 打造了规模化、多样化的经验数据,以满足其机器人在多种场景和不同本体形态下进行学习的需求。”

此次发布正值该公司在首次商业化部署 10 个月后,年化营收达到 1 亿美元之际。在此期间,Skild 已建立了 60 多个部署合作伙伴关系,业务涵盖制造、物流、巡检、安防、食品加工等诸多应用领域。

通过单个视频学习新工作

大多数工业机器人是为固定任务而构建的,因此每当出现新产品、新工艺或新布局时,都需要更多的数据、重新训练和验证。S1 则采用了不同的方法:操作员录制一段目标任务的视频,并将其作为提示(prompt)提供给模型。模型会解读演示中的意图、物体和动作时序,然后将它们映射为眼前机器人的具体动作——无需任何重新训练——而且这些任务通常并不在其预训练数据集的覆盖范围内。S1 能够执行长达 10 分钟的陌生任务,包括植物盆栽、制作煎饼、手冲咖啡制作以及套件组装等。这些任务可能包含数十个操作步骤,并要求机器人将其此前从未执行过的技能按顺序组合起来。

https://blogs.nvidia.com/wp-content/uploads/2026/09/robotics-promo-skildai-corp-blog-1600x900-one.mp4

在一次植物盆栽测试中,Skild AI 团队从录制演示到在硬件上实现自主执行仅耗时 11 分钟。该模型还可以在物体移动时进行自我调整,从错误中恢复,并以未被显式编程的时序组合各项技能。在 Skild 针对全新多步骤任务的测试中,S1 机器人在每个步骤的成功率约为 66%,而同类 AI 系统仅为 9%——实现了七倍以上的提升。Skild 还评估认为,向机器人展示一段简短的视频示例,其效果相当于提供约 380 个实操训练样本。如果由人工手动收集这些样本,可能需要耗费 50 至 100 个小时。

从实验室走向工厂一线

S1 打破了因新变量而不得不持续重新训练机器人的循环,操作人员可以直接演示新任务,无需针对每次变动重新构建数据集或执行训练。在客户协议允许的前提下,来自 Skild 商业化部署的经验还可反馈给通用模型,并有助于加速未来的部署工作。

这一成果已在工厂车间付诸实践。Skild、NVIDIA 和富士康正在双臂机械臂上部署 Skild Brain,用于 NVIDIA Blackwell 系统的高精度装配。在演示的一个工作流程中,机器人完成了汇流排和限位块的安装,紧固了 16 颗螺丝,并能适应整个多步骤任务中的各种干扰。这项工作需要精准的运动规划、接触感知控制、时序跟踪能力,以及在现场情况偏离规划时的自我恢复能力。

https://blogs.nvidia.com/wp-content/uploads/2026/09/skildai-video-2.mp4

贯穿开发全周期的 NVIDIA 技术

NVIDIA ac

为什么值得读

仅凭单段视频和上下文学习即可驱动机械臂完成长序列新任务,展示了具身智能免微调落地的关键技术路径。

标签

Skild AINVIDIA具身智能机器人基础模型Physical AIIsaac LabIn-Context Learning

评分依据

  • 新颖性86
  • 影响力85
  • 实践价值82
  • 可信度88
  • 时效性84