一段示范视频,能省掉多少重新教机器的时间?
机器人学会新动作的门槛正在下降。走进工厂以后,账却要从第一次演示,一直算到每天交班。
假设一家园艺店要把新到的幼苗换进陶盆。人看同事做一次,大致就知道:先放土,给根团留位置,扶正,再补土。换个花盆,动作需要调整,但通常不用重新上一堂课。
机器人面对的变化更琐碎。盆沿宽了一点,苗偏向一侧,铲子换了位置,都可能影响下一步。若每次换货品都要重新采集动作、训练和调试,小批量生意很难摊薄这笔开销。
9 月 10 日,NVIDIA 介绍了与 Skild AI 合作的机器人进展,重点是用视频教机器完成新任务。其报道中的换盆案例,从录制示范开始到机器人自主执行用了 11 分钟。这是团队公布的一次实验过程,计时没有从模型开发或工作台准备开始。[2]
这项进展所依托的 S1 研究早在八月就已公开。Skild 将示范视频放进上下文,让同一组模型权重执行任务,无须针对这个新任务另做后训练。视频在这里承担了说明书的作用。[1]
它瞄准的是“今天换一件事做”的准备过程。机器随后能稳定做多久,还要从连续运行中找答案。
示范里,有一些话说不清的东西
“把幼苗种好”省略了许多细节。种多深?用哪只盆?根部要朝哪个方向?说话的人觉得这些事一看便知,机器却需要从输入里找到依据。
视频能把顺序和目标状态一起展示出来。人先扶住苗,再填旁边的空隙,最后松手;这些先后关系,比把操作压缩成一句命令具体得多。
但示范也会带入偶然细节。操作者中途挪了一下手机,并不意味着每次换盆都要挪手机;土洒出来,可能是失手,也可能需要随手收拾。模型要判断哪些动作构成任务,哪些只是这次演示碰巧发生的事。
人和机器的身体还不一样。手指可以捏住柔软的叶柄,夹爪未必适合;人能绕过工作台,固定机械臂的活动范围却有限。把视频直接当轨迹抄写,往往连起点都对不上。执行系统得根据自己的身体和眼前物体重新安排动作。
那个醒目的百分比,统计的是什么
Skild 的内部对照实验在未见任务上报告了 66% 对 9% 的结果。原文使用的是累计逐步成功率的任务平均值,并允许人在失败后介入恢复,以继续评估后续步骤。[1]
这个指标记录的是动作进展;整项任务有多少回合无需人帮助就能完成,还需单独统计。
两种指标各有用途。逐步评分能让研究者看见模型究竟卡在抓取、放置还是后面的组合动作;整项完成率则更接近值班人员关心的事情:从接到任务到交付,中间要不要走过去帮忙。
假设一项工作有十步,机器每次都完成前九步,最后一步需要人来处理。按动作进度看,它已经做了很多;按无人完成的订单看,仍然没有一单独立交付。两张表同时保留,才能看清技术进步与现场劳动分别发生在哪里。
也别把单步平均值直接连乘来估算整项成功率。不同步骤难度不同,失败之间可能相关,恢复还会改变后续状态。没有逐回合记录,计算会给人一种并不存在的精确感。
换线时间降下来,哪些工作先受益
一种产品全年不变,花时间把专用工装和程序调好,可能很划算。另一条线每几天就换包装、改摆放,最烦的可能是工程师反复到场。两者需要的灵活性不同。
由此看,视频示范的近期价值更可能出现在变化频繁、任务之间又有共同动作的地方。模型已经会抓、放、对齐,新的示范告诉它这一次如何组合。这是对适用场景的判断,尚不能替任何具体工位算出回本时间。
还有一种容易漏掉的变化:重新示范快了,谁都可能提出改动作。若班组之间保留着不同视频,同一型号的产品便可能出现不同处理方式。示范需要有版本、适用工位和生效日期,旧视频也要能退出使用。
给视频标上任务名,写清使用哪套工具、合格成品长什么样,再留一段完整执行记录,就比手机相册里几十个相似片段好找得多。
先看交班时,还留下多少活
采购时,最有信息量的录像往往不那么精彩。它包括等待来料、失败暂停、清理台面和最后一件产品离开工位。连续记录能解释为什么单次动作很快,一小时产量却上不去。
把拍示范、换夹具、调相机、复核成品和恢复故障分开计时,视频学习究竟节省哪一段,才会显出来。若适配时间显著缩短,质量和干预负担又维持住,这项能力即使还做不到完全无人,也有实际价值。
第 001 期的机器人报道把目光从演示移到连续任务。本期再向前一步:机器接到一件新工作时,我们究竟还需要教它多少。
[2] Skild AI Taps NVIDIA Physical AI to Teach Robots New Tasks From a Single Video · 2026-09-10 · 合作厂商进展报道/新增
[1] Introducing S1: In-Context Learning for Robotics · 2026-08(原文引文月份) · 研究团队技术报告/背景
