Veyria
本期目录往期刊物
第 003 期封面:白色长裙人物、机械臂与园艺工作台,手机拍摄换盆示范;AI 虚构创作。
NO.003 · 2026.09.11 UTC

机器人看一遍,
就会做了吗?

一段视频教新动作,
一张工位账单看实际价值。

视频示范 · 动作学习 · 换线成本

责任编辑 / Veyria
封面故事 · 技术拆解 · 实战手记

封面为 AI 创作,人物与场景均为虚构。

LETTER FROM THE EDITOR

看它怎么学,
也看怎么开工。

责任编辑 / Veyria

给机器看一段视频,能省下多少重新教它的时间?本期从机器人换盆说起,拆开现场示范、模型训练和连续运行,再把目光移到工位里的成本。

封面故事解释关键指标;技术拆解介绍动作背后的机制;实战手记提供三轮试用方法。“另一面”保留专用自动化的理由,科技纵深则走到太空,看看 AI 如何寻找甲烷排放。

资料截至 2026-09-11 00:58:00 UTC · 正文约 6,300 字
可按兴趣精读、选读或扫读

COVER STORY

一段示范视频,能省掉多少重新教机器的时间?

机器人学会新动作的门槛正在下降。走进工厂以后,账却要从第一次演示,一直算到每天交班。

假设一家园艺店要把新到的幼苗换进陶盆。人看同事做一次,大致就知道:先放土,给根团留位置,扶正,再补土。换个花盆,动作需要调整,但通常不用重新上一堂课。

机器人面对的变化更琐碎。盆沿宽了一点,苗偏向一侧,铲子换了位置,都可能影响下一步。若每次换货品都要重新采集动作、训练和调试,小批量生意很难摊薄这笔开销。

9 月 10 日,NVIDIA 介绍了与 Skild AI 合作的机器人进展,重点是用视频教机器完成新任务。其报道中的换盆案例,从录制示范开始到机器人自主执行用了 11 分钟。这是团队公布的一次实验过程,计时没有从模型开发或工作台准备开始。[2]

这项进展所依托的 S1 研究早在八月就已公开。Skild 将示范视频放进上下文,让同一组模型权重执行任务,无须针对这个新任务另做后训练。视频在这里承担了说明书的作用。[1]

它瞄准的是“今天换一件事做”的准备过程。机器随后能稳定做多久,还要从连续运行中找答案。

示范里,有一些话说不清的东西

“把幼苗种好”省略了许多细节。种多深?用哪只盆?根部要朝哪个方向?说话的人觉得这些事一看便知,机器却需要从输入里找到依据。

视频能把顺序和目标状态一起展示出来。人先扶住苗,再填旁边的空隙,最后松手;这些先后关系,比把操作压缩成一句命令具体得多。

但示范也会带入偶然细节。操作者中途挪了一下手机,并不意味着每次换盆都要挪手机;土洒出来,可能是失手,也可能需要随手收拾。模型要判断哪些动作构成任务,哪些只是这次演示碰巧发生的事。

人和机器的身体还不一样。手指可以捏住柔软的叶柄,夹爪未必适合;人能绕过工作台,固定机械臂的活动范围却有限。把视频直接当轨迹抄写,往往连起点都对不上。执行系统得根据自己的身体和眼前物体重新安排动作。

那个醒目的百分比,统计的是什么

Skild 的内部对照实验在未见任务上报告了 66% 对 9% 的结果。原文使用的是累计逐步成功率的任务平均值,并允许人在失败后介入恢复,以继续评估后续步骤。[1]

这个指标记录的是动作进展;整项任务有多少回合无需人帮助就能完成,还需单独统计。

两种指标各有用途。逐步评分能让研究者看见模型究竟卡在抓取、放置还是后面的组合动作;整项完成率则更接近值班人员关心的事情:从接到任务到交付,中间要不要走过去帮忙。

假设一项工作有十步,机器每次都完成前九步,最后一步需要人来处理。按动作进度看,它已经做了很多;按无人完成的订单看,仍然没有一单独立交付。两张表同时保留,才能看清技术进步与现场劳动分别发生在哪里。

也别把单步平均值直接连乘来估算整项成功率。不同步骤难度不同,失败之间可能相关,恢复还会改变后续状态。没有逐回合记录,计算会给人一种并不存在的精确感。

换线时间降下来,哪些工作先受益

一种产品全年不变,花时间把专用工装和程序调好,可能很划算。另一条线每几天就换包装、改摆放,最烦的可能是工程师反复到场。两者需要的灵活性不同。

由此看,视频示范的近期价值更可能出现在变化频繁、任务之间又有共同动作的地方。模型已经会抓、放、对齐,新的示范告诉它这一次如何组合。这是对适用场景的判断,尚不能替任何具体工位算出回本时间。

还有一种容易漏掉的变化:重新示范快了,谁都可能提出改动作。若班组之间保留着不同视频,同一型号的产品便可能出现不同处理方式。示范需要有版本、适用工位和生效日期,旧视频也要能退出使用。

给视频标上任务名,写清使用哪套工具、合格成品长什么样,再留一段完整执行记录,就比手机相册里几十个相似片段好找得多。

先看交班时,还留下多少活

采购时,最有信息量的录像往往不那么精彩。它包括等待来料、失败暂停、清理台面和最后一件产品离开工位。连续记录能解释为什么单次动作很快,一小时产量却上不去。

把拍示范、换夹具、调相机、复核成品和恢复故障分开计时,视频学习究竟节省哪一段,才会显出来。若适配时间显著缩短,质量和干预负担又维持住,这项能力即使还做不到完全无人,也有实际价值。

第 001 期的机器人报道把目光从演示移到连续任务。本期再向前一步:机器接到一件新工作时,我们究竟还需要教它多少。

来源与延伸阅读

[2] Skild AI Taps NVIDIA Physical AI to Teach Robots New Tasks From a Single Video · 2026-09-10 · 合作厂商进展报道/新增

[1] Introducing S1: In-Context Learning for Robotics · 2026-08(原文引文月份) · 研究团队技术报告/背景

AI FRONTIER

三条新消息:算力、车队与安全记录

9 月 10 日的新材料,让 AI 落地的几个外围条件变得更具体。

推理芯片开始借用同一套机架

d-Matrix 计划把下一代 Raptor XPU 接入 NVIDIA 的 NVLink Fusion 和 MGX 机架体系。NVIDIA 9 月 10 日的公告还列出了网络、CPU 与数据处理组件的集成计划。[7]

芯片设计之外,一套系统还需要供电、散热、互联和软件。采用现成平台,可以把一部分工程工作交给已有生态;同时也让专用芯片的商业路线与平台提供者更加紧密。这次公布的是集成计划,尚无可据此独立比较的整机成本结果。

对使用者来说,接下来更有用的是支持哪些模型、什么延迟条件下能跑多少请求,以及供货时间。只知道用了哪种互联,还无法替工作负载选机器。

Robotaxi 的计算栈,不只装在车上

NVIDIA 同日梳理了自动驾驶业务的三类计算:训练模型、模拟与验证、车内运行。合作方可能使用其中一部分,也可能组合使用。[8]

因此,一家企业采用了 NVIDIA 技术,未必意味着它的整套自动驾驶系统都来自同一家供应商。读合作公告时,把训练基础设施、仿真工具和车载计算分开,能更准确地理解企业之间的分工。

这些合作说明平台进入了哪些环节;车辆在具体城市能开放什么服务,还要看运营方自己的发布与当地条件。

Anthropic 公布新的滥用案例报告

Anthropic 发布九月威胁情报报告,回顾其团队在过去八个月识别和阻断的恶意活动,覆盖网络攻击、诈骗等类别。[9]

这是上期“为什么留下部分活动记录”的新材料:厂商披露了自己从活动中发现的线索。但被发现、被选入报告的案例,无法代表所有使用行为,也不能据此计算整个行业的滥用比例。

上期提到的 EFS 企业安全方案,与这份案例报告仍是两件事。后者不能替代前者部署后的误报率、审查工作量和效果评估。

来源与延伸阅读

[7] d-Matrix Adopts NVIDIA NVLink Fusion for Rack-Scale XPU Deployment · 2026-09-10 · 合作厂商公告/新增

[8] Physical AI Takes the Wheel · 2026-09-10 · 平台厂商产业报道/新增

[9] Countering misuse of AI: September 2026 · 2026-09-10(新闻索引) · 厂商威胁情报报告/新增追踪

UNDER THE HOOD

看视频、记过程、感受接触:机器人怎样把示范变成动作

技术背景|“现场学会”包含不同机制,有些改变输入,有些更新内部状态,还有些负责应对碰到物体的那一刻。

把一段操作视频交给模型,与把视频拿去训练模型,是两种不同的安排。

在前一种安排里,视频留在这次任务的输入中,帮助已经训练好的系统判断目标和步骤。换一段视频,可以改变这次做什么。后一种安排则用样本调整参数,试图让能力在以后遇到相似任务时仍能发挥作用。

它们也可以组合使用:先用大量经验学会如何读示范,再在现场提供一个新例子。所谓“只看一遍”,描述的是现场增加的示范数量,不能据此推断此前没有训练成本。

上下文里,需要留下任务进度

假设桌上有两个相同的盒子,机器人已经检查完其中一个。此刻的画面里,它们仍然长得一样。只看当前图像,系统可能再次检查刚才那个盒子。

动作历史能补上静态画面缺失的信息:谁已经处理过,哪一步刚失败,手里的东西从哪里来。任务越长,这些记录越容易影响下一步。

七月提交的 RoboTTT 预印本探索了另一种长历史处理方式。它把上下文扩展到 8K 时间步,用会在训练与推理期间更新的 fast weights 保存信息。这些“快权重”构成不断变化的内部状态。[4]

RoboTTT 的快权重会随输入更新,前文 S1 则强调同一组模型权重。两者都利用现场上下文,内部实现并不相同。

可以把这种区别想成两种工作记录:一种把资料摊在桌面上反复查,另一种不断把新情况写进一份压缩笔记。这个类比只说明记忆组织方式;笔记是否完整、能否准确调用,还取决于具体模型。

画面里看不出的阻力

一个盖子看起来已经对齐,实际可能被边缘卡住。视觉能看见位置,却未必能判断再推一点会滑进去,还是把材料压坏。

接触让控制问题变得细致。物体的形状、摩擦、柔软程度都会影响下一次动作。手臂运动得很像演示者,仍可能用错力。

FACTR 2 的八月修订稿给出了一条工程路线:通过数据估计外部关节扭矩,减少对专用力传感器的依赖;训练时又提高接触前后片段的采样比重,让策略更多学习这些关键时刻。[5]

这项研究在其设备和任务范围内,展示了利用已有信号感知接触的方法。其他工位是否仍需力传感器,取决于精度、可靠性和任务代价。

这里还有一项容易被视频长度掩盖的差异。十分钟录像里,机器可能有很长时间在空中移动,决定成败的却是接触物体的半秒。均匀地增加更多视频,并不必然增加同等数量的关键经验。

在模拟器里,把失败做便宜一点

Newton 的官方文档把接触、摩擦、执行器和传感器建模列为物理模拟的一部分。这个开源引擎基于 Warp 与 OpenUSD,并允许扩展求解器。[6]

模拟的吸引力很具体:可以反复改变物体位置、摩擦参数和运动条件,观察策略在哪里失败,不必每次都重新摆一张真实桌子。

假设要测试夹取包装盒。虚拟环境可以先扫过一组重量和表面摩擦条件,找出容易滑落的区域,再把有限的实体测试时间集中在那里。这样用仿真,是为了更有针对性地安排现实验证。

若模拟器把盒子设得过于坚硬、把相机看得过于清楚,模型也可能学到现实里用不上的动作。图像渲染得漂亮,并不能自动消除这些偏差。

把流程连起来看,视频负责表达这次要做什么,历史帮助判断做到哪里,感知和控制处理眼前情况,仿真扩充可练习的环境。每一层都可以进步,也可能成为整项任务最后剩下的短板。

来源与延伸阅读

[4] RoboTTT: Context Scaling for Robot Policies · 2026-07-16 17:59:06 UTC · 预印本/技术背景

[5] FACTR 2: Learning External Force Sensing for Commodity Robot Arms Improves Policy Learning · 初稿2026-06-10;v2为2026-08-12 07:03:08 UTC · 预印本/技术背景

[6] Newton Physics Engine · 持续更新文档;访问2026-09-11 UTC · 官方工程文档/技术背景

FIELD NOTES

请供应商演示同一件事,三次

试用方案|用一个低风险工位,把适配、连续运行和故障恢复分开看。

下面是一份采购前试用方案。假设要比较两套桌面机器人系统,把无危险、无液体的模拟零件按订单装进空盒。它们使用各自适配的硬件,在隔离测试区运行;不要临时把陌生模型接上生产设备。

让两边处理相同任务、遵守相同合格标准。若某项条件对其中一套系统不适用,单独记录,保留差异。

第一次:用原来的条件跑通

请供应商先说明:哪些动作已经训练过,现场还要提供什么,系统是否需要联网,有人会不会远程参与。

随后记录准备过程。工作台定位、夹具更换、相机校准、演示录制、额外训练和等待部署分别用了多久。一个“部署用了半小时”的数字,藏不住这些项目之间的差别。

合格标准在开始前写定。例如,指定零件进入对应格子,数量正确,外观没有损伤,盒外无遗留。只要结果和安全要求得到满足,就允许机器采用不同动作顺序。

保留整段录像和逐回合记录。供应商可以解释表现最好的案例,但评估材料应包括全部尝试,特别是暂停、超时和人工接管的回合。

第二次:只改变一个条件

换一种颜色但形状相同的模拟零件,或把空盒移到约定的新位置。每轮只改变一项条件,才容易知道系统为什么退步。

先让系统在原设置下尝试;随后允许按产品规定补一段示范,再试同类任务。把两轮分开,便能区分“原本就能适应”与“很快就能教会”。两者都有价值,却解决不同问题。

若供应商需要重新训练,也让它做。记录数据量、等待时间和恢复后的质量,一并计入完成业务所需的投入。

原示范、修改后示范、模型版本和配置要能对应到各轮结果。测试结束后一周还能找到当时条件,下一次升级才有可比性。

第三次:安排一次可控中断

与设备方事先约定安全中断方法,由熟悉设备的人执行。可以模拟订单取消、来料缺失或任务尚未开始时的暂停,不要在运动中的机械臂旁徒手制造障碍。

观察系统会保留哪些状态。恢复后,它会从头装第二份,还是知道第一份已经做到哪里?需要人重新摆齐全部物品,还是只处理失败的那个步骤?停止指令生效后,界面是否仍显示正在运行?

用一次受控中断,很容易看出现场劳动藏在哪里。有的系统动作速度一般,恢复却顺手;有的单次表现漂亮,出了错必须找工程师重新配置。

把结果放进一页记录

记录项保留的内容
准备校准、示范、训练、等待各自的时间
完整回合总次数、无人合格次数、人工接管次数与超时次数
干预谁介入、做了什么、花多久;远程帮助也计入
成品数量、位置、损伤与返工情况
变化后改变的条件、补充示范、恢复质量所需时间
中断后遗留物品、重复动作、恢复位置与耗时

最后把采购问题收回到这个工位:当前最贵的是工程师调试时间、班组干预时间,还是报废和停线?能改善最贵那一项的系统,未必拥有最好看的单次演示。

小规模试用适合发现明显故障和估计下一轮试验成本。涉及人机协作、生产安全和正式投产,仍须由负责设备安全与工艺的人员完成相应评估。

来源与延伸阅读
TECH HORIZON

从太空找甲烷:AI 的另一种“看懂现实”

技术背景|模型找到更多排放线索以后,还需要现场的人把线索变成行动。

机器人的问题,是从画面里理解该怎样动手。环境监测面对另一种困难:地面上正在发生的事,可能根本看不见。

Google 在九月九日介绍了与 NASA 喷气推进实验室合作的 MAPL-EMIT,用 AI 处理 EMIT 仪器的观测,寻找甲烷羽流。更完整的研究说明发表于九月一日;这里回看其技术方法,并非当天新发现。[10][11]

羽流是排放出来的气体在空气中扩散形成的区域。它在普通照片里可能毫不起眼,而不同光谱波段的变化可以留下线索。模型要从复杂地表背景里把这些线索分离出来。

现实样本不够,先借物理规律造训练材料

研究团队介绍,他们将 360 万个模拟甲烷羽流注入真实 EMIT 场景,用于训练。模型结合光谱与周围空间信息,估计羽流范围和源头,而不只逐个像素寻找相似信号。[11]

这与机器人仿真有一个相通之处:现实数据难收集,物理模型可以提供带有已知条件的练习题。合成数据里的源头位置由生成过程掌握,训练时便有明确参照。

但地表上也可能出现像气体信号的干扰。若把所有候选都交给调查人员,模型找得越勤,人工负担可能越大。团队因此提供了置信度信息,承认误报仍需处理。[11]

找到一处线索,还没有修好一处泄漏

假设一次观测指向某个工业设施附近。后续还要核对时间、天气、设施边界和其他观测,判断是否值得安排现场检查。风把气体带向哪里,与排放设备实际在哪里,也需要区分。

一张地图可以帮助调查排序,却不能单独说明设备是否已经维修,更不能直接计算整改带来的减排量。要回答后面的问题,需要处理记录和后续观测接上来。

这也决定了产品界面应该保留什么。只给一个醒目的红点,阅读很快,却丢掉了检查所需的上下文。显示观测日期、来源、置信程度和可回看的区域,才方便下一位使用者继续核实。

开放材料,让别人能接着查

团队提供了公开数据、模型与推理工具的入口,Earth Engine 也有对应数据目录。[10][12] 对研究者而言,可继续检查的材料比一张全球热点图更有用。

它们让不同使用者按自己的问题筛选线索:有人优先找持续出现的候选,有人关心某片区域的变化,还有人研究模型在哪些地表容易误判。不同任务可以接受不同误报负担,不必强行共用一个阈值。

评价这类 AI 的价值,也就多了一种尺度:它有没有让有限的核查人力更快找到值得处理的问题,以及处理之后是否留下了可追踪的结果。

来源与延伸阅读

[10] A new deep learning model maps global methane emissions from space · 2026-09-09 · 官方摘要/上期未刊背景

[11] Mapping global methane emissions from space with deep learning · 2026-09-01 · 研究团队说明/背景

[12] MAPL-EMIT: Modeled Methane Plumes · 持续更新数据目录;访问2026-09-11 UTC · 官方数据目录/背景

SECOND OPINION

有些工位,继续用专用自动化更划算

另一面|快速适应新任务令人兴奋,但每天只做同一件事的机器,未必需要同样的灵活性。

假设一条生产线每天装同一种零件,未来半年都不换型。另一张工作台每天接十几种小订单。两边都叫自动化,最费钱的环节却可能完全不同。

第一条线可以花时间把供料、工装和动作调得很确定,再从大量重复操作中收回投入。第二张工作台更在意新订单来了多久能开工。对它来说,重新教机器的时间也许比单个动作慢几秒更难接受。

通用模型把后一类问题带进了讨论,但它没有取消前一类问题。

后训练得到的质量,也有价值

Generalist 八月十九日的 GEN-1.5 报告,在十项短时任务上给出单示范上下文学习平均成功率 59%;使用每任务五分钟数据进行十步梯度更新后,报告的平均成功率为 83%。两者条件不同,原文分别给出标准差。[3]

这个对照提示了一种朴素选择:如果一个任务值得多花一点准备时间,额外训练可能换来更好的表现。它与 Skild 的任务、指标和实验设置不同,不能把两个百分比摆在一起当作厂商排行榜。

少样本适应和充分准备后的质量,是两个可以同时研究的目标。选哪一边,取决于任务会重复多少次、变化有多频繁,以及错误要付出什么代价。

用一组假设数字,把换线价值摊开

假设方案甲每次换任务需要四小时准备,方案乙需要半小时;两者每个任务之后都能达到相同合格率和产出,其他条件暂时视作相同。

一周只换一次,乙节省三点五小时;一周换十次,便是三十五小时。这里的数字只是演算示例,却能说明为什么同一项适应能力,在两家工厂会得到不同报价。

接着解除“其他条件相同”的假设。如果乙运行时需要更多人工干预,或者每次停顿造成上下游等待,就要把这部分加回来。反过来,若乙让普通操作员就能完成换型,省下的还可能包括等待专业工程师到场的时间。

预算里还要留下准备物料、检查成品、处理异常和维护系统的人。把减少的工时与转移到其他岗位的工时分开,节省了多少才会清楚。

通用能力可以先放在少数环节

一套流程并不需要每一步都由同一个大模型决定。物料识别、异常分类或任务说明可以更灵活,已经稳定的送料和固定装配动作则可以保留。

混合安排会增加接口和维护工作,但也允许团队先在变化最多的地方验证收益。若一项工序本来就可靠,没有必要为了统一技术标签,把它重新变成试验。

评估视频学习时,最值得保留的对照组可能就在现场:原有专用设备、已有程序,或者经过改进的人工流程。新模型能在这些具体对照中减少准备和返工,它的进步才有了清楚的位置。

来源与延伸阅读

[3] GEN-1.5: Embodied Foundation Models are One-Shot Learners · 2026-08-19 · 研究团队技术报告/背景

SIGNALS

三个可以继续往下看的入口

快讯与追踪|工具开放到哪一步,决定了谁能继续复查。

新的接触模拟组件,仍在路上

NVIDIA 九月十日称,正与 Skild 合作开发 GPU 加速的接触模拟求解器,后续将作为 Newton 的一部分提供给开发者。[2] 当前入口是 Newton 文档与已有代码,新组件仍待开放。

S1 的论文介绍之外

S1 项目页提供了研究说明和早期访问登记。[1] 下一步可留意权重、评测任务与完整运行记录的开放情况;这些材料会影响外部团队能把实验复查到哪一步。

甲烷数据可以从目录开始查

MAPL-EMIT 的Earth Engine 数据目录提供了具体入口。阅读本期科技纵深后,可以接着查看数据说明;地图中的候选线索仍需结合观测条件解读。

来源与延伸阅读

[2] Skild AI Taps NVIDIA Physical AI to Teach Robots New Tasks From a Single Video · 2026-09-10 · 合作厂商进展报道/新增

[1] Introducing S1: In-Context Learning for Robotics · 2026-08(原文引文月份) · 研究团队技术报告/背景