一次演示即可学会:证据的现状
8月24日,一家美国公司发布了一套系统:给机器人看一段 3到12秒的视频, 它就能学会一项从未做过的工作。零重新训练,零代码:机器人观察演示, 然后照做。这类公告六个月后就会变成报价单,摆上工厂主管的办公桌; 因此我们花了两天时间,核查它背后到底有什么。写出来的东西与其说 是一篇机器人学笔记,不如说是一份用来阅读此类新闻稿的核查清单。
公告与现有资料
这套系统叫 GEN-1.5,来自 Generalist AI——一家 2024年创办的公司,创始人是两位前 Google DeepMind 员工和一位前 Boston Dynamics 员工;已融资约4亿美元,投资方包括 NVIDIA 和 Bezos Expeditions。这是十个月内发布的第三个模型:GEN-0 (2025年11月:超过100亿参数,27万小时的真实操作数据,由操作员 手持带摄像头的夹爪采集),GEN-1(2026年4月:所展示任务的 平均成功率从64%升至99%,数据超过50万小时),现在是 GEN-1.5。
公司对 GEN-1.5 的宣称是:在十个全新任务上,仅凭一次演示、模型 不做任何改动,平均成功率达 59%;用五分钟数据做十步训练后 达到 83%。其背后的理念值得关注:打造通用机器人,关键在 于数据量,而不是设计。
短板在于文档。没有科学论文,没有同行评审,没有可下载的权重, 没有公开基准,也没有任何与其他系统的对比。有的是公司博客上的三篇 文章、几段视频,以及在此前不久完成的几亿美元融资。
不过也得承认,这篇博客文章比转载它的媒体诚实:公司自己承认任务 简单且短、成功率有限、即时学会的技能很脆弱、超参数从未优化。每条 限制一句话,白纸黑字出自他们自己——却在第二天几乎所有的报道中 消失了。
0.15%的论据:超参数的产物
他们用来支撑论点的论据,原文照引如下:十步训练使模型权重的移动 幅度不到0.15%,因此模型"只是轻微地重新配置已有的知识, 而不是构建新的表征"。乍一看很有冲击力:变化微乎其微,成功率 却提高了24个百分点。
重新算一遍就会发现,这个数字什么也证明不了。AdamW——几乎所有 这类模型都用它训练的优化器——会对每次更新做归一化:单个 参数每一步走多少,由学习率决定,而不是误差的大小。对一个100亿 参数的模型,用任何处于正常范围的学习率(百万分之二到二十之间) 走十步,权重的总移动幅度都在0.15%左右,与模型知道什么 无关。走一百步,你会读到1.6%;走一千步,16%。
本质上,"十步让权重移动不到0.15%"这句话——上下差个两倍—— 等价于"我们跑了十步"。佐证来自该公司自己,就在下面两行:"学习率 更高时性能更好"。调高学习率会机械地抬高这个数字;如果这个数字 小能证明什么,那一次好的优化反而会摧毁这个证据。
尽管如此,这个结论很可能是对的。真正支撑它的是另一个 数据,而 Generalist 手里就有,只是把它当成产品功能展示了出来: 冻结权重下取得的59%。如果一个模型在没有收到任何一次更新的 情况下完成了从未见过的任务,那所需的知识必然早已在它内部—— 事后根本没有任何地方能让它进来。为了论证观点,他们挑了手里最弱的 数字,大概是因为"0.15%"听起来更有冲击力。
泛化还是检索:决定性的问题
隐藏在下面的,是一个单独就足以成就或推翻该公司评估的问题:模型 是在泛化,还是在检索?换句话说:演示向它传递了 新东西,还是仅仅充当一个选择器,从它在50万小时训练中已经见过的 技能里挑一个出来?
还要指出,这个机制已有先例。第一个让机器人模仿留在上下文中的 演示、而不动权重的工作,可以追溯到2024年8月:它叫 ICRT,在 Franka 机械臂 上运行,并且公开了论文、代码、权重和数据,任何人都可获取。因此 Generalist 宣称的新意不在机制,而在规模:有了50万小时的积累, 这件事普遍有效,而不只是在精选的案例中有效。而这恰恰是从外部 无法核查的部分。
两种答案描绘出相反的经济图景。如果检索占上风,规模曲线就变成 一条覆盖定律:每多一小时数据,就多买下一块案例空间,回报 是线性的,而且这座仓库永远不会耗尽。如果泛化占上风,那就是一条 泛化定律:每一小时都会增强模型的能力,甚至包括无人采集过 数据的任务。两种世界里展示的是同一条曲线;改变的是它的含义, 其余一切都由此推导而来。
文章给出了三个认真支持泛化的线索;奇怪的是,最有说服力的那个 没有被用上。在模拟器里录制的演示能用在实体机器人上,尽管 训练数据里没有任何模拟的痕迹。靠纯视觉相似性运作的系统在这里会 失败,因为渲染出来的画面与任何已观察过的东西都不像:要做到这一点, 必须抛开外观、提取出运动本身。
但同样重要的是三件缺失的东西。没有展示两次或五次演示而非一次 的效果曲线——对于声称具备这种能力的人来说,这是最容易做的图, 除非结果是平的。没有用错误的演示做的测试:这是决定性的 检验,一天就能做完。而针对记忆化嫌疑的核查,是在1,891,392个场景 上做的一次文本检索:找到的是相同的标签,而不是相同的 动作。
一个独立的测试基准:VLA-Arena
评判一则公告需要一个由别人测量的参照。正好有一个:它叫 VLA-Arena, 来自北京大学的一个团队,已被 ICML 2026 接收,并且公开了一切—— 基准、数据、代码和排行榜。
它的原则是:把难度变成一个受控变量。训练只在基础难度上进行; 评估在两个从未见过的难度上进行,交叉施加文本和图像的扰动。把它 应用到六个被视为最先进水平的模型上,结论是"记忆而非泛化"。 其中有一个数字值得写在这里:
在原子技能上,六个模型的成功率在66%到93%之间。一旦被要求 连续执行两项,全部跌到零或略高一点,三次重复的方差为零: 这不是统计噪声,而是一堵墙。换到实体机器人上,平均值从基础难度的 60%跌到第二难度的3.3%。而把多次演示串联起来,恰好是 GEN-1.5 在 视频里展示的能力之一。
还有第二个结果,影响更具结构性。这类模型的做法是把一个大型 视觉-语言模型嫁接到机器人上;VLA-Arena 测量的是微调之后这种能力 还剩多少。在最严的视觉扰动下,原始模型的物体识别能力下降6.7%; 由它衍生出的机器人模型则下降50.5%。换句话说,行业当前的 配方是从一个会泛化的模型出发,然后训练到它忘记为止。在这一点上 必须给 Generalist 记一功:用十步做适配而不是重新训练,也正是 远离这种灾难的办法。
最后是安全性,基准把它作为独立的一轴来衡量,与成功率分开: 一个回合也可能在成功的同时违反约束——碰撞、推挤、打翻 东西。在实体机器人上,仅第一难度,十个回合中就有六个被判定为 不安全。对于正在评估是否在车间采用这类系统的人,这一项不在 成功率里:它在责任里。
公允地说:VLA-Arena 考察的模型是开源的、中等规模、每个任务用 五十条演示微调的。它们与在50万小时上成长起来的模型不属于同一 类别,也不能证伪 GEN-1.5。它们的作用是另一个:标明这个主张有 多么非同寻常,以及因此在采信之前需要多少证据。
现有证据的性质
我们试图回答那个最显而易见的问题。答案是:没有任何独立 观察者。这个模型的全部存在是一篇博客文章、几段视频和一条 X 上的消息。能找到的每一篇新闻报道,包括行业媒体,都源自那篇 文章:"公司宣布"、"据公司称",附一个博客链接。没有记者现场看过 演示;没有人能提出自己选的任务。
但让我们学到最多的是另一个细节。四月份,在 GEN-1 的 文章里,公司写明:"这些视频是1倍速、完全自主的,没有加速"; 逐一标注加速过的片段,并公布无干预的连续重复次数——连续 86次、200次、1800次。这正是正确的写法,因为它排除了只挑成功的 那次尝试——机器人视频里常见的做法。
在 GEN-1.5 的文章里,这些全都不见了:关于播放速度、 自主性、每段视频试了多少次,只字未提。透明度恰恰在主张变得 非同寻常的这次发布中倒退了。单凭这一点证明不了什么;但它是我们 第一件要去核查的事。
也要如实报告两条相反方向的情况。人是真实存在的,履历可查; NVIDIA 和 Bezos Expeditions 在投钱之前做过尽职调查:这不是一个 空壳。而且8月25日,二十四小时后,Skild AI 提出了形式完全 相同的主张——以人类视频为提示、不做重新训练——任务长达十分钟, 同样留下证据真空。因此,这一主张并不只属于一家公司。
结论:一份评估核查清单
从这项工作中提炼出的核查清单适用于任何人工智能公告,不只针对 机器人。六个问题,按成本从低到高排列。
1. 是有证据,还是只有一篇文章? 论文、权重、代码、公开 基准。如果四样全缺,你手里拿的就是一份新闻稿,无论语言看起来 多么技术化。
2. 给你的那个数字取决于做展示的人吗? 0.15%取决于走了 多少步。一个转动旋钮就升就降的数字,描述的不是系统:描述的是 旋钮。
3. 相对于什么测量的? "与什么都没有对比"不算数。缺少 参照,这个数字就没有计量单位。
4. 输入错误时它表现如何? 如果给一条错误的指令,系统的 表现几乎不变,说明它根本没在读指令。在一个标准基准上,使指令 失效只让性能下降28%:那些模型完成任务靠的是观察场景,对被要求 做什么毫不在意。
5. 展示的任务是短还是长? 惊艳的结果几乎总是只持续几秒 钟,且只包含一个失败点。概率会连乘:每一步90%,五步就是59%。 永远要求看长版本。
6. 还有谁见过? 有多少家媒体报道不算数:那衡量的是公关 办公室。算数的是谁能提出自己选的任务。
提出这些问题,不需要是机器人学专家。需要知道的是往哪里看, 并愿意接受这样的答案:很可能是真的,但迄今无人证明。而这恰好 就是我们对 GEN-1.5 的判断。
注释与参考
GEN 系列模型的数据来自 Generalist AI 的三篇公司博客——GEN-0 (2025年11月)、GEN-1(2026年4月)、GEN-1.5(2026年8月)—— 因为这些模型没有科学论文。关于 Skild AI:S1 的公告(2026年8月25日)。
调查中引用的学术工作:
- B. Zhang et al., VLA-Arena: An Open-Source Framework for Benchmarking Vision-Language-Action Models, ICML 2026 — arXiv:2512.22539。 第四节讨论的独立测试基准。
- L. Fu et al., In-Context Imitation Learning via Next-Token Prediction, 2024 — arXiv:2408.15980。 不更新权重的上下文内模仿学习的先例。
- I. Loshchilov, F. Hutter, Decoupled Weight Decay Regularization, ICLR 2019 — arXiv:1711.05101。 AdamW 的论文,第二节计算的基础。
- S. Min et al., Rethinking the Role of Demonstrations: What Makes In-Context Learning Work?, EMNLP 2022 — arXiv:2202.12837。 错误输入测试(清单第四问)的方法论先例。