机器人领域长期存在一道成本墙:让机械臂学会拧一个瓶盖,工程师需要编程数月并注入专门的领域知识。Generalist AI 在 8 月 19 日发布的机器人基础模型 GEN-1.5 给出了另一种路径:给机器人看一段 3 到 12 秒的动作演示,模型立刻尝试执行,全程零梯度更新、零微调。
官方公布的评测数字:在 10 个不同操作任务(拉拉链、开玻璃罐盖、从钱包取钱、叠纸、翻手机等)上,单样本上下文学习(one-shot)平均成功率 59%(标准差 ±10%);补上 5 分钟数据、约 50 次演示、10 个梯度步骤的少样本适配(few-shot)后,平均成功率升至 83%(标准差 ±9%)。Generalist 团队将其类比为 2020 年 GPT-3 之于语言模型的位置:GPT-3 当年在语言任务上 one-shot 约 45%、few-shot 约 65%,两组数字的结构高度相似。

Physical Prompting:把演示装进上下文窗口
GEN-1.5 是一个大型多模态模型,输入端处理视频(30 秒记忆窗口)、传感器、语言与本体感知数据,输出端以 100 Hz 频率生成动作轨迹。所谓 Physical Prompting(物理提示),就是把一段感觉运动示例(传感器数据加动作轨迹)直接放进模型的上下文窗口,剩余空间留给滚动的实时观测。演示可以由人类持一对手持夹具录制,也可以由机器人自己 rollout 产生。
提示一旦进入上下文,模型立即开始执行任务。这一机制与语言模型的 in-context learning 同构:无需改写参数,示例本身就是指令。
物理提示还能组合。把两个独立录制的任务演示(如拉开笔袋拉链、从钱包取钱)同时放进上下文,模型会将其串成一段连续行为,自动生成两段演示中都未曾出现的过渡动作:重新抓取、调整位置、错误恢复,甚至中途换手。
单样本学习如何涌现
Generalist 强调,这些能力没有经过任何专门设计:没有为促进上下文学习而修改架构,没有内外循环的元学习机制,没有鼓励即兴发挥的辅助训练目标。官方博客的原话是,这些能力「直接从大规模物理交互数据的预训练中涌现」。
关于涌现的原因,官方给出两个假设:物理世界的观测与动作分布可能具有类似语言数据的「突发性」与 Zipf 结构,这类性质已被证明与 Transformer 的上下文学习相关;物理劳动本身包含大量重复循环,模型可能学会了检测并延展这类模式。模型的预训练数据由数据引擎从家庭、仓库、工厂等真实场景中随机采样,训练时上下文内没有打包示例的专门设施,物理提示带来的时间不连续跳变在训练中从未出现过。
预训练持续了超过 8 个月。Generalist 的表述是,每一条追踪指标都在持续改善:新任务变得更省数据、更省算力、更具泛化性,曲线尚未见到渐近的迹象。他们从需要数百个梯度步骤,逐步压缩到数十个,最终观察到 1 个梯度步骤、1 分钟数据即可学会新任务。
即兴行为:簸箕实验与 189 万场景检索
最能说明问题的是工具即兴实验。先用刷子把积木扫进碗的演示加 5 分钟数据微调模型,然后更换工具:给它一根香蕉,模型把香蕉当作刷子横扫积木;给它一个簸箕,模型放弃了「扫」的策略,转而用簸箕铲起积木、抬起、倒进碗里。簸箕方案是一套全新的接触序列。Generalist 用最近邻语言检索在 1,891,392 个预训练场景中查找,没有找到类似的簸箕用法,微调数据与预训练数据均不包含这种操作。
类似的即兴行为在测试中反复出现:碗被纸盖住,模型自己掀纸完成任务,偶尔还会把纸盖回去;乐高积木粘在指尖,另一只手上前拨除;训练数据只用单手旋转罐盖,模型某些尝试中自发切换为双手策略;只被训练放一块积木进一个碗的模型,开始按颜色分拣多块积木。一个反直觉的规律是:微调的梯度步骤越少,即兴发挥能力越强。官方解释为轻度适配让模型更贴近预训练先验,可调用的行为库更宽。
少梯度适配:10 步训练改变 0.15% 参数
传统机器人模型适配新任务通常需要数万个梯度步骤。GEN-1.5 的少样本适配只需 1 到 10 步:10 步训练对模型权重的改变不足 0.15%,官方将其描述为「提醒模型一些它几乎已经知道的事情」,更接近极低数据量下的测试时训练(test-time training)。极端单步骤场景下,仅用 1 分钟数据采样训练,保留任务成功率 66.5%,且未经任何适配专用超参调优。
Sim-to-Real 与跨形态迁移
GEN-1.5 的上下文学习还能跨越仿真与现实的边界:在模拟器里录制的演示(来自脚本策略、RL 智能体或遥操作)可以直接作为物理提示驱动真实机器人,而预训练数据中不包含任何仿真数据,渲染视频与仿真动力学都没有。被提示出的行为能泛化到不同的机械手、新的物体位置与尺寸。
部分任务中,迁移甚至跨过形态鸿沟:人类直接用自己的双手在机器人摄像头前演示,机器人随后用机械手复现任务。
能力边界
官方博客同时明确了模型当前的边界:任务是简单且短周期的,成功率属于中等水平;上下文学到的技能比微调模型更脆弱;所有结果均由 Generalist 自行报告,尚未经独立验证。距离工厂与家庭中的长程复杂任务仍有相当距离。从 GPT-3 到 ChatGPT 用了两年半,GEN-1.5 现在处于曲线的哪个位置,取决于物理交互数据的规模竞争如何展开。
资本与行业坐标
Generalist AI 创立于 2024 年。据 Bloomberg 报道,公司今年 6 月完成 4 亿美元融资,估值 20 亿美元,Radical Ventures 领投,英伟达、Bezos Expeditions 参投,天使投资人包括李飞飞、Zoom 创始人袁征、小米联合创始人林斌与 Naval Ravikant,累计融资超过 5.5 亿美元。Business Insider 7 月底报道,公司正在洽谈以 30 亿美元估值进行新一轮融资。
发布时间落在具身智能行业密集的一周:8 月 19 日宇树科技在科创板上市,开盘报 1100 元/股,市值约 4449 亿元;同日 WRC 世界机器人大会在北京亦庄开幕,300 余家企业、超过 2000 件展品参展。宇树 2025 年人形机器人出货量超过 5500 台居全球第一,但其招股书披露 2026 年一季度扣非净利润同比下降 52.55%,硬件领先与「大脑缺席」的落差正是 GEN-1.5 这类基础模型的入场理由。下一轮竞争的核心资源,将是足够多的物理交互数据。