宇树暴涨 629% 那天,GEN 1.5 发布!机器人的 ChatGPT 前夜终于来了?
人们总是高估未来两年的变化,而低估未来十年的变化。
人们总是高估未来两年的变化,而低估未来十年的变化。

👦🏻 作者: DeKox
🥷 编辑: Koji
🧑🎨 排版: NCon
8 月 19 日,上海,宇树登陆科创板,盘中一度暴涨 629%——资本市场正在为机器人的「身体」疯狂下注。
同一天,大洋另一端,马萨诸塞州剑桥 Generalist 的办公室里,一台双臂机器人刚看完一段几秒钟的人类演示:拉开钱包,取出钞票。
轮到它了。右手伸过去——没抓到。
它没有卡死,没有机械地重复同一个动作,也没有等程序员介入,而是做了一件很小、却让在场记者印象深刻的事:换了左手,把钱取了出来。
这是 WIRED 记者 Will Knight 在现场看到的一幕[1]。同一场演示里还有更多「随机应变」:人类示范用刷子把积木扫进碗里,刷子被拿走后,它改用簸箕;面前只剩一根香蕉时,它把香蕉当成了临时刷子。

有一个数字值得关注:这台机器人跑的新模型 GEN-1.5,在陌生任务上的平均成功率只有 59%;而它的上一代 GEN-1,是 99%+。
一个成功率「暴跌」的模型,凭什么值得认真对待?因为真正变化的不是可靠性,而是学习一个新任务的边际成本——它第一次开始逼近零。
而这,正是标题里那个问题的由来:机器人的 ChatGPT 前夜,可能真的近了。
01 机器人终于有了自己的 Prompt
8 月 19 日,Generalist 重磅发布了新一代机器人基础模型 GEN-1.5。
我们用 AI 生成了两张图片,帮助大家更好地理解 GEN-1.5:

GEN-1.5 最重要的一点——人类在它面前做一遍拉开钱包、取出钞票,这几秒钟的动作就化作一卷胶片,被机器人「读」进眼里——它代表的正是那段被放进上下文窗口的传感器—动作序列。
注意胶片的去向:它没有进入任何训练管道去改写模型参数,而是像我们把示例贴进对话框一样,停留在「对话」里。
看懂这一点,就看懂了 Physical Prompting 与传统方式的本质区别:过去是「改它的脑」,现在是「给它看一眼」。

Physical Prompting 有三步。第一步,人类演示一次「用刷子把积木扫到一起」,秒表提醒你成本只有 3–12 秒;第二步,这段演示被编码成传感器—动作序列,像胶片一样插进机器人头部的「上下文窗口」;第三步,机器人现场上手执行。
最值得玩味的细节藏在第三格:它面前的积木换了颜色、换了摆放,和演示场景并不相同——这说明机器人复现的不是一段录像,而是「任务本身」。
看看 Generalist 官方技术文章[2]给出的三组数字:
| 模式 | 新任务数据 | 是否训练 | 平均成功率 |
|---|---|---|---|
| GEN-1「任务精通」 | 约 1 小时 | 需要后训练 | 99%+ |
| GEN-1.5「Physical Prompting」 | 3–12 秒、一次演示 | 不训练 | 59% |
| GEN-1.5「快速适应」 | 5 分钟、约 50 次演示 | 10 个梯度步骤 | 83% |
今年 4 月,GEN-1 讲的还是一个工业式的故事:给一个任务喂大约一小时数据,做后训练,把成功率打磨到 99% 以上——像培养一个动作永远标准的熟练工。
GEN-1.5 做了一笔完全不同的交换:不更新参数、不重新训练,只看一次 3–12 秒的演示,就能开始执行一个从没见过的任务。Generalist 把这种方式叫作 Physical Prompting(物理提示):不是程序员给机器人写动作脚本,也不是为每项工作重新训练,而是人做一次,机器人把这段传感器—动作序列放进约 30 秒的上下文窗口,像大模型读取 few-shot 示例一样现场理解。如果愿意多花 5 分钟、做约 50 次演示,再加 10 个梯度步骤,成功率能爬到 83%。
GEN-1 解决的是「机器人能否把一件事做熟」;GEN-1.5 试图解决的是「机器人能否立刻学会一件新事」。
02 为什么 59% 可能比 99% 更重要
第一眼看到 59% 这个数字,确实很难把它和「突破」联系起来。
但决定机器人产业形态的,从来不是单点成功率,而是「新增一个任务的成本函数」。
-
GEN-1 的 99% 代表「把一个任务打磨成高可靠 SOP」的能力,思路接近自动化工厂:少数任务,极致稳定;
-
GEN-1.5 的 59% 代表「把陌生任务变成可尝试执行」的能力,更像人类学徒:先做个七七八八,再在实践中变熟。
而现实世界的需求从来不是 10 个任务,是 10 万个长尾任务。过去几年机器人落地最大的障碍,不是某个任务做不出来,而是每加一个任务都要重新付费:数据贵、训练贵、部署贵、维护贵——最后「做得出来,但规模化不经济」。当学习成本降到「看一眼就会」,机器人才有机会接住服务业、制造业和家庭里那些没人愿意专门写程序的小事。
这条路径我们其实见过一次:大模型让软件从「为每个任务写规则」,走到「给一个 Prompt、几个例子就现场适配」。
现在,同样的机制正从文本世界跨进物理世界。
03 它不是第一个 one-shot 机器人
机器人的 one-shot imitation 并不是今天才出现:
-
2024 年的 ICRT[3] 已经尝试用传感器—动作轨迹提示机器人完成新任务;
-
今年 6 月的 Behavior Prompting Policy[4] 直接提出「用一次人类演示作为 behavior prompt」;
-
7 月 NVIDIA 等团队的 RoboTTT[5] 把机器人上下文扩展到 8K 个时间步,并展示了人类视频 one-shot imitation 和五分钟长任务。
所以更准确的表述是:GEN-1.5 不是第一个 one-shot 机器人。按 Generalist 的原话,这是他们所知第一个「在大范围灵巧、闭环的物理任务上,普遍展示出 one-shot / few-shot 演示学习能力」的模型;此前的同类工作,要么只覆盖有限的任务变体,要么局限于特定物体、任务类型或传感方式。
外部研究者的评价可以作参照。在 WIRED 的报道中,Georgia Tech 的 Danfei Xu 认为 Generalist 可能是目前「最接近可部署」的通用机器人模型团队之一;Stanford 的 Karen Liu 则指出,这种不绑定单一机器人身体的大规模物理数据路线,开始显出效果。
04 三种押注:语言、反馈与演示
把具身智能当成一个大盘看,头部团队其实在押注三种不同的「提示语言 Prompts」:
-
Physical Intelligence 的 π0.7[6]:用语言、元数据和视觉子目标来提示,把已有技能重新组合去解决陌生任务,强项是语义控制、长任务和跨机器人迁移——用语言提示;
-
Skild AI[7]:机器人根据失败经历在上下文中调整身体控制,重点在跨机器人形态与运动能力——用反馈提示;
-
Generalist 的 GEN-1.5:把「新任务本身的传感器—动作演示」直接作为 prompt——用演示提示。
这三条路线大概率会合流:语言告诉机器人要做什么,演示告诉它怎么做,反馈告诉它哪里做错了。
05 香蕉当刷子:理解、模仿,还是相似模式?

回到那根香蕉。
看到机器人拿香蕉扫积木的瞬间,很多人会忍不住宣布:它理解了「刷子」的功能。
但严格说,这可能是理解,可能是模仿,也可能只是训练数据与上下文提示在高维空间里撞出的「相似模式」——它只是看起来像理解。目前没有公开证据足以区分这三者,Generalist 也没有给出。
更务实的看点在别处:当演示可以放进上下文窗口,我们第一次能用「Prompt Engineering」的思路去研究和改造机器人的行为。未来也许会出现一种新工种——Physical Prompt 设计师:知道怎样演示一次,机器人学得最好;知道它容易学偏什么,怎样用更好的演示把成功率往上拉。
如果这条路走通,机器人产业的分工会随之改变:从「程序员编程」,转向「普通人教学」。
06 同一天,大洋两岸
GEN-1.5 发布当天,宇树在科创板上市,首日一度上涨 629%,收盘上涨约 460%[8]。第二天,王兴兴给「具身智能的 ChatGPT 时刻」下了一个很具体的定义:机器人进入陌生环境,能完成约 80% 的任务[9];他判断乐观需要两三年,保守可能五到十年。

把这两件事放在一起看:
-
中国在快速解决身体:成本、供应链、工程化、出货量,以及资本市场对具身叙事的集中下注;
-
美国的基础模型公司在解决大脑:让机器人在陌生环境里现场学习,让「每换一个任务就重训一遍」的旧模式松动。
用王兴兴的标尺来量,GEN-1.5 的 59% 距离那道 80% 的门槛仍有明显差距。但它可能展示了通往门槛的一条路线:不是把每个任务都训练到 99%,而是把学习成本降到接近零,再让可靠性在迭代中爬升。
当身体足够便宜、足够多,大脑又能以近乎为零的边际成本学会新任务,机器人才会从「少数人的设备」变成「多数人的基础设施」。
07 最后
GEN-1.5 目前是一次研究发布,不是可下载模型或正式产品:没有开源权重,没有完整技术论文,没有第三方统一评测,演示任务也主要是十项简单、短时的桌面操作。
把它读作一个强烈值得关注的能力信号,比宣布「机器人 ChatGPT 时刻已经到来」更准确,也更负责任。
但信号本身足够清晰。过去,机器人每学一件新事都要重新付费;现在,新任务第一次变成了一个 prompt。
大洋一边在把机器人从「贵」变成「多」,另一边在把机器人从「笨」变成「会学」。
终局还远,但路线已经比以前清楚了一些。

参考资料
[1] WIRED 记者 Will Knight 在现场看到的一幕:https://www.wired.com/story/generalist-ai-robots-learn-like-clever-toddlers/
[2] Generalist 官方技术文章:https://generalistai.com/blog/gen-1.5
[3] ICRT:https://arxiv.org/abs/2408.15980
[4] Behavior Prompting Policy:https://arxiv.org/abs/2606.30457
[5] RoboTTT:https://arxiv.org/abs/2607.15275
[6] Physical Intelligence 的 π0.7:https://www.pi.website/blog/pi07
[7] Skild AI:https://www.skild.ai/blogs/omni-bodied
[8] 首日一度上涨 629%,收盘上涨约 460%:https://apnews.com/article/f33facc61122faf0c0b08af5020bd170
[9] 机器人进入陌生环境,能完成约 80% 的任务:https://www.thestandard.com.hk/innovation/article/340485/Robots-poised-for-ChatGPT-moment-Unitree-CEO-says