硅谷机器人公司Generalist AI发布了新一代基础模型GEN-1.5。
两个月前,斯坦福教授李飞飞刚以个人身份投了Generalist AI的4亿美元融资,同轮天使投资人还有林斌和袁征,英伟达也是股东。
GEN-1.5给出了它们投资的理由:给机器人看一段3到12秒的动作演示,不训练、不微调,当场执行,10个操作任务平均成功率59%。以前教一个机器人拧瓶盖,工程师要编程三个月,现在需要的全部投入是一段三秒钟的演示,和零行代码。多位顶尖研究者将这一刻类比为2020年GPT-3的发布,认为具身智能走到了自己的GPT-3时刻。
GEN-1.5最让研究者震动的能力不是模仿,关键在于即兴发挥。给它一根香蕉,它把香蕉当成刷子横扫积木入碗;给它一个簸箕,它放弃了「扫」的策略,改用推起来再倒进碗——这套动作在约189万段预训练场景里都检索不到,没有人在任何阶段告诉模型应该这样做。碗被纸盖住,模型会自己掀开纸;积木粘在指尖,模型会用另一只手拨下来;一个只训练过放一块积木的模型,开始自发按颜色分拣多块积木。
Generalist AI表示,这些能力都不是刻意设计的结果,而是从大规模物理数据的预训练中自行出现。这就是具身智能的Scaling Law:物理交互数据规模越大、训练时间越长,模型泛化能力越强。一个反直觉的发现是,微调的梯度步骤越少,即兴发挥能力反而越强,10个梯度步骤只改变了模型参数的0.15%,Generalist AI的说法是,这已经接近于「提醒模型一些它几乎已经知道的事情」。
不过这些结果均为Generalist AI自行报告,尚未经过独立验证,任务本身也仍是简单的短程操作,距离真实场景中的长程复杂任务还有很大距离。
Generalist AI联合创始人Pete Florence和Andy Zeng来自谷歌DeepMind机器人团队,Andrew Barry来自波士顿动力。公司2026年6月完成4亿美元融资,Radical Ventures领投,英伟达和Bezos Expeditions参投,投后估值20亿美元,目前正以30亿美元估值洽谈新一轮融资。


