Ilya、Jeff、田渊栋押注同一个AI赛道
AI圈现在有个词很火,叫递归自我改进,就是AI自己改自己。
Karpathy今年三月搞了个AutoResearch,AI自己写代码、跑实验、把有用的改动留下,循环几轮,性能自己往上爬。逻辑漂亮,但前提要求很多,比如环境已知,代码沙盒不变,编译器规则不漂移。AI要做的,只是在这个封闭世界里找更优解。
但物理世界,显然不可能是这么回事。
机器狗不会提前收到障碍物说明书,工厂的数字孪生会跟着零件磨损悄悄失真,自主实验室随时可能冒出当前假设解释不了的数据。现实太大、太动态、太充满意外,出错也没有低成本的replay按钮。
有个团队叫MirroS,提出Physical RSI框架,想把AI自我改进的逻辑从数字世界搬进物理现实。
他们觉得,数字世界的RSI是单轴进化,环境固定,AI只需要改进自己的动作策略。物理世界不行,环境一直在变,AI得一边理解世界,一边改进动作,两个一起转,互相喂数据。
你先把世界搞明白,动作才有意义;每次动作的结果,又会暴露你对世界的理解哪里错了。
你在陌生城市开车,导航让你左转,前面路封了。问题在于地图更新没那么及时。不换地图,路线规划得再好也过不去。机器狗被电缆绊住,先想到的不该是瞎试新动作,而是想想,我对电缆、对地面、对这条腿的理解,是不是哪儿错了。
能复现失败原因,说明是技术问题,练就行;复现不了,说明世界模型有盲区,得先补认知。
这里有个关键选择。主流世界模型,什么视频生成、神经场、隐空间表征,都是黑盒,出错了你不知道错在哪。
MirroS选了另一条路,用代码构建世界模型。多模态经验翻译成语言,语言再变成可执行的代码规则。哪条预测错了,定位、修改、重新验证,跟改矢量地图一样,改局部不影响全局。
也不能坐等意外。系统得知道自己哪里不知道,主动设计实验去探盲区。从遇到封路才更新地图的司机,变成主动去没标注路段测绘的勘探者。
押注这条路的人有不少。
田渊栋离开Meta后联合创办了Recursive Superintelligence,Ilya的SSI今年7月拿到英伟达长期战略合作,上周Jeff Dean也官宣离开谷歌创办Discovery Loop,要让AI自动跑科学实验的整套闭环,连ICLR 2026都开了RSI的workshop。但这些人大多还在数字世界使劲。纯语言智能的边际回报在递减正成为共识,物理世界的理解和交互,可能是AI下一个数量级的增长轴。
MirroS做的,就是把已经在数字世界跑起来的自我改进,搬进能感知、能推理、能行动的物理世界里。让机器狗摔了跟头自己爬起来,还越摔越聪明。
数字世界的RSI比拼的是谁的沙盒建得更精巧,物理世界的RSI比拼的却是谁更擅长和意外打交道,谁能把每一次摔倒、每一次数据对不上,转成一次可复用的升级。这条赛道现在还没有公认的领跑者,护城河也远没有数字世界那么清晰。
但如果"下一个数量级"真的藏在物理世界里,那么谁先把这套感知-推理-行动的闭环跑通,谁就可能拿到通往AGI的下一张船票。
