上交大PAWBench世界模型不能只生成一种未来
视频生成模型越来越像世界模型,但一次生成看起来合理,只能说明它会演出一种未来。真实物理过程常有多个可能结果,同样的初始状态和动作,硬币可能落在不同面,物体碰撞也可能出现不同结局。世界模型还得把这些结果出现的比例学对。
上海交通大学、上海人工智能实验室、Krea AI、Hugging Face、上海创新研究院、通义实验室与香港大学提出 PAWBench,专门测这种概率对齐能力。
基准包含 50 个场景、8 类物理机制,每个场景固定初始图像和动作,再让模型重复生成 50 次。PAW-Calibration 检查硬币、转盘、路径选择等场景的结果比例是否符合参考分布;PAW-Coverage 则检查碰撞、稳定性、智能体互动和材料变化中,可行结果有没有被覆盖。
11 个视频模型的结果暴露出明显问题。Cosmos 3 Super I2V 的 Calibration TVD 为 20.5,但场景通过率只有 80%;LTX-2.3 的 Coverage 达到 71.7%,场景通过率只有 72%。没有一个模型同时兼顾概率分布、结果覆盖和场景稳定性。
增加采样次数能找到更多结果,却很难修正比例偏差。11 个模型的平均 TVD 为 31.2,而按参考分布模拟采样时,99% 情况低于 9.22,说明差距并非简单来自采样不足。
换 Prompt 可以指定某种未来,但视频模型真正实现指定结果的比例只有 37.6%~58.1%。用耦合噪声能扩大结果覆盖;修改训练数据比例也能改变输出分布,可这种变化往往同时影响多个场景,仍不能根据具体物理状态自动调整。
边界也很清楚:当前主要看终局结果,没有完整评价中间物理轨迹;每个场景依赖有限次数生成,测试环境也以受控物理场景为主。
这项工作的意义,是把世界模型评测从这段视频像不像现实,推进到同样条件重复运行很多次后,可能发生什么,以及这些未来出现的比例是否合理。能生成多个未来,只是起点;学会世界里的随机规律,才更接近可用于规划的世界模型。
PAWBench 上海交通大学 上海人工智能实验室 世界模型 视频生成 AI论文




