一个苹果从树上落下,今天的视频模型大多能生成一段「看起来正确」的运动:苹果向下、速度加快,最终落地。 但模型是真的理解了重力定律,还是只是在复现训练数据中的视觉统计规律? 这一区别,决定了视频模型究竟是擅长制造逼真画面的生成器,还是能够预测世界演化的「世界模型」。现有物理视频基准多聚焦最终结果是否合 本文链接