过去一年,具身智能最热闹的争论,不是某个模型的效果有多好,而是一个悬而未决的路线问题:机器人到底该走 VLA,还是走 WAM?两种路线看似针锋相对,内核却指向同一个出处,都建立在数字世界的大模型之上。VLA 是视觉语言模型向动作的延伸,WAM 则把视频生成模型搬到机器人身上。 行业争论的 VLA 和 本文链接