一台机械臂正伸向转盘上的寿司。此刻,它是在稳定接近目标,还是已经错过最佳抓取时机?夹爪与物体接触得恰到好处,还是下一秒就会把寿司撞飞?只看一张静态图片,这些状态几乎一模一样。 但在不少视觉-语言-动作模型强化学习(VLA-RL)方法中,负责评价当前状态好坏的批评家模型(Critic Model),恰 本文链接