从检索动作知识、寻找角色参考,到模拟运动和衔接镜头,一个经过强化学习的智能体,能给视频生成带来多大提升? 让视频模型生成一个人打太极,画面可能很流畅。但如果把要求具体到某个招式,手该怎么抬、重心该怎么移,模型还能做对吗? 再加一点难度:指定一个角色,让它完成这套动作;或者要求两个物体按给定条件碰撞, 本文链接