YC科技资讯网

李飞飞团队新作:让视频模型反推机器人动作

机器人世界模型通常吃的是关节角、末端位姿等动作向量:控制很精确,却绑定具体机械臂。视频模型反而见过大量“物体如何被推动、抓取和改变”的视觉规律,却不知道怎样接收机器人的动作。

斯坦福、哈佛和马里兰大学团队提出 Masked Visual Actions:把动作改写成视频里的“局部可见轨迹”。

给模型看机器人手臂在时空中的像素级运动,它就补全场景将如何响应,充当前向世界模型;反过来,给它看物体希望如何移动,同一个模型会补全可能实现该结果的机器人运动,充当逆向模型。

核心在于不再把动作当成一串抽象数字,而是当作与视频天然对齐的遮罩(mask)。
作者以 Wan-Fun-Control 2.2 14B 为底座,用真实 DROID 视频和 RoboCasa 仿真数据构造训练样本,仅用约 15 小时机器人交互数据做 LoRA 微调。渲染出的机器人轨迹还允许在推理时输入任意候选动作。

实验中,该方法在已见的 DROID 和未见的双臂机器人 BEHAVIOR 上,都优于图像转视频、轨迹控制视频和 Ctrl-World 等基线;在 BEHAVIOR 上,LPIPS 为 0.123、PSNR 为 22.90。

它还可用于:让视频模型预演多条策略轨迹、由 VLM 选优做规划;估计策略在真实环境中的成功率;从目标物体轨迹反推出机器人动作。

这篇工作的关键不是“又训练了一个机器人视频生成器”,而是提出一种统一接口:同一视频先验,遮住/显露谁,就能在前向预测与逆向求解之间切换。

对做跨本体(cross-embodiment)泛化、视频世界模型与模型式规划的读者尤其值得看。

论文可以直接获取哦~👇🏻