李飞飞、Yilun Du罕见联手:别给机器人建大脑了,直接偷视频模型的|GAIR Paper 115
用像素动作的新接口,打通视频大模型与机器人之间的壁垒 作者丨邓哲敏 编辑丨齐铖湧 今年视频生成和具身智能领域,阵容最为豪华的一篇“融合体论文”出现了。前几天,一篇名叫Masked Visual Actions for Unified World Modeling的论文,挂在 arxiv 上,这篇工作还未在学术圈传开,但绝对马上就要爆了。因为它的署名栏和论文内容都实在太炸裂了,大家自己看吧。不仅包括李飞飞,ImageNet 缔造者,如今全力押注空间智能;吴佳俊,斯坦福助理教授,物理推理方向代表人物,刚获得热乎的 IJCAI 2026 计算机与思维奖,还没领奖;张吕民,ControlNet 作者,如果你用过 AI 绘画里照着姿势生成人物的功能,你已经在用他的技术。还有斯坦福计算成像实验室负责人 Gordon Wetzstein、机器人基础模型核心推动者黄文龙等十多位顶尖学者。更让AI科技评论(
大模型