Ai2 发布 MolmoMotion:语言引导的 3D 运动预测模型
MolmoMotion: Language-guided 3D motion forecasting
Ai2 发布 MolmoMotion,输入视频帧、物体上的 3D 点和动作描述,即可预测这些点未来几秒在 3D 空间中的轨迹,性能超过现有预测方法。
Ai2 开源了语言引导的 3D 运动预测模型,并给出机器人规划与视频生成两类下游验证,可据此判断运动预测的落地路径。
机器在感知运动方面已经变得非常出色。给定一段视频,现代模型能够以极高的置信度追踪物体和点在场景中的运动方式。但感知本质上是回溯性的:它解释的是已经发生的运动。我们想要构建的许多系统和应用则需要 向前看。一个伸手去拿杯子的机器人必须在触碰杯子之前预判杯子将如何移动。一个视频生成器要想生成物理上合理的画面,就必须知道接下来会发生什么真实的运动。
预测运动比观察运动更难,但在许多场景中它也远为有用。
这一想法正是 MolmoMotion 背后的动机,这是我们今天发布的一个新的运动预测模型。给定一帧视频、标记在物体上的 3D 点,以及描述预期动作的文字指令(例如“移动并旋转桌上有水果的木碗”),MolmoMotion 会预测这些点在接下来的几秒内将在 3D 空间中如何移动——其性能大幅超越现有的预测方法。
给定一个 RGB 观测、物体上的一组查询点以及一段动作描述,MolmoMotion 会预测该物体未来的 3D 点轨迹。这些预测出的轨迹随后可以驱动下游应用,例如机器人规划和以轨迹为条件的视频生成。
除了模型之外,我们还发布了 MolmoMotion-1M,这是最大的与动作描述配对的 3D 点轨迹集合,取自 116 万段视频。我们还发布了 PointMotionBench,这是一个经过人工验证的基准,旨在衡量以物体为中心的 3D 运动预测准确度,包含 2.7K 段视频片段。
我们发现,像 MolmoMotion 这样的运动预测器在一系列下游任务中都很有用,从机器人规划到可控视频生成。我们公开模型权重、MolmoMotion-1M 数据集以及我们的 PointMotionBench 基准,供社区研究、改进和定制。
MolmoMotion:底层揭秘
MolmoMotion 以一种精心设计且极为高效的方式表示运动:作为世界空间中附着于物体的 3D 点,从而在无需渲染完整视频的情况下捕捉运动。我们选择它,是因为我们需要一种具备三个特性的通用运动表示:
- 类别无关:不依赖于人体、手、刚性物体或任何其他固定类别的模板。
- 视角稳定:相同的物理运动在不同相机和视角下应被一致地表示。
- 可被下游系统直接使用,这些系统需要对物理运动进行推理。
在我们考虑过的表示方法中,它是唯一同时满足这三点的。一组稀疏的表面点可以描述刚性、铰接以及(在一定限度内)可变形运动,而无需假设被移动物体的类型。由于这些点位于共享的世界坐标系中,它们的轨迹在相机运动和视角变化下保持稳定。而且由于它们是 3D 空间中紧凑的显式轨迹,可以直接传递给机器人策略或视频生成模型等系统。
为了预测这些轨迹,MolmoMotion 使用 Molmo 2 作为其骨干,使其能够将语言指令与图像中的物体和点关联起来。给定一段短视频历史、一个动作描述以及一组带有初始 3D 位置的查询点,模型首先识别所指的物体、查询点以及指令所描述的运动。然后,它预测每个点的未来 3D 轨迹。
我们训练了 MolmoMotion 的两个变体:
- 自回归变体(MolmoMotion-AR)逐步预测未来坐标。它将 3D 坐标表示为结构化文本,遵循 VLM 使用的坐标风格预测,并按时间顺序写出未来轨迹。由于每个新坐标都以已生成的轨迹为条件,这鼓励了平滑的展开,并在未来路径明确时给出最高的准确率。
- 流匹配变体(MolmoMotion-FM)通过将噪声转换为运动,在连续 3D 空间中预测轨迹,这使其更适合在指令允许多种可能未来时表示不确定性。
推出 MolmoMotion-1M 和 PointMotionBench
为了训练 MolmoMotion,我们需要尚不存在的数据:带有与特定物体关联的 3D 点轨迹并配以动作描述的大规模视频。现有的 3D 轨迹数据集规模小且领域有限,而互联网视频虽然具备我们想要的规模和多样性,适合像 MolmoMotion 这样的预测器,却不包含 3D 标注。因此,我们构建了一个自动流水线,从无约束视频中提取以物体为基的 3D 轨迹。
给定输入视频及其动作描述,我们的标注流水线在度量世界坐标中生成以物体为基的 3D 点轨迹。(下图展示了每个阶段。)具有挑战性的部分是,来自无约束视频的原始轨迹是有噪声的——深度和跟踪误差使点抖动和漂移——而且物体在视频的大部分时间里往往保持静止。为了使数据更可信,我们过滤掉与物体其余部分不一致运动的点,平滑剩余轨迹,并将每个片段裁剪到物体实际运动的窗口。
大规模运行我们的流水线产生了 MolmoMotion-1M——据我们所知,这是迄今为止组装的最大的带有动作描述、以物体为基的 3D 点轨迹语料库,涵盖 736 种运动类型和 5.6K 个不同物体。
我们的数据标注流水线概览。给定一个动作事件的视频及其描述,我们首先定位运动物体并在其上采样查询点。然后我们跟踪物体上的密集 2D 点,将这些轨迹提升到共享的度量 3D 坐标系中,并使用物体级空间和时间一致性先验来过滤不可靠的轨迹。最后,我们在所定位物体经历有意义运动的时间段周围裁剪视频。
左侧指令:“在桌子上移动并旋转装有水果的木碗。” 右侧指令:“在蓝色布上滚动粘毛滚筒。”
左侧指令:“一辆银色汽车沿着道路行驶并缓慢向右转。” 右侧指令:“一只火烈鸟在向右行走时将喙浸入水中。”
为了评估 MolmoMotion 的预测性能,我们还构建了 PointMotionBench,这是一个经过人工验证的、基于留出 3D 轨迹的基准测试。它涵盖 2.7K 个片段,跨越 111 个物体类别和 61 种运动类型,包括室内操作、第一人称手-物交互以及户外动态场景。对于每个片段,模型会获得当前观测、物体查询点和动作描述,并评估其预测的 3D 点轨迹与物体实际未来运动的匹配准确程度。这为我们提供了一种对 3D 运动预测的直接定量测试,而不是依赖生成的轨迹点是否仅仅看起来合理。
实验与性能
我们通过三种方式评估 MolmoMotion。第一,测试它是否比现有方法更准确地预测未来 3D 运动。第二,测试它学到的运动知识是否有助于机器人执行操作任务。第三,测试同样的知识是否能够帮助引导生成视频中的运动。
3D 运动预测
在 PointMotionBench 上,MolmoMotion 在我们测试的所有现有 3D 运动预测方法中表现最佳——包括像素空间视频生成器、参数化 3D 方法以及简单的匀速基线——覆盖多种物体、场景和动作。
MolmoMotion 可以预测多种物体和场景运动,例如粘毛滚筒如何在布料上来回移动、碗如何在桌面上滑动并旋转、火烈鸟如何向右行走同时将喙浸入水中,或者汽车如何在转弯时沿道路行驶。在每种情况下,预测路径都遵循 MolmoMotion 收到的指令,并且与基准测试中的真实运动极为接近。
| HOT3D | |
|---|---|
| MolmoMotion-AR (3f) | 0.109 |
| ObjectForesight | 0.129 |
| MolmoMotion-FM (3f) | 0.135 |
| MolmoMotion-AR (1f) | 0.157 |
| Extrapolate baseline | 0.159 |
| EgoScaler | 0.170 |
| Static baseline | 0.180 |
| MolmoMotion-FM (1f) | 0.183 |
| Wan2.2-5B | 0.200 |
| Robot4DGen | 0.212 |
| Cosmos Predict | 0.225 |
| Track2Act | 0.294 |
| WorldTrack | |
| MolmoMotion-AR (3f) | 0.143 |
| MolmoMotion-AR (1f) | 0.148 |
| MolmoMotion-FM (3f) | 0.158 |
| MolmoMotion-FM (1f) | 0.165 |
| Static baseline | 0.167 |
| Extrapolate baseline | 0.184 |
| Robot4DGen | 0.548 |
| Cosmos Predict | 0.831 |
| Wan2.2-5B | 0.852 |
| Track2Act | 1.230 |
| DAVIS | |
| MolmoMotion-AR (1f) | 1.146 |
| MolmoMotion-AR (3f) | 1.227 |
| MolmoMotion-FM (1f) | 1.380 |
| MolmoMotion-FM (3f) | 1.480 |
| Robot4DGen | 2.120 |
| Static baseline | 2.281 |
| Extrapolate baseline | 2.683 |
| Wan2.2-5B | 3.074 |
| Cosmos Predict | 4.191 |
| Track2Act | 4.853 |
| 来源:MolmoMotion 论文,表 1——PointMotionBench 上的 3D 点轨迹预测。MolmoMotion (3f) 和 (1f) 分别表示 3 帧和单帧输入变体。ObjectForesight 和 EgoScaler 仅在 HOT3D 上报告(表 1 中的其他位置)。Static 保持每个 3D 点固定;Extrapolate 将先前帧的运动线性外推到未来。 | |
下游评估:机器人规划
MolmoMotion 学到的运动知识应当能够从一个场景迁移到另一个场景——人手举起杯子和机器人夹爪举起杯子是非常不同的动作,但杯子本身在 3D 空间中遵循相似的路径。这使得 MolmoMotion 天然适合机器人领域,因为机器人必须先规划物体应如何移动,然后再移动它们。
在 DROID(一个大型真实世界机器人操作视频开放数据集)上微调后,我们发现 MolmoMotion 能够在广泛的机器人规划场景中,针对不同物体、相机视角、场景和任务预测合理的物体路径。
左侧指令:“将布料从容器中取出。” 右侧指令:“移动锅盖。”
在仿真中,基于 MolmoMotion 构建的控制策略在 76.3% 的拾取放置任务上取得成功,而基于 Molmo 2 构建的同一策略成功率为 56.0%——并且它学习得更快,在 10K 训练步后达到 51%,而 Molmo 2 版本最高仅达到 19%。在真实机器人上(经过微调后),MolmoMotion 仅用约 2K 步就达到了 Molmo 2 基线在 12K 训练步后才达到的相同测试 L2 误差。
MolmoMotion 初始化 Molmo 2 初始化 | |
| 样本效率 | |
|---|---|
| 10K 步时的成功率 | |
| 最终闭环成功率 | |
| 已见场景已见物体 | 85.0 |
70.0 | |
| 已见场景未见物体 | 74.5 |
51.2 | |
| 未见场景已见物体 | 72.0 |
50.0 | |
| 未见场景未见物体 | 74.2 |
48.7 | |
| 平均 | 76.3 |
56.0 | |
| 来源:MolmoMotion 论文,图 5a 和第 5.2 节。两个 MolmoBot 策略使用相同的流匹配动作头和 20K 已发布回合,仅在骨干网络初始化上有所不同。 | |
下游评估:视频生成
指令:“一只火烈鸟一边向右行走,一边将喙浸入水中。”从左到右:DaS + MolmoMotion、CogVideoX-5B 和 WAN-14B。
指令:“从桌上拿起圆形的浅棕色盘子。”从左到右:DaS + MolmoMotion、CogVideoX-5B 和 WAN-14B。
MolmoMotion 预测的路径还可以引导视频生成。与其让图像到视频模型仅根据文本指令猜测运动,你可以输入 MolmoMotion 的预测。结果是生成的视频更紧密地遵循所要求的动作,尤其是对于提示词只能模糊描述的小幅精确运动。
指标也证实了这一点。用于引导视频生成器时,MolmoMotion 在我们测量的全部五项运动相关指标上都比基础模型提升了运动质量,并在五项中的四项上击败了一个大得多的图像到视频模型。
| 时间一致性 | |
|---|---|
| DaS + MolmoMotion | 0.968 |
| Wan2.2-I2V-A14B | 0.965 |
| CogVideoX-5B | 0.964 |
| 主体一致性 | |
| DaS + MolmoMotion | 0.950 |
| Wan2.2-I2V-A14B | 0.940 |
| CogVideoX-5B | 0.939 |
| 运动平滑度 | |
| DaS + MolmoMotion | 0.990 |
| CogVideoX-5B | 0.988 |
| Wan2.2-I2V-A14B | 0.983 |
| 动态程度 | |
| Wan2.2-I2V-A14B | 0.908 |
| DaS + MolmoMotion | 0.876 |
| CogVideoX-5B | 0.861 |
| 背景一致性 | |
| DaS + MolmoMotion | 0.948 |
| Wan2.2-I2V-A14B | 0.947 |
| CogVideoX-5B | 0.941 |
| 来源:MolmoMotion 论文,表 2。本节中的条形长度在每个指标行内重新缩放,以使微小差异可见,不应被解释为绝对分数比例;打印的分数为报告值。 | |
局限性与下一步
MolmoMotion 是一个能力很强的模型,但仍有一些局限性需要注意。它在训练期间为每个物体使用八个查询点——足以预测有用的轨迹,但不足以密集表示表面几何形状。这限制了模型处理复杂可变形运动的能力。
我们认为,预测——在物体移动之前预判它们将如何在世界中运动——与感知已经存在的事物一样,是机器智能的基础。MolmoMotion 是朝这一方向迈出的一步——它无需按类别模板即可跨物体类别泛化的 3D 运动预测,从普通视频中学习,并且是我们在 PointMotionBench 上测量过的最准确的 3D 运动预测器。我们预计机器人、视频及其他领域将涌现许多应用。
我们鼓励你通过下载权重、检查训练数据以及在 PointMotionBench 上评估我们的方法来试用 MolmoMotion。
加入我们
在 Ai2,我们正在构建透明、开源 AI 的未来——以开放方式构建,以赋能科学进步,并促进对这项改变世界的技术的根本理解。我们不是为了盈利,而是为了确保 AI 的益处被广泛共享并造福人类。如果这吸引你,请看看我们的开放职位。
订阅以每月接收有关 Ai2 最新动态的更新。
来源:Allen AI (Ai2) · allenai.org