跳到正文
热点事件持续更新

斯坦福发布 OpenWAM 世界-动作模型框架

1 篇报道1 个报道来源6 小时前更新

先了解这件事

AI 综述

2026年10月7日,斯坦福团队发布可组合世界-动作模型框架 OpenWAM,并公开论文、代码与预训练权重。据 Hacker News 报道,该框架支持视频与动作生成顺序及注意力关系的多种配置,允许独立训练的组件在推理时连接。OpenWAM 基于 Wan2.2-5B 视频模型,在约 334 万条轨迹、14.64k 小时视频上预训练,再以 5B 视频专家加 2B 动作专家的 MoT 架构加入机器人控制,在 LIBERO 上 VTA 程序平均成功率达 98.6%。报道称,OpenWAM 仓库包含训练、评估和视频到动作组合代码,用户可从 quickstart 入手或下载预训练视频模型权重。团队表示,OpenWAM 为研究预测与控制如何协同提供了共同基础。目前该事件仅有这一篇报道,尚无后续跟进或相互矛盾的说法。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. Hacker News
    斯坦福发布 OpenWAM:可组合世界-动作模型开源框架

    斯坦福团队发布 OpenWAM,一个可组合的世界-动作模型框架,支持视频与动作生成顺序及注意力关系的多种配置,并允许独立训练的组件在推理时连接。该框架基于 Wan2.2-5B 视频模型,在约 334 万条轨迹、14.64k 小时视频上预训练,再以 5B 视频专家加 2B 动作专家的 MoT 架构加入机器人控制,LIBERO 上 VTA 程序平均成功率 98.6%。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。