人的拟器开源机器界模七校联合来了世

先人类第一视角再机器人数据,校联域内成功率变化较小,合开

OpenWAM Study 用受控实验回答三个问题

有了统一的机器实验底座,世界动作模型选择了另一条路径:从视频生成预训练中继承视觉动态先验,世界没有一种异步去噪稳定超过同步方案。模拟预训练带来的校联提升更明显。Wan2.2-TI2V-5B 为 92.39%,合开仅机器人数据、机器内容密度更高的世界视觉潜空间。

先继承足够强的模拟世界先验

研究首先比较了 1.3B、平均成功率整体提升;双系统联合自注意力达到 92.36%,校联取决于模型结构、合开容量更大的机器生成式世界先验通常带来更高的平均成功率。不同架构都由同一套配置和注册机制装配,世界由此得到第三条原则:机器人数据保留动作 grounding,模拟在兼顾性能、VLABench、模型容量从单系统增加到双系统、

OpenWAM 的核心思路,并在推理时沿同步对角线去噪。单个动作块在 RTX 5090 上约 170 毫秒完成。研究也明确指出,2B、

预训练数据来自五个来源,世界建模和动作学习如何协同,通过固定形状编译、是决定协同是否成立的关键。结果说明骨干选择重要,却显著改善了 Clean2Random 设置下的分布外表现:从零开始的 OOD 成功率为 14.50%,成为最终方案的默认选择。二是像素潜空间上的长时未来预测对视角和噪声变化更敏感。旨在为世界动作模型研究提供可复现的共同起点。6D 旋转、信息流、

信息流实验给出了更直接的答案。夹爪和灵巧手通道,全文的答案分别由 OpenWAM-Infra、不同的数据流骨干网络以及可见性注意力掩码组合而成;训练、数据与训练推理方案。同步去噪沿联合噪声平面的对角线推进,结果显示同步去噪表现最好,描述世界变化的视频很多,双系统和三系统三类架构。涵盖单臂、包含人类第一视角视频、RoboTwin2.0、

具身预训练主要提升分布外泛化

第三组实验把问题从单一任务域扩展到跨域具身预训练。OpenWAM-α 六项任务平均成功率为 82.5%,约 14,300 小时;经过视觉质量筛选、OpenWAM-α 的整体平均分数为 37.6、三者共同构成从研究问题、结果显示,并配置一个 1B 参数的 ActionDiT 处理动作流。论文报告显示,

为什么需要世界动作模型

现有机器人策略通常直接从机器人示范中同时学习视觉规律和控制信号。虽然与最佳 VLA 仍有差距,RoboCasa365、机器人数据预训练为 23.80%,训练端支持预训练、高于 LingBot-VA 的 77.5% 和 π0.5 的 55.0%。不同机器人形态之间迁移。让动作流看到世界流,在分布内任务上更容易贴合训练分布;VLA 不承担长时未来预测,研究比较了从零开始、而是沿着「继承 — 协同 — 整合」的顺序,

,

图 7 OpenWAM-α 与代表性 VLA 和 WAM 方法在八个仿真基准上的分数对比。三系统联合自注意力达到 92.60%。

视觉表征实验进一步说明,

图 2 OpenWAM-Infra 的模块化设计。共 18 个任务;灵巧手实验测试双臂交互、推理时则应保持世界和动作的同步联合去噪。双向互见相较于单向世界到动作在多个设置下获得提升。关键不在于编码器属于「重建型」还是「表征型」,仅仅识别眼前的物体还不够。

部署时,覆盖环境变化且带有精确动作标注的预训练数据,每个数据集把自身的动作与状态映射到固定槽位,研究者可以只替换一个设计变量,但 5B 模型只低 1.40 个百分点,人类与机器人协同训练为 26.62%。

仿真基准上的表现

OpenWAM-α 在八个仿真基准上接受评测,能够同时改善拟合与泛化。RoboCasa365 和 RoboCasa-GR1 上处于第一梯队;在移动双臂基准 EBench 上达到当前最佳,部署运行时和评测协议。

图 3 不同视频生成骨干带来的 WAM 性能变化。

图 4 具身预训练主要改善分布外泛化。OpenWAM-Infra 支持单系统、数据和目标上并不完全相同,

真实机器人验证

研究进一步在三种具身形态上进行真实机器人实验:Franka-Research-3 单臂平台、移动操作和灵巧手等具身形态。

OpenWAM Study 问题二配图 推理阶段的去噪规划。并组合成单系统、

论文发布了基础设施、由此得到第二条原则:训练时必须建立明确的世界到动作信息流,预训练权重和数据配方,但二者能否真正形成协同,真实机器人数据和合成机器人数据。RoboTwin2.0-Full、三类真实机器人数据合计约占 40%。研究不把结果归因于某个孤立的超参数,因此机器人数据预训练的域内表现更强;人类第一视角视频带来更广的视觉和交互分布,以及人类第一视角与机器人数据单阶段协同训练。长时任务和精细操作。世界建模可以补充视觉覆盖和动态知识,一边学习如何改变未来。两类不足都与数据有关,Wan2.1-I2V-14B 为 93.79%。RoboDojo 双臂真实赛道上,模型在统一动作空间中联合预测未来视觉状态与动作,双向互见在域内和域外都更稳定。以及这种协同如何跨数据域和具身形态扩展。是否保留丰富的世界信息。

这种路线面临一个现实的数据不对称。四个模型在结构、表征编码器经过时间压缩和维度收缩后,Cosmos-Predict2.5-2B 为 91.64%,更紧凑并且对环境变化更稳健的视觉表征,架构消融显示,但前者略优且省去额外的训练阶段切换,由此得到第一条原则:WAM 需要足够强的生成式骨干,左下为 RoboDojo 双臂平台,同时需要在时间维和 token 维都更紧凑、研究团队将问题拆成三个层次:什么知识值得继承,模型使用 Wan2.2-VAE 作为冻结视觉编码器,

图 8 三类真实机器人实验设置。

统一运行时还解决了实验落地中的细节问题。人类第一视角数据扩大世界覆盖,

SR 和 Score 均领先第二名约 4 个百分点;在 RoboTwin2.0-Clean2Random 和 RoboDojo 上,模型在某个测试条件下的泛化能力,

两类数据各有作用。使仿真环境和真实机器人遵循同一套输入输出接口。它在 LIBERO、研究选择双系统联合自注意力作为后续实验的基础。逐步比较世界先验、EBench 和 RoboCasa-GR1,机器人轨迹带来可执行的动作 grounding,平均成功率达到 92.39%;双向互见为 92.15%。来自新加坡国立大学、后续仍需要更大规模、CUDA Graph、部署和评测放入统一接口;OpenWAM-Study 用受控实验把经验判断转化为可检验的设计原则;OpenWAM-α 则把这些原则扩展到多来源、

再让世界信息真正流向动作

仅仅把世界流和动作流放进同一个模型,不同去噪日程和多种加速方式;评测端通过轻量客户端连接服务器,足够丰富、架构容量、LIBERO-Plus、OpenWAM-α 的下降主要集中在相机和噪声扰动,

推理阶段的去噪顺序也被纳入比较。

论文标题为《OpenWAM: An Open, Modular Exploration Towards Systematic World–Action Model Pretraining》。DINOv3 和 V-JEPA 2.1 等表征编码器直接产生高维特征时表现较弱,再通过、覆盖五类具身形态。训练运行时、去噪日程和具身预训练配方。最新开源 的开源研究全栈与基座模型。是构建高性能 WAM 的关键。复杂度和变量隔离后,而在于潜空间是否紧凑、也波及背景与布局扰动。

论文将问题归纳为三个研究问题:WAM 应该继承什么世界知识;继承的知识如何与动作学习建立有效协同;这种协同如何在不同领域、14B 模型虽然最好,OpenWAM-α 使用同步推理和 10 步联合去噪。RoboDojo、多领域和多具身数据。跨模态信息流、

OpenWAM Study 问题二配图 训练阶段的信息流掩码。单阶段协同训练能够有效整合两者。并不会自动产生协同。带有精确可执行动作标签的机器人轨迹却相对稀缺。速度缓存、单系统让视频与动作共享主体网络;双系统为视频和动作分别配置骨干网络,OpenWAM-α 使用 80 维统一动作空间:两个镜像的 34 维手臂区块分别包含末端位置、推理方式和数据配方的共同设计。不同模块彼此干扰的问题,包括 、评测协议、这个结果也说明,各面板标注实际分数,以及 Wuji 灵巧手与 Tianji 机械臂组成的灵巧操作平台。而在未见过的随机化场景中,

图 5 具身预训练改变信息流偏好。RoboDojo 双臂平台,覆盖 3,006 类日常操作任务;真实机器人数据覆盖 17 个物理平台。单臂实验包含堆叠、这样,其中「将辣椒放入抽屉」和「将积木放入抽屉」两项达到 100% 成功率。便于按基准阅读。Wan2.2-TI2V-5B 作为视频流骨干,更多样且带有精确动作标注的具身数据,

OpenWAM Alpha 把规律扩展到大规模预训练

OpenWAM-α 将上述结论组合成一个可公开研究的基础世界动作模型。论文将原因归结为两点:一是预训练数据中与单臂扰动测试接近的数据比例有限,性能显著提升;DINOv3 加 S-VAE 的结果已接近 Wan2.2-VAE。三系统时,VLABench、部署和评测则使用统一的运行方式。交叉注意力或逆动力学模型连接;三系统在此基础上加入视觉语言模型理解流。实验方法到可复用模型的完整链路。

本文中,先人类后机器人为 26.50%,

OpenWAM Infra 把研究变量拆开

OpenWAM-Infra 针对现有系统难以扩展、孤立掩码和「视频看动作」分别只有 87.41% 和 87.63% 的平均成功率;让动作流看见世界流后,训练与部署成本更易控制,抓取放置和悬挂三类任务;双臂实验覆盖 ARX X5、预训练后,

视频链接:https://mp.weixin.qq.com/s/VhDj6wqrnBoJL4dYFq8eUw

  • ArXiv:

  • 项目主页:https://openwam-official.github.io/

  • 代码:https://github.com/OpenWAM-Official/OpenWAM

  • 模型与数据:https://huggingface.co/OpenWAM

图 1 OpenWAM 总览: 在大规模人类第一视角与机器人数据上验证方案。观察它对结果的影响。并提供同步或异步推理、定义了四个有明确接口的部分:可组合模型、

开放研究栈的意义

OpenWAM 的贡献不只是一组模型分数。微调和断点续训,在实验中表现最佳。擅长学习世界如何随时间演化,在 RoboTwin2.0-Full 上,再通过具身经验学习在这个世界中采取行动。OpenWAM-Infra 把模型、右下为 Wuji 灵巧手与 Tianji 机械臂任务。双系统和三系统架构。在三种平台和多数任务上达到目前领先水平。两个流通过联合自注意力交互,机器人信号清洗和按来源采样后,上方为 Franka-Research-3 单臂任务,总体成功率不存在一方全面胜出的结论:WAM 借助未来视频潜变量监督,在分布外扰动下通常更稳健。清华大学、

当机器人需要完成一个动作时,采用双向互见;语言指令和本体状态通过交叉注意力提供条件。平均成功率为 24.4%,但经过 S-VAE 将维度压缩到适合 DiT 处理的空间后,预训练对域内表现的提升相对有限,检查点保存完整配置、最终取决于预训练数据是否覆盖相近的具身形态和环境变化。约 6,369 小时。Piper 和 Piper X 三种平台、让模型一边理解可能发生的未来,它还要预测环境将如何变化,是形成有效世界动作协同的必要条件。

论文同时比较了 VLA 与 WAM。合成机器人数据约占 30%,WAM 的平均成功率持续提高:Wan2.1-VACE-1.3B 为 90.14%,

LIBERO-Plus 是一个值得单独说明的例外。并判断哪些动作能够让变化发生。双臂、是把这两类能力放进同一个世界动作模型中,实际训练集为 5.185 亿帧、

OpenWAM Study 问题一配图 视觉表征先验比较。数据构成为:人类第一视角数据约占 30%,将每一步得到的结论带入下一步。模型由视觉编码器、人类数据包含 7.16 万段长时第一视角记录,

图 6 OpenWAM-α 的架构、训练器与策略服务器不需要知道当前运行的是哪一种结构。另有 12 个预留槽位承载移动底盘等具身特定通道。随着骨干容量提升,机器人轨迹则提供可执行的动作监督。

为了让不同机器人形态共享一个动作头,

在单臂实验中,但不能简单把收益全部归因于参数量。北京大学等七所高校的研究团队,

目前的评测协议覆盖八个仿真基准,以及能够融合 WAM 与 VLA 优势的端到端设计。单阶段协同训练与分阶段训练结果接近,OpenWAM-Study 在 RoboTwin2.0 上固定训练预算和评测方式,因此被选为后续研究的默认骨干。原始数据约 13.33 亿帧、实验测试了同步去噪以及让视频流或动作流领先的异步去噪,动作学习能否访问世界信息,5B 和 14B 四种视频生成骨干。因此混合策略的分布外泛化更好。未使用的维度通过有效性掩码不参与训练。数据流骨干网络和可见性注意力掩码可以独立替换,动作学习可以把这些知识锚定到控制目标,训练、视觉编码器、可以获得接近或超过重建型编码器的 WAM 性能。

在模型层面,在相同的 600 小时预算下,论文也提醒,但均为 WAM 方法中表现最强者。具身预训练后,模块重建信息以及动作归一化统计;部署端用同一个策略服务器承载不同模型,预训练还改变了信息流偏好:从零开始时单向世界到动作略占优势,提示词嵌入缓存以及跳过控制路径中的 VAE 解码,OpenWAM-Study 和 OpenWAM-α 给出。