在线咨询 400-826-1668
回到顶部
ARTICLE DETAIL

资讯详情

深耕国风建站与运营引流的一线实战洞察。

预训练以想象,微调以行动:世界-动作模型的兴起(下)

预训练以想象,微调以行动:世界-动作模型的兴起(下) 26年6月来自Nvidia 西雅图机器人实验室的Moritz Reuss写的博客“Pretrained to Imagine, Fine-Tuned to Act: The Rise of World-Action Models”。。。。继续。。。仅表示在推理阶段跳过视频生成第三种方法是将视频骨干网纯粹用作表示完全跳过推理阶段的视频生成。Fast-WAM 就是这种思路的一个很好的例子。Fast-WAM【23】采用与 LingBot-VA 类似的 Wan/MoT 式设置即使没有 16000 小时的大规模机器人预训练其在模拟基准测试中的表现也与其非常接近。此外在测试阶段跳过视频生成步骤使其推理速度提高了数倍。然而Fast-WAM 是目前为数不多的公开证据之一支持“仅表征假设”而现有的模拟证据尚不足以真正信服这一观点。但也期待在未来的工作中获得更充分的论证。目前大多数WAM算法在推理阶段仍然保留某种形式的视频生成速度非常慢。像Fast-WAM这样的快速WAM算法未来将成为更重要的研究领域。行动整合行动如何进入模型在讨论了如何将视频和动作预测结合起来之后重点关注模型内部如何表示动作。动作表示的选择至关重要因为预训练的主干网络擅长对视觉token进行去噪而非连续的机器人动作因此存在着模态不匹配的问题。在现有论文中看到三种不同的表示方法。默认操作token最简单的默认做法是添加动作token连续或离散和一个动作头其中动作被视为与视频并列的另一种模态。UniPi、GR-1、DreamZero、LingBot-VA、VPP、mimic-video 和 Fast-WAM 都采用某种形式的类似方法。风险在于模态不匹配动作块与骨干网络预训练所用的视觉token不同因此模型必须在动作微调期间调整其表示。动作即图像另一种方法是将动作转换成视频模型已知的内容。无需创建新的动作token或单独的动作头而是将动作编码为同一生成界面内的视觉目标这样就不会破坏预训练的视频表征。最接近的早期先导者是GENIMA 。GENIMA 对稳定扩散算法进行微调使其能够在 RGB 图像上绘制关节动作目标然后使用控制器将这些视觉目标映射到关节位置动作。有趣的是它的接口选择动作被表达为生成图像模型可以绘制的内容。Cosmos Policy 是这一方向的现代版它将动作视为合成的潜视频帧。它没有添加单独的动作解码器而是将动作、本体感觉和价值目标编码为视频模型自身去噪接口中的虚拟帧并在推理时通过对空间维度进行平均将预测的动作图像解码回动作向量。这种设置既能使预训练的视频骨干网络保持在其原生视频去噪空间的接近性又能生成机器人动作。潜动作和规划另一种方法是将行为压缩成潜规划或潜动作并以此为基础来制定策略。这种方法很有吸引力因为完整的视频预测成本很高而且大多数像素实际上并不需要用于控制。潜规划和潜动作并不完全相同但为了便于讨论将它们归为一类两者都是从轨迹或视频中学习的紧凑行为抽象。它们的主要区别在于粒度和监督方式。计划通常覆盖多步窗口并且通常需要成对的机器人数据而Genie/LAPA风格的潜动作可以从未标记的视频中学习。Play-LMP 于 2019 年率先提出这一理念。值得一提的是其基本思想比当前的基础模型浪潮更为古老。早在如今能够获取更大规模的机器人数据集和预训练模型之前Play-LMP 就将子任务压缩到一个较小的潜空间中作为底层策略的中间抽象。具体而言后验网络将短轨迹窗口压缩成一个潜规划先验知识用于根据当前观测值和目标图像预测该潜规划而底层策略则将采样的规划解码为动作。现代潜动作浪潮改变规模和数据来源。Genie 证明可以从未标记的网络视频中学习潜动作tokens并用其驱动一个基于动作的世界模型。Genie 本身并不将这些潜token解码成真实的机器人运动指令因此它并非机器人策略。但它使这一理念更具可扩展性无需真实机器人动作即可从视频中学习类似动作的抽象概念。随后 LAPA 将这种潜动作预训练方法推向 VLA 式的机器人学习。Being-H0.7是 Play-LMP 的现代 WAM 版。它保留了先验/后验潜规划逻辑但将其部署到基础模型规模并进行了多项重大改进。它没有采用小型分层潜规划策略而是使用一个更大的 Mixture-of-Transformer 骨干网络。与 Play-LMP 类似该模型包含一个后验分支和一个先验分支。后验分支获取未来的观测数据使用冻结的 V-JEPA2.1视觉编码器和感知器重采样器对其进行编码并将其压缩成 K 个未来嵌入。先验分支使用可学习的潜查询并学习如何从可用上下文中匹配这些包含未来信息的潜状态。在测试阶段后验分支被移除因此该策略可以获得一个快速的潜接口而无需强制模型重新生成完整的视频序列。动作生成部分仍然是一个流匹配动作策略。Being-H0.7 经过 20 万小时以自我为中心的人类视频和 1.5 万小时机器人演示的训练。关键区别不在于潜变量本身。Play-LMP 已经具备先验/后验潜规划的核心思想。Being-H0.7 展示了如何在现代 WAM/VLA 混合模型中扩展该接口。潜动作作为一种抽象方法在动作条件世界模型中也越来越受欢迎。最近的一个例子是DreamDojo它从大规模的以自我为中心人类视频中学习连续的潜动作从而构建一个可控的世界模型。与逆动力学的重要区别在于监督路径。逆动力学世界模型通常需要成对的视频和动作数据来学习视觉转换如何映射到运动指令。而潜动作方法则尝试首先从视频本身学习行为抽象然后再将该抽象与机器人动作联系起来。架构层级式、单体式还是MOT第三个维度是架构组件的结构组成方式。这与前两个维度基本正交。逆动力学可以是层级式的也可以是MoT式的联合预测可以是整体式的也可以是基于专家的潜动作方法可以封装在多个不同的框架中。分层式设计最为灵活因为动作头是完全模块化的。它可以是任何模型从简单的 CNN 回归器UniPi到完整的 VLA 栈Pi-0.7 的 BAGEL 子目标加上完整的基于 VLA 动作专家VPP 【24】 和 mimic-video则介于两者之间通过传递中间视频模型特征而非完整的 RGB 展开来实现。缺点是视频阶段和动作阶段之间的耦合较弱。信息单向流动因此当视频和动作需要相互强烈影响时这种设计就显得不太自然。像 DreamZero 这样的整体式 Transformer 模型将视频和动作去噪放在同一个栈中这使得两个数据流之间具有很强的耦合性。它们也天然适用于像 Cosmos Policy 这样的“动作-即-图像”的设置在这些设置中动作和视频已经存在于同一个潜空间中。风险在于双重优化相同的模型权重必须处理密集的视觉token和特别稀疏的动作目标。混合Transformer模型MoT是目前的默认架构包括现代VLAPi-0、Pi-0.5以及LingBot-VA[9]和Fast-WAM[23]等最新的WAM模型。模态特定的参数保证不同模态表征的分离而共享注意机制则允许视频和动作之间交换信息。MoT架构也许也将成为主流的WAM架构主要是因为它在模块化和耦合性之间取得切实可行的平衡。为什么WAM现在兴起关于WAM为何现在才兴起简短回答虽然这个想法并不新鲜但所需的工具例如预训练视频模型终于发展成熟。早期的模型例如用于逆动力学的UniPi、用于联合预测的GR-1以及用于潜抽象的Play-LMP思路正确但工具有限骨干网络规模较小、视频数据质量较差、没有公开可用的视频基础模型而且逐步动作头与现代动作块策略相比效果不佳。而现代版例如LingBot-VA、DreamZero以及Being-H0.7则使用几年前还不存在的基础设施和大规模机器人数据集。首先视频骨干网络得到极大的增强。基于 DiT 的模型例如 Wan [21] 和 Cosmos取代了早期的基于 CNN 的架构它们拥有更优的时间压缩、流匹配目标以及精心整理的网络级视频数据。其次这些骨干网络实现了开源。研究人员现在可以对强大的预训练视频模型进行微调而无需自行承担全部预训练成本。第三动作处理方面也取得长足进步现代系统使用 Transformer 或流匹配头来预测动作块而不是使用小型的逐步 MLP 头。正因如此WAM 现在看起来更像是一个成熟的解决方案而不仅仅是一个包装更精美的老概念。WAM 比较下表总结之前讨论过的模型并根据不同的设计决策对其进行分类模型预测什么、动作如何输入、使用什么骨干网络以及采用什么架构WAM 领域发展迅速因此这里仅列出部分论文。如需更全面地了解世界模型和 WAM 相关机器人学习论文请参阅 NTU 的综述【57】。实际考虑因素已经看到一些很有前景的WAM模型和一些令人鼓舞的结果。然而也存在一些核心问题训练成本高昂。视频骨干网络处理的token数量远多于基于图像的动作策略而且完整的视频预训练成本很高。推理速度慢。生成或去噪未来视频潜信号的策略比简单的视频潜信号算法慢得多。内存和系统复杂性。冗长的视频token序列会大幅增加 GPU 内存、通信和数据加载的压力。如果不进行额外的工程改造想在本地 GPU 上运行 100 亿以上的 WAM 模型几乎是不可能的。视频先验的成本在某些情况下强大的视频先验信息可以降低机器人数据需求并且在使用WAN等现代视频模型时仍能提供出色的零样本性能。实际上这通常会以牺牲机器人数据效率为代价来增加计算成本。看一个非常粗略的下限比较。模型间的训练成本很难直接比较但可以根据论文和 GitHub 代码库中提供的细节做出一个粗略的下限估计。因此用一个简单的密集transformer下限估计C ≈ 6NT其中 N 是可训练的密集参数数量T 是token的数量。基于 VLM 的 VLA 在训练的两个阶段都更便宜因为它们的序列更小它们编码一到几张图像以及文本然后预测文本或一个简短的动作token序列。WAM 则需要训练来预测包含额外动作token的视频潜序列。视频token序列的长度通常是 VLA 序列的 10 倍左右。这使得在相同的数据集上进行训练比默认的 VLA 训练成本更高。下图概述不同的 VLA/WAM 训练成本估算。DreamZero 式的动作调优大约需要 9 ZFLOPs相比轻量级的 VLA 训练行而言这相当大。像 MolmoAct2 这样的现代 VLA 报告称从 Molmo2-ER 到 DROID 检查点的完整成本约为 9.8 ZFLOPs。这假设使用强大的 Molmo2-ER 骨干网络并且没有计算 Qwen3 或 SigLIP2 的预训练成本。Summer-22B 是一个现代的公开视频预训练 token/数据集参考用于了解大规模训练一个具有竞争力的视频基础模型所需的成本使用 220 亿参数的模型和论文中约 5000 亿 Token 的训练规模它给出了约 66 ZFLOPs 的视频预训练成本估算。如果将其缩小到与 DreamZero Wan 的 140 亿规模相匹配可以估算出训练视频模型和 WAM 阶段的总成本约为 51 ZFLOPs。与高效的 VLA Foundry 算法运算速度为 6.9 ZFLOPs相比这导致约 7.4 倍的差距。这些数字表明大规模 WAM 训练所面临的挑战。除了总浮点运算能力之外还存在硬件和工程方面的障碍。一个拥有约 8000 个tokens的动作调优序列的 140 亿参数模型需要大量的 GPU 内存并且通常需要配备高端互连的多节点架构。成功的视频模型训练还依赖于强大的数据过滤、字幕生成、视频解码、潜在预处理、分布式 I/O 以及长序列DiT基础设施。同样的论点也存在数据质量方面的版本。DreamZero认为更强大的视频生成能力能够转化为更强的策略性能[8]因此WAM不仅计算量巨大而且对视频数据质量要求也很高过滤、字幕生成、潜表示和生成式预训练都成为策略制定的一部分。基于VLM的VLA则没有展现出同样的清晰关联。VLM4VLA 发现 VLM初始化比从头开始训练更有帮助但通用的VLM能力并不能很好地预测下游VLA的性能。对于WAM而言视频生成质量是良好策略的必要条件而对于VLA而言空间目标远比其他视觉能力重要。有关逐行注意事项和每个估算背后的推导过程请参阅下面的参考表。推理速度总体而言基于VLM的VLA并非总是快速而默认的WAM设置包括测试时视频生成速度可能更慢。具体数值取决于硬件、实现方式、扩散步骤和动作块长度但Fast-WAM提供的代表性数值可作为参考两种常见的WAM推理模式联合预测和完整视频生成的逆动力学每个动作块耗时590毫秒至800毫秒而Pi-0.5的耗时约为190毫秒。这意味着推理速度降低了3-4倍这对实时控制至关重要。虽然有一些方法可以加速这一过程例如DreamZero论文和Fast-WAM完全跳过视频生成的方法但如果没有大型GPU在本地运行这些模型仍然具有挑战性。为什么现代VLA基线仍然重要现代基于VLM的VLA模型发展迅速目前最强大的基线模型融合四种理念离散动作token化、保留VLM的协同训练、隔离动作头以及更广泛的数据混合。任何声称视频骨干网是更优默认方案的说法都必须超越当前最先进的方案。VLA 的架构已趋于统一采用一种默认设置混合 Transformer 模型该模型最初由Transfusion引入视觉领域后由Pi-0 在机器人领域推广。主要变化在于训练方法。早期基于流的动作头导致 VLM 的预训练从离散的下一个token转向连续的动作去噪造成了较大的干扰。而新的方法则试图减少这种干扰。首先许多现代VLA使用离散token化器例如FAST或BEAST将动作表示为一种新型语言VLM 可以学习这种语言。这是出于优化方面的考虑VLM 预训练用于离散的下一token预测并使用交叉熵损失函数而机器人动作存在于一个连续空间中通常使用流匹配进行建模。简单地使用流匹配目标来微调 VLM 会导致预训练语言和视觉能力的灾难性遗忘。与离散动作token化进行协同训练通常结合来自流匹配头的隔离梯度可以规避这个问题。VLM 可以更接近其首选的离散空间并学习用于具身控制的有用表示而流匹配头则基于这些特征进行自身的动作预测。在测试阶段具有独立动作头的系统可以放弃缓慢的自回归动作-token预测路径让动作头独立完成其工作。为了更直观地了解这种灾难性遗忘问题的影响再次来看一下 RoboArena的快照。Pi-FAST 使用与 Pi-0-DROID 相同的骨干网络但它去掉流组件并使用离散的 FAST token来生成动作。两者都在 DROID 上进行了微调。Pi-FAST 的得分达到了 1592而 Pi-0 的得分仅为 1475两者差距相当大。这支持了以下观点与原始的基于流程的 Pi-0 设置相比离散动作方案能够保留更多有用的预训练能力。其次Pi-0.5 式系统会同时使用 VLM 数据和机器人数据进行训练通常会隔离 VLM 和流程/动作组件之间的梯度以实现更快更稳定的收敛。这使得 VLM 可以继续练习语言和视觉理解而动作部分则可以专注于操作。Pi-0.5、Xiaomi-robotics-0和Being-H0.5等近期的 VLA 也采用了相同的模式。在RoboArena 测试中Pi-0.5 的表现显著优于 Pi-FAST 和 Pi-0 Pi-0 为 1622Pi-FAST 为 1592Pi-0 为 1475。这些结果与训练设计决策对策略性能的重要性相一致。即使改进了这些方法VLA 仍然遇到了瓶颈。语言表达行为目标的方式不够具体。在杂乱的场景中文本指令很少能准确指出相关的物体实例或期望的物理状态。因此策略可能会过拟合虚假相关性例如背景物体或其他数据集偏差。Pi-0.7 报告的仅语言提示和目标-图像条件之间的差距支持这一观点视觉子目标可以提高语言遵循度并加快训练收敛速度。DreamZero 在同一 RoboArena 快照上获得的 1750 elo-分数也进一步证明视频/图像目标先验可以帮助解决这类问题。因此目前WAM和VLA之间尚无真正的赢家而且未来是否会有赢家也值得怀疑。Zhang【25】的初步比较研究在LIBERO-Plus和RoboTwin 2.0-Plus上针对匹配扰动对LingBot-VA、Cosmos Policy和Pi-0.5进行了基准测试。他们的结果表明WAM无需像VLA基线那样使用更广泛的训练数据混合即可达到很强的鲁棒性。然而该比较仅限于仿真环境并未涵盖真实世界的泛化能力。这两条代表道路实际上是一条吗悬而未决的问题是从长远来看这两条路径是否仍然截然不同。一些最新的VLA已经采用世界模型风格的组件来更好地跟踪目标参见Pi-0.7而许多最新的WAM也借鉴了VLA 混合TransformerMoT的算法来构建动作专家。机器人基础模型的未来发展方向似乎是两者的融合。在Motus和BagelVLA 等近期研究中已经出现了这种方向的初步迹象。与其纠结于选择语言还是视频作为机器人的主要表征方式不如训练一个能够处理所有情况的模型。下图展示一个简化的模型一个理解/视频-语言模型 (VLM) 组件、一个视频生成组件和一个动作专家。每个组件都有各自的权重并通过共享的自注意机制交换信息通常采用非对称模式以便每个组件可以向其他组件展示不同的信息。密集 Transformer 模型或 MoE 风格的路由可以实现相同的高级思路。这种混合系统的分层版也出现在 Physical Intelligence 公司最近推出的Pi-0.7中Pi-0.7 是一款可控的 VLA模型其动作专家基于测试时由基于BAGEL的世界模型生成的视觉子目标进行训练。高级策略发出子任务指令世界模型将这些指令转换为子目标图像动作专家则根据当前观测结果加上该子目标来执行动作。报告的消融实验结果支持语言跟随论点添加世界模型子目标可以改善复杂指称任务中的指令跟随能力并且对于某些数据集偏差消除任务而言是必要的因为在这些任务中不添加子目标的变体会失败。作者还报告说子目标图像可以显著加快训练速度因为动作预测更接近于当前帧和期望的未来帧之间的逆动力学问题。从证据的角度来看这是一个现实世界的信号表明视觉子目标可以弥合部分语言基础差距即使在VLA栈中也是如此。但这并不意味着每个强大的VLA都需要一个完整的视频生成头。Sereact 的Cortex 2.0是另一个指向这种混合方向的初创公司案例。Cortex 2.0 添加一个世界模型该模型在视觉潜空间中生成候选的未来轨迹并根据预期进展、风险和效率对其进行评分最终以得分最高的方案作为执行条件。这标志着 WAM 式预测技术有望成为已部署操作系统内部的一个规划层。Being-H0.7是基础模型混合模型的最佳示例它是一个基于预训练的 VLA Being-H0.5 构建的潜规划风格的 WAM/VLA 模型使用 InternVL3.5 作为理解专家模型Qwen3 作为动作专家模型以及 V-JEPA2.1视觉编码器。它成功地结合 VLA 风格的预训练组件、V-JEPA2.1 的未来观测嵌入、Play-LMP 风格的先验/后验潜接口以及流匹配动作策略。计算成本是目前只看到少数“单一模型包办一切”系统的主要原因。训练一个强大的视觉-语言模型VLM本身就成本高昂在此基础上叠加大规模视频建模会进一步增加成本。因此在短期内VLA式训练和WAM式训练的分离仍然具有意义这既是出于计算能力的限制也是因为仍然不清楚哪些要素对机器人技术最为重要。问题是这两条道路最终会融合还是其中一条会彻底胜出第四条路径以机器人技术为先导的基础模型第四种可能性是机器人-优先基础模型RFFM。简而言之这是一个围绕机器人挑战而设计的大型Transformer架构这些挑战包括具身认知、动作、富接触交互和具身记忆。该方案的清晰版本并非简单地从Web视频模型或视频生成器开始然后再添加动作。它会从一开始就将交互和动作作为预训练的核心。最清晰的例子是Generalist AI 的GEN-1它引入一个大型机器人行为模型该模型基于 50 万小时的 UMI 式可穿戴设备数据进行预训练。这一方向的核心问题在于数据获取除了资金雄厚的初创公司和大型企业之外几乎没有人能够获取这种大规模的人类或机器人数据。因此在获得更多大规模的开源机器人数据之前这条研究路径目前对社区来说是受阻的。一个值得关注的正交方向是潜世界模型例如V-JEPA 2 [45]。它们直接从预训练的潜空间中的视频学习潜动态。与基于扩散的视频生成方法相比这些模型有望实现更低的部署成本、更快的推理速度和更清晰的规划信号。该方向的首批 WAM 模型例如VLA-JEPA [63] 或Being-H0.7 [42]都展现出了令人鼓舞的性能。结语WAMs 将成为机器人基础模型的核心研究子领域。虽然 VLAs 已经趋于统一VLM 骨干网络、基于梯度隔离的动作专家模型结合流匹配以及在广泛的网络和机器人混合数据集上进行协同训练但 WAMs 仍处于探索阶段。相关论文在视频骨干网络、策略制定、训练方案和评估设置等方面差异很大。这种研究多样性对于一个新兴领域来说是有益的并且涌现出了许多新的想法。然而目前还没有人真正知道哪种方法最有效。总结这篇博客的结论从指令到动作的鸿沟依然存在。即使是采用离散动作token化、保持VLM不变的协同训练以及广泛的数据混合等技术的现代VLA也无法完全弥合这一鸿沟。WAM有望从视频层面解决这一问题但目前的研究结果尚未表明它们已经成功解决。机器人基准测试仍然是一个核心问题。必须重申一个观点现代 VLA 和 WAM 基准测试尚未得到解决。需要更多像RoboLab [62] 或MolmoSpaces [61] 这样的基准测试它们会增加基准测试的难度并要求机器人具备良好的策略泛化能力才能获得高分。下一代机器人基础模型很可能是WAMVLA的混合模型。Pi -0.7的BAGEL子目标、Cortex 2.0的基于预见的规划、Being-H0.7的潜先验/后验桥接以及Motus/BagelVLA风格的混合模型已经融合VLA和WAM的思维模式。从零开始训练的首批机器人基础模型也是很有可能的发展方向尤其是在能够获取更多更优质的开源机器人数据之后。参考文献Atreya, Pranav, et al. “RoboArena: Distributed Real-World Evaluation of Generalist Robot Policies.” CoRL 2025. paperBlack, Kevin, et al. “Pi-0: A Vision-Language-Action Flow Model for General Robot Control.” arXiv 2024. paperPertsch, Karl, et al. “FAST: Efficient Action Tokenization for Vision-Language-Action Models.” arXiv 2025. paperPhysical Intelligence, et al. “Pi-0.5: A Vision-Language-Action Model with Open-World Generalization.” arXiv 2025. paperBjorck, Johan, et al. “GR00T N1: An Open Foundation Model for Generalist Humanoid Robots.” arXiv 2025. paperLiu, Bo, et al. “LIBERO: Benchmarking Knowledge Transfer for Lifelong Robot Learning.” NeurIPS 2023. paperMees, Oier, et al. “CALVIN: A Benchmark for Language-Conditioned Policy Learning for Long-Horizon Robot Manipulation Tasks.” RA-L 2022. paperYe, Seonghyeon, et al. “World Action Models Are Zero-shot Policies.” arXiv 2026. paperLi, Lin, et al. “Causal World Modeling for Robot Control.” arXiv 2026. paperDu, Yilun, et al. “Learning Universal Policies via Text-Guided Video Generation.” NeurIPS 2023. paperWu, Hongtao, et al. “Unleashing Large-Scale Video Generative Pre-training for Visual Robot Manipulation.” ICLR 2024. paperCheang, Chi-Lam, et al. “GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation.” arXiv 2024. paperKim, Moo Jin, et al. “Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning.” arXiv 2026. paperPai, Jonas, et al. “mimic-video: Video-Action Models for Generalizable Robot Control Beyond VLAs.” arXiv 2025. paperNair, Suraj, et al. “R3M: A Universal Visual Representation for Robot Manipulation.” arXiv 2022. paperKaramcheti, Siddharth, et al. “Language-Driven Representation Learning for Robotics.” arXiv 2023. paperBi, Hongzhe, et al. “Motus: A Unified Latent Action World Model.” arXiv 2025. paperHu, Yucheng, et al. “BagelVLA: Enhancing Long-Horizon Manipulation via Interleaved Vision-Language-Action Generation.” arXiv 2026. paperBruce, Jake, et al. “Genie: Generative Interactive Environments.” ICML 2024. paperDriess, Danny, et al. “Knowledge Insulating Vision-Language-Action Models: Train Fast, Run Fast, Generalize Better.” NeurIPS 2025. paperWan Team, et al. “Wan: Open and Advanced Large-Scale Video Generative Models.” arXiv 2025. paperAgarwal, Niket, et al. “Cosmos World Foundation Model Platform for Physical AI.” arXiv 2025. paperYuan, Tianyuan, et al. “Fast-WAM: Do World Action Models Need Test-time Future Imagination?” arXiv 2026. paperHu, Yucheng, et al. “Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations.” ICML 2025. paperZhang, Zhanguang, et al. “Do World Action Models Generalize Better than VLAs? A Robustness Study.” arXiv 2026. paperSchäfer, Lukas, et al. “When does predictive inverse dynamics outperform behavior cloning?.” arXiv preprint arXiv:2601.21718 (2026). paperCai, Rui, et al. “Xiaomi-robotics-0: An open-sourced vision-language-action model with real-time execution.” arXiv 2026. paperLuo, Hao, et al. “Being-H0.5: Scaling Human-Centric Robot Learning for Cross-Embodiment Generalization.” arXiv 2026. paperTian, Yang, et al. “Predictive Inverse Dynamics Models are Scalable Learners for Robotic Manipulation.” ICLR 2025. paperZhou, Chunting, et al. “Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model.” ICLR 2025. paperShridhar, Mohit, Yat Long Lo, and Stephen James. “Generative Image as Action Models.” CoRL 2024. paperLynch, Corey, et al. “Learning Latent Plans from Play.” CoRL 2020. paperYe, Seonghyeon, et al. “Latent Action Pretraining from Videos.” ICLR 2025. paperZhou, Hongyi, et al. “BEAST: Efficient Tokenization of B-Splines Encoded Action Sequences for Imitation Learning.” NeurIPS 2025. paperChi, Cheng, et al. “Universal Manipulation Interface: In-The-Wild Robot Teaching Without In-The-Wild Robots.” RSS 2024. paperChi, Cheng, et al. “Diffusion Policy: Visuomotor Policy Learning via Action Diffusion.” IJRR 2025. paperMa, Teli, et al. “DiT4DiT: Jointly Modeling Video Dynamics and Actions for Generalizable Robot Control.” arXiv 2026. paperZhang, Wenyao, et al. “DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge.” NeurIPS 2025. paperLi, Shuang, et al. “Unified Video Action Model.” arXiv 2025. paperRhoda AI Team. “Causal Video Models Are Data-Efficient Robot Policy Learners.” Rhoda AI Blog, 2026. blogPhysical Intelligence. “Pi-0.7: a Steerable Model with Emergent Capabilities.” Physical Intelligence Blog/Paper, April 2026. blog, paperLuo, Hao, et al. “Being-H0.7: A Latent World-Action Model from Egocentric Videos.” arXiv 2026. paper, project pageAssran, Mido, et al. “V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning.” arXiv 2025. paperGao, Shenyuan, et al. “DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos.” arXiv 2026. paperAida, Adriana, et al. “Cortex 2.0: Grounding World Models in Real-World Industrial Deployment.” arXiv 2026. paper, project pageMercat, Jean, et al. “VLA Foundry: A Unified Framework for Training Vision-Language-Action Models.” arXiv 2026. paper, model collectionRyu, Simo, and Chunghwan Han. “Summer-22B: A Systematic Approach to Dataset Engineering and Training at Scale for Video Foundation Model.” arXiv 2026. paperPhysical Intelligence. “openpi.” GitHub repository, 2025-2026. codeZhang, Jianke, et al. “VLM4VLA: Revisiting Vision-Language-Models in Vision-Language-Action Models.” arXiv 2026. paperDeng, Chaorui, et al. “Emerging Properties in Unified Multimodal Pretraining.” arXiv 2025. paperHancock, Asher J., et al. “Actions as Language: Fine-Tuning VLMs into VLAs Without Catastrophic Forgetting.” ICLR 2026. paper, project pageHo, Jonathan, et al. “Imagen Video: High Definition Video Generation with Diffusion Models.” arXiv 2022. paperWang, Lirui, et al. “Prediction with Action: Visual Policy Learning via Joint Denoising Process.” arXiv 2024. paperWen, Junjie, et al. “Unified World Models: Coupling Video and Action Diffusion for Pretraining on Large Robotic Datasets.” arXiv 2025. paperByteDance Seed. “GR-1.” GitHub repository, 2024. released configWan-Video Team. “Wan2.2.” GitHub repository, 2025. releaseHou, Bohan, et al. “World Model for Robot Learning: A Comprehensive Survey.” 2026. project page, repoFang, Haoquan, et al. “MolmoAct2: Action Reasoning Models for Real-World Deployment.” arXiv 2026. paper, modelClark, Christopher, et al. “Molmo2: Open Weights and Data for Vision-Language Models with Video Understanding and Grounding.” arXiv 2026. paper, modelReuss, Moritz. “State of VLA Research at ICLR 2026.” Blog post, October 2025. blogKim, Yejin, et al. “MolmoSpaces: A Large-Scale Open Ecosystem for Robot Navigation and Manipulation.” arXiv 2026. paperYang, Xuning, et al. “RoboLab: A High-Fidelity Simulation Benchmark for Analysis of Task Generalist Policies.” arXiv 2026. paperSun, Jingwen, et al. “VLA-JEPA: Enhancing Vision-Language-Action Model with Latent World Model.” arXiv 2026. paperMur-Labadia, Lorenzo, et al. “V-JEPA 2.1: Unlocking Dense Features in Video Self-Supervised Learning.” arXiv 2026.
返回列表