XM外汇官网跟单资讯:VLA不够用了?WAM正在重构具身智能“最强大脑”与硬件价值链

具身智能竞争正在从“机器人能不能动”转向“能不能理解并预测物理世界”。2026年以来,纯VLA在长时程任务、复杂环境泛化和异常恢复上的局限逐渐暴露,VLA与世界动作模型WAM融合开始成为主流厂商共同方向。模型架构变化还在重新定义硬件价值:3D视觉、触觉、六维力、灵巧手和数据采集设备的重要性持续提升,中国供应链的优势也可能从低成本制造进一步延伸至真实世界数据闭环。当机器人开始学习“动作之后世界会发生什么”,产业价值链将如何重新排序?

一、发生了什么?——具身智能“大脑”从纯VLA走向VLA+WAM

1. VLA解决了“理解到行动”,长时程任务却暴露能力边界:

过去两年,VLA(Vision-Language-Action,视觉-语言-动作模型)逐渐成为具身智能“大脑”的主流技术路线。其核心逻辑是将视觉感知、语言理解和动作输出连接起来,使机器人能够根据环境信息和自然语言指令直接产生操作行为。相比依赖人工编程和固定轨迹的传统机器人,VLA显著提升了任务理解和泛化能力,也使机器人真正具备从“看懂”走向“行动”的基础。

问题在于,真实世界并不是连续发生的一组独立动作。完成一次抓杯可能只需要数秒,但“打开冰箱、找到牛奶、取出、倒入杯中、放回原位并关门”要求模型持续跟踪环境变化,并判断每一步操作会怎样影响下一步。当任务链条拉长以后,纯粹依赖“当前观察—下一动作”的模型更容易发生误差累积,陌生物体、位置变化或一次动作失败都可能打断整条任务链。

当前,具身智能的“大脑”正从VLM、VLA进一步向“多模态大模型+世界模型”演化,目的正是增强机器人对复杂环境状态和物理规律的理解。

2. WAM补上的,是“动作之后世界会怎样”:

World Model和WAM并非完全相同。World Model的核心任务是学习物理环境的状态转移,也就是理解当前世界处于什么状态,以及某个动作执行以后环境可能怎样变化;WAM(World Action Model,世界动作模型)则进一步把这种预测能力与机器人动作生成结合起来。

……