街坊秀 街坊秀

当前位置: 首页 » 街坊资讯 »

从 VLA 到 WBI,具身智能的大脑在如何改变?

(来源:机器之心)

在过去几年间,具身智能领域流行的 VLA 路线极大地推动了机器人对开放环境的认知与泛化操作能力。然而,大多基于桌面或双臂静态基座的数据进行训练的 VLA 在具身智能体进入双足人形机器人时,其动作空间无法完成数十个自由度、处于严重欠驱动状态且需要时刻维持动态平衡运动需求。以更高的协调性为目标,业界近期的注意力开始聚焦于全身智能(WBI)的目标,以求设计出能够真正掌握身体的具身大脑。

目录

01. 如何理解具身智能的「WBI」新目标?WBI 与 WBC、VLA 有何关联?业界对 WBI 有哪些共识与非共识?...

02.技术路线的非共识下,近期工作如何实现 WBI?分层架构如何实现更优的全身协调?WBI 需要什么数据?端到端模型是否更容易实现 WBI 的目标?...

如何理解具身智能的「WBI」新目标?

1、在人工智能向物理世界延伸的进程中,具身智能的研究热点正在「高层语义理解」转向「底层物理掌控」,其「大脑」在表征维度、控制接口、物理推理能力以及数据感知源头上经历着持续重构。

2、过去几年,以视觉-语言-动作(VLA)模型为代表的工作在固定基座或局限场景中取得了突破。然而,当具身智能体拓展至双足人形机器人等高自由度构型时,业界开始追求将导航移动、姿态平衡与灵巧操作在策略层面深度耦合的「Whole-Body Intelligence」(WBI)范式。[1-1] [1-2] [1-3] 

① 传统 VLA 模型的大脑试图将物理世界抽象为「视觉输入 $$\rightarrow$$ 末端位姿(轨迹)」的简单映射,但容易忽略基座移动、躯干扭转与重心转移。

② 在传统架构中,底盘移动或双足行走被作为独立模块切分出去。上层规划器通常只给出末端轨迹或离散的足迹指令,全身控制(WBC)只能被动地在底层进行力矩补偿,导致机器人无法实现真正的「全身协同」。

③ 近期兴起的全身智能(WBI)强调机器人能够原生理解物理世界的力学规律,并通过单一或紧密耦合的神经网络策略,将高级多模态语义指令直接转化为包含全身重心调整、四肢协同、多触点平衡以及精细力控的连贯运动输出的能力。

3、在 WBI 的目标下,业界尝试推动具身大脑从「局部位姿预测器」向「全身物理协调大脑」的跃迁,探索更具协调性的具身智能系统。

① 香港大学助理教授、源策未来创始人李弘扬在 7 月中旬的 RSS 2026 的演讲中阐述了从「全身控制(WBC)」向「全身智能(WBI)」演进的范式转移,指出机器人未来需要实现覆盖移动、平衡、接触和操作的全身智能。[1-4] 】

② 谷歌 DeepMind 在 7 月末发布的 Gemini Robotics 2 介绍文档中强调了由三款模型组合形成的「智能层」(Intelligence Layer)及其为机器人带来的全身智能。[1-1] 

③ Current Robotics、与 Symbiosis Robotics(共生知行)等初创团队同样在最新成果中展示了机器人系统在全身协调性的突破,并引起大量关注。[1-5] [1-6] 

技术路线的非共识下,近期工作如何实现 WBI?

1、尽管「走向全身智能」已成为具身智能学术界与工业界对下一阶段的共同追求,但由于不同团队在系统架构的选择、数据采集范式的定义以及动作生成引擎的底层设计上均存在既有的非共识,业界对于如何构建 WBI 系统同样存在路线差异。

2、Google DeepMind 在 7 月 Gemini Robotics 2 工作中采用了一种分工明确的三模型堆栈架构,通过兼顾大模型的长程推理能力与本地的高频响应需求。

① 该工作通过组合 VLA 模型 Gemini Robotics 2、具身推理模型 Gemini Robotics ER 2(VLM)和轻量级 VLA 模型 Gemini Robotics On-Device 2 三款模型,以「ER 2」作为高级大脑进行决策,协调 VLA 执行动作完成任务...

 关注👇🏻「机器之心PRO会员」,前往「收件箱」查看完整解读 

未经允许不得转载: 街坊秀 » 从 VLA 到 WBI,具身智能的大脑在如何改变?