街坊秀 街坊秀

当前位置: 首页 » 街坊资讯 »

τ0-VLA如何用"世界模型"给机器人装上大脑的刹车片

  炒股就看金麒麟分析师研报,权威,专业,及时,全面,助您挖掘潜力主题机会!

(来源:科技行者)

你有没有想过这样一个场景:你让一个机器人去做奶茶,它需要先放杯子,加配料,倒牛奶,倒茶,封口,插吸管,一共十几个步骤。

如果机器人在第三步就选错了动作,比如该加珍珠的时候去倒了牛奶,会发生什么?

答案是:没有任何补救的余地。

机器人不是"手抖了一下",它是把整个动作完美地执行了,只是这个动作从一开始就选错了。就像你去银行办事,排错了窗口,哪怕你在那个窗口把表格填得再工整、态度再礼貌,办的也不是你要办的业务。动作层面的精确,救不了决策层面的错误。

这正是当下机器人研究里一个挺让人头疼的问题。过去几年,大家把很多精力花在了怎么让机器人的动作更精准、更丝滑上,但很少有人认真思考:机器人在漫长的任务里,怎么知道"现在该做什么"?

Agibot Finch团队和上海创新研究院联合发布的τ0-VLA,就是奔着这个问题去的。这篇论文的核心洞察其实很朴素:与其等机器人做错了再收拾烂摊子,不如让它在动手之前,先在脑子里"预演"一下几种可能的选择,看看哪种更靠谱。

这篇文章我会带你把这套系统从头到尾捋一遍,包括它怎么"想象"未来、怎么打分、怎么记住自己做到哪一步了,以及这套东西在真实机器人身上跑起来到底表现如何。

长任务里,真正的瓶颈不是动作,是决策

先说说这个领域此前卡在哪儿。

市面上已经有不少能干活的机器人大模型,比如π0、GR00T N1.7、LingBot-VLA,这些模型统称为VLA。

VLA(Vision-Language-Action Model):视觉-语言-动作模型,简单说就是一个能看懂画面、听懂指令、然后直接输出机器人动作指令的AI系统,是目前机器人领域最主流的技术路线。

这些模型确实解决了"怎么把话变成动作"这个问题,但它们大多数有一个共同的软肋:面对需要几分钟甚至十几分钟才能完成的复杂任务时,它们往往是"一条道走到黑"式地生成动作,或者哪怕引入了分层结构,也是每一步决策都只过一次脑子,不会停下来比较几种方案。

打个比方,这就像让一个新手厨师做一道复杂的菜,但不给他任何"回头看一眼菜谱"的机会,他必须凭直觉一路做到底。如果某个环节记错了顺序,比如先放盐还是先炒鸡蛋,他不会意识到自己错了,只会硬着头皮往下走,直到最后端出一盘不对劲的菜。

论文里举了一个特别典型的例子,叫"西红柿炒蛋"任务里的放盐问题。放盐这个动作,在画面上几乎看不出明显变化,机器人如果没有一个专门的记忆去记录"我是不是已经放过盐了",它要么会重复放盐,要么干脆漏掉这一步。这两种情况都会导致任务失败。这不是执行精度的问题,是记忆和判断力的问题。

那有没有更好的思路?论文提到,语言模型领域早就有答案了。像DeepSeek-R1、OpenAI o1这些模型,已经证明了一件事:给推理过程分配更多计算量,能显著提升回答质量,这就是所谓的测试时计算(Test-Time Computation)。

测试时计算(Test-Time Computation, TTC):不是在训练阶段花更多时间学习,而是在真正回答问题、做决策的那一刻,允许模型多想一会儿、多比较几个方案,再给出最终答案。

问题来了,这套思路能不能搬到机器人身上?

论文作者的判断是:能,但不能照搬。语言模型的推理是纯文字层面的比较,不涉及真实的物理世界。而机器人不一样,机器人的每一个决策都会实实在在地改变环境的状态。你在语言模型里让GPT多想几步,顶多是浪费了几秒钟的算力;但机器人如果做错了一个动作,可能就把一个鸡蛋摔碎了,这个代价是真实且不可逆的。

所以τ0-VLA面临的真正挑战是:怎么在机器人真正动手之前,就大致预测出"如果按这个方案做,会得到什么样的画面结果",然后拿这个预测结果去比较哪个方案更好。

这就引出了这篇论文最核心的设计:世界模型引导的搜索。

三个"小分身"协作:提议、想象、打分

τ0-VLA把这件事拆解成了一套流程,论文里叫"propose-predict-evaluate"循环,翻译过来就是"提议-预测-评估"。

具体来说,这套高层决策系统里有四个角色。

提议模型(Proposal Model):负责根据当前画面和历史记忆,生成一个或多个候选的下一步动作建议,比如"拿起勺子"或者"把杯子放好"。

世界模型(World Model):这是整套系统里最有意思的部分。它不是用来生成动作的,而是用来"想象"的。给它一张当前的画面和一个候选动作,它会预测出如果真的执行了这个动作,最终画面会变成什么样子。

价值模型(Value Model):拿到世界模型想象出的画面后,价值模型会给这个想象结果打分,判断这个候选动作到底是不是朝着任务目标在推进。

反思模型(Reflective Model):在搜索完成之后,综合所有保留下来的候选路径,给出最终决定。

这四个角色是怎么配合的?论文用了一个叫束搜索(Beam Search)的经典算法框架。

束搜索:一种不会把所有可能性都算一遍,但也不会只赌一个方案的搜索方法。它每一步只保留得分最高的几个候选分支,然后继续往下扩展这几个分支,像是一棵不断修剪枝叶的决策树。

具体的流程是这样的:提议模型先抛出N个候选动作,比如"拿勺子""放杯子""拿杯子"三个选项。世界模型分别针对这三个选项,想象出执行完之后画面会是什么样。价值模型给这三个想象结果打分,比如0.95、0.50、0.95。系统只保留分数最高的几个分支,把分数低的直接砍掉。

这个过程可以重复好几轮,每一轮都是"提议一个更长的动作序列-想象结果-打分-筛选"。论文里管这个叫depth(搜索深度),你可以理解成"往前多想几步"。到了设定的深度之后,反思模型会看着所有保留下来的候选路径,以及它们各自想象出的最终画面,做出最终判断,这个判断不一定要照抄某个候选,它可以自己综合信息生成一个更合适的答案。

这里有个细节挺关键的:这一整套"提议-想象-打分"的搜索过程,并不是每次决策都要跑。

论文设计了一个自适应路由机制,通过分析提议模型生成文字时的置信度(具体是token的概率和logit差值),来判断这次决策是不是"有把握"。如果有把握,直接用提议模型的第一次答案,走快速通道;如果没把握,才启动那套完整的搜索流程。

这个设计其实特别符合我们人类做决策的方式。你早上决定穿哪件衣服,大概率是瞬间反应,不会犹豫;但你决定要不要接受一个工作邀约,可能会反复权衡好几天。把有限的"深思熟虑"用在真正需要的地方,这是聪明的资源分配,而不是每件事都用同一个标准去死磕。

如果不做这个路由判断会怎样?那就意味着机器人在每一个决策点上,不管难易程度,都要跑一遍完整的搜索,计算成本会白白浪费在那些本来一眼就能看出答案的简单决策上,系统的响应速度也会被拖慢。这就好比开车时,不管是走熟悉的小区门口还是走陌生的复杂立交桥,你都要停下来看十分钟地图,这显然没有必要。

那这套搜索到底带来了多大的提升?论文给出了具体数字。在"整理书本"这个任务里(需要机器人判断该交换哪两本书的位置来排序),面对训练时没见过的初始排列(论文叫OOD,即分布外情况),只用一次决策的方法准确率只有50%,而用了完整搜索流程之后,准确率提升到了74%,提升了24个百分点。

这个数字意味着什么?意味着在陌生情况下,原来的方法有一半的时间会给出错误判断,而搜索之后,机器人能答对四分之三的情况。这个差距,在需要连续十几步都不出错才能算成功的长任务里,是决定成败的关键。

记忆不是越准越好,是要能"自我纠错"

光有搜索还不够,τ0-VLA还要解决一个更底层的问题:机器人怎么记住自己做到哪一步了?

这就引出了论文里的执行记忆(Execution Memory)机制。

执行记忆:一个会随着任务推进不断更新的"进度笔记",记录着哪些步骤已经完成、哪些还没做、遇到了什么问题。这不是简单的历史录像,而是被压缩和提炼过的、对当前决策有用的信息。

这里有个特别有意思的设计,论文管它叫"记忆扰动训练"。

研究者们没有额外雇人去标注"如果机器人记忆出错了应该怎么办"这种数据,而是拿现成的示范数据,人为地把记忆搞乱,制造出几种典型的错误场景,然后训练模型学会怎么把记忆纠正回来。

论文里列出了具体的错误类型。有一种叫"记忆滞后",就是机器人的记忆还停留在上一步,没跟上眼前的画面;还有一种叫"记忆超前",机器人过于乐观地以为自己已经做完了好几步,实际上还没有;还有一种是"执行失败没被发现",比如抓取失败了,但记忆里没有记录这次失败。

针对这几种情况,模型被训练去识别当前画面和记忆之间的矛盾,然后把记忆修正到跟画面一致的状态,再决定下一步该做什么。

这套机制解决的问题是什么?我们平时说"好记性不如烂笔头",但烂笔头也可能记错。如果你出差回来发现日历上记的会议时间跟同事说的对不上,你不会死板地相信日历,你会去核实到底哪个是对的,然后修正日历,再决定接下来的安排。机器人的执行记忆也是同样的逻辑,它不能一味相信自己之前记录的东西,得学会拿眼前的真实画面去校验、去纠错。

如果没有这套纠错机制会怎样?机器人一旦某一步记忆出错,后面所有基于这个错误记忆做出的决策都会是错的,而且这个错误会不断累积、没有任何自我修复的能力,这在需要执行25步的"打扫房间"这种任务里几乎是灾难性的。

论文里的实验数据也印证了执行记忆的价值。在"打扫房间"任务中,有执行记忆的分层系统能达到5/10的成功率、94.8%的进度得分,而没有这套记忆机制的直接执行版本只有4/10、92.8%的进度。差距虽然看起来不大,但论文特别指出,失败的案例大多集中在挂手提包和后续整理阶段,也就是任务越往后走,记忆的价值越明显。

一个40维的"通用插座":让机器人不挑身体

高层决策解决的是"想清楚要做什么",接下来还得有个底层执行系统能真正把动作做出来,而且这个执行系统还得能适配不同的机器人身体。

τ0-VLA的低层策略用了一个叫统一状态-动作空间的设计。

统一状态-动作空间:不管是轮式人形机器人、双臂固定机械臂,还是移动底盘加机械臂的组合,都用同一套40维的数字向量来表示状态和动作,只是每种机器人只激活其中对它有意义的那部分维度,其余维度直接屏蔽掉。

这套40维的向量里塞下了左右手末端执行器的位置和姿态、夹爪开合度、腰部关节、移动底盘速度、左右臂各8个关节角度,几乎覆盖了当前机器人形态能用到的所有控制维度。

这个设计解决了什么问题?你可以想象一下,如果每种电器都要用不同形状的插座,那你家里得配几十种转换头,出门在外更是寸步难行。手机充电这件事之所以现在方便了很多,很大程度上就是因为Type-C接口逐渐统一了标准,不管是什么品牌的设备,插上去都能用。τ0-VLA想做的就是给不同的机器人身体做一个"统一插座",让同一个AI大脑不用重新学习就能操控不同构造的机器人。

如果不做这种统一,会发生什么?那就意味着每换一种机器人形态,都得重新设计一套动作输出接口,重新训练一遍,之前学到的经验完全没法复用,这对于一个想做"通用机器人大脑"的项目来说是致命的低效。

这个低层策略的核心是一个混合专家结构的动作生成模型,论文里叫Mixture-of-Transformers(MoT)动作专家,配合一个预训练好的视觉语言模型主干网络。

它的工作原理用了一种叫条件流匹配(Conditional Flow Matching)的技术。

条件流匹配:不是直接一步预测出动作,而是先从一堆随机噪声出发,通过学习到的"速度场"一步步把噪声"引导"成真实可执行的动作序列,有点像雕塑家从一块粗糙石料开始,一点点雕琢出最终的形状。

这套低层策略是在40115小时的真实世界数据上训练出来的,这个数据规模相当惊人,数据来源包括人工远程操作、机器人自主试跑积累的数据,还有一种叫UMI的手持采集设备录制的数据。同时,训练过程中还混入了大量图文问答类的多模态数据,目的是让模型在学习动作的同时,不要忘记它原本作为视觉语言模型时具备的语义理解能力。

论文里把整个训练过程分成三个阶段:第一阶段做知识隔离的联合训练,让动作学习不会太快地干扰原有的视觉语言能力;第二阶段把隔离撤掉,让动作梯度和语言梯度充分融合;第三阶段针对每个具体部署任务,用少量任务专属数据做微调。这种循序渐进的训练方式,有点像先分开学游泳的手部动作和腿部动作,练熟了再让全身协调起来游,最后针对不同泳姿再做专项训练。

实测数据:搜索到底带来了多少真金白银的提升

说了这么多设计理念,最终还是要看实际效果。论文在真实机器人上做了大量长任务测试,涵盖打扫房间、准备食材、西红柿炒蛋、做奶茶、收衣服、整理化妆台等六大类任务。

先看整体的分层系统表现。在四个长任务(打扫房间、准备食材、西红柿炒蛋、做奶茶)上,分层系统(带记忆但不带搜索)相比直接执行的τ0-VLA基线,平均成功率从27.5%提升到了45%,平均进度得分从80.1%提升到了87.85%。

在西红柿炒蛋这个任务上,提升尤其明显,直接执行版本的成功率是0/10,而分层系统达到了4/10。前面提到的"放盐"问题在这里体现得淋漓尽致,直接执行的策略要么重复放盐、要么漏掉这一步,而带了执行记忆的分层系统能明确记住这一步是否已经完成。

再看专门针对搜索机制(TTC)的对比实验。论文设计了三种方法做对比:只决策一次的Plan Once、采样多个候选后一次性选择最优的Best-of-N、以及完整的搜索加反思流程TTC。

| 任务场景 | Plan Once | Best-of-N | TTC(本文方法) |

| 做奶茶 | 64.7% | 70.0% | **87.3%** |

| 整理书本(训练内分布) | 66.0% | 83.0% | **88.0%** |

| 整理书本(训练外分布) | 50.0% | 57.5% | **74.0%** |

| 打扫房间 | 72.0% | 74.0% | **87.0%** |

从这张表能看出一个很明确的规律,TTC在所有场景下都是表现最好的,而且在最具挑战性的"训练外分布"场景里,TTC相对于只决策一次的方法提升幅度是最大的,从50%到74%,提升了24个百分点。这也印证了前面说的,搜索机制在面对陌生情况时的价值最突出,毕竟越是常见的、模型见过很多次的场景,一次性决策也大概率是对的,搜索带来的边际收益自然就小;但越是陌生的场景,多想几步、多比较几个方案的价值就越大。

论文还专门测了闭环真实机器人执行的效果,也就是把这套搜索机制真正部署到机器人身上跑一遍完整任务,而不只是离线判断准确率。

| 任务 | Plan Once成功率 | TTC成功率 | Plan Once进度 | TTC进度 |

| 做奶茶 | 5/10 | **7/10** | 91.92% | **95.38%** |

| 整理书本 | 6/10 | **9/10** | 66.67% | **93.33%** |

| 打扫房间 | 5/10 | **7/10** | 94.80% | **97.60%** |

整理书本任务的提升最惊人,成功率从6/10直接跳到9/10,进度得分从66.67%跳到93.33%。这个任务本身就没有固定的执行方案,机器人每一步都得根据当前书本的摆放情况现场判断该交换哪两本书,这种没有标准答案、高度依赖临场判断的任务,恰好是搜索机制大显身手的地方。

论文最后还专门分析了"投入多少计算量能换来多少准确率提升"这个问题,画了一条计算成本和准确率的关系曲线。结果显示,准确率一开始随着计算量增加会快速上升,但涨到一定程度后,提升速度明显放缓,曲线趋于平缓。这个规律其实和很多领域都类似,一开始多投入一点努力,收益立竿见影;但投入到了某个程度之后,继续加码换来的回报会越来越小。这提醒我们,搜索深度和宽度不是越大越好,找到那个性价比最高的区间,才是工程落地时真正要考虑的事。

除了长任务测试,论文还专门在两种额外的机器人平台(ARX AC One和双臂Franka Research 3)上测了低层策略本身的跨平台适应能力,涉及收衣服和整理化妆台两个短任务。τ0-VLA在这些任务上的表现全面超过了对比的GR00T N1.7、LingBot-VLA、π0.5等模型,比如在收衣服任务上达到了10/10的满分成功率和97%的进度得分,在整理化妆台的三个子任务组里也都是全场最高分。这说明这套统一动作空间和训练方式,确实让同一个模型具备了跨越不同机器人身体的适应能力。

写在后面

读完这篇论文,最让我意外的其实是"放盐"这个例子。一个如此微小、几乎不改变画面的动作,竟然成了整套系统设计的关键出发点之一。这提醒我一件事:很多时候AI系统的失败,不是因为它"看不清",而是因为它"记不住自己看过什么"。视觉能力已经很强了,真正拖后腿的常常是那些看不见的、需要靠记忆去维系的中间状态。

另一个值得琢磨的细节是,论文里提到的记忆扰动训练完全不需要额外标注数据,靠的是把现成的示范数据故意打乱、再教模型纠正回来。这种"自己制造错误再学着改正"的思路,某种程度上比单纯堆更多干净数据更聪明,因为现实世界里机器人一定会犯错,提前让它在训练阶段就见过各种错误场景,总比等它真上岗了才第一次遇到要稳妥。

这套方法目前还是built on对束搜索深度和宽度的手工设定上,搜索多深、每步展开几个候选,这些超参数怎么根据任务难度自动调整,论文里提到了计算量和准确率的关系曲线会趋于饱和,但没有给出一个自适应决定搜索预算的机制。如果机器人能像人一样,自己判断"这件事我要不要多想一会儿",而不是靠预先设定好的置信度阈值去触发,会不会是下一步更有意思的方向?

Q&A

Q1:τ0-VLA是什么?

A:τ0-VLA是由Agibot Finch团队联合上海创新研究院发布的一款分层机器人基础模型,它的核心特点是让高层决策模块具备"测试时计算"能力,能在机器人真正动手之前,通过世界模型预测不同候选动作的结果,再选出最优方案,从而提升长任务中的连续决策准确率。

Q2:τ0-VLA和普通的机器人VLA模型有什么区别?

A:普通VLA模型大多是每个决策只过一次脑子,直接输出动作,没有比较和纠错机制。τ0-VLA增加了提议、世界模型想象、价值打分、反思决策四个环节,能在不确定的情况下主动搜索多个候选方案,并结合可自我纠错的执行记忆来跟踪任务进度,这让它在长达十几分钟的复杂任务里表现明显更稳定。

Q3:τ0-VLA的搜索机制真的能提升机器人成功率吗?

A:能,而且提升幅度不小。论文实验显示,在整理书本这类没有固定方案的任务里,加入搜索机制后成功率从6/10提升到9/10,进度得分从66.67%提升到93.33%;在训练数据之外的陌生场景下,下一步预测准确率也从50%提升到了74%。

未经允许不得转载: 街坊秀 » τ0-VLA如何用"世界模型"给机器人装上大脑的刹车片