来源:环球网
【环球网科技报道 记者 秦耳】今年国内AI产业浪潮里,物理AI无疑是最受瞩目的赛道。如果说通用大模型擅长理解人类构建的符号世界,聚焦语言与知识处理;那么物理世界大模型则通过学习真实世界的物理因果关系,完成环境状态推演,直面现实场景的复杂挑战。而我国具备深厚积淀的制造业,恰好为物理AI提供了广阔的落地土壤。
然而,学术界对当前世界大模型的前景抱有不同态度。一些业内专家认为,由于物理现实世界内存在无数物理效应,过于繁杂的参数会是世界大模型的“拦路虎”。不过,更多的业内人士对于更为宽泛的物理AI发展前景充满信心。在他们看来,如果将应用场景设定在特定的可控场景之中,形成专属于特定领域的行业大模型,那么就无需追求包罗万象的通用能力,转而聚焦场景内的物理规则与业务逻辑,更容易实现安全、可靠的规模化产业落地。例如,特斯拉的最新一代自动驾驶AI通过在真实世界中进行有限的上手操作+看视频,就足以让机器人AI理解真实世界。
在行业积极探寻物理 AI 可行落地方案的大背景下,国内物理 AI 领域的头部探索者光象科技,8 月 25 日联合清华大学李升波教授课题组发布了第一代物理原生世界模型,即Phi-WM 1.0 ActEffect,简称ActEffect,落地 “物理原生智能(Phi)” 技术路线,为具身智能行业提供全新思路。围绕行业技术瓶颈、模型底层逻辑、数据壁垒、产业落地等核心议题,光象实验室首席科学家吕尧分享了其对物理原生世界模型以及行业发展趋势的见解。
在吕尧看来,当前行业广泛采用的纯视频预测方案,虽然能够依托数据规模法则实现性能提升,但这套统计拟合路线存在难以逾越的天花板。仅仅学习输入与输出之间的映射关系,缺少物理规律与结构约束,模型会始终受困于幻觉问题,很难把任务成功率从 99% 推进到 100%。想要让机器人真正可靠完成任务,不能只靠拟合海量示范数据,必须在训练过程中遵守客观物理规律与动作因果,让模型理解动作如何改变现实世界,这也是光象科技打造物理原生模型的核心初衷。
“真正在底层理解世界规律,而不是依靠不断的数据输入和尝试来拟合结果。”吕尧讲到。
实际上,光象科技探索的物理AI路径符合AI发展方向。早期,DeepMind所开发AlphaGo Zero探索出只输入围棋规则,完成对围棋的学习。而光象的路径与AlphaGo Zero异曲同工,选择隐状态空间路线,不去复刻画面全部细节,只提取和任务强相关的状态信号,在特征空间完成状态转移学习,以此输出可靠动作。物理原生模型从数据中习得底层物理规律之后,面对全新场景只需要少量数据即可完成迁移,知识的可泛化、可迁移是该路线的重要价值。
与此同时,吕尧谈到物理AI进一步发展,需要梳理清楚不同来源和质量的数据职能,并且灵活调配仿真数据与真实数据的训练占比,但仿真数据必须占据绝对主导地位。想要学习物理世界的状态变迁,需要海量同一状态下不同动作带来不同结果的反事实对比信号,仿真环境是唯一可以低成本大批量可控产出这类数据的途径,这类数据的需求量,甚至会达到真实示范数据的数十至上百倍。吕尧预判,面向具身智能的自进化模式会在今年下半年成为行业热点,但距离真正成熟落地,还需要经历一段技术打磨周期。
值得一提的是,光象科技特别厘清了ActEffect 的定位。他表示,对外发布的 ActEffect 属于底层通用基础模型,未来会以该基座为原点,蒸馏适配不同垂直场景的专用模型。而现阶段已经在工业真实场景投入使用的模型,沿用相同的技术路径,但训练目标更加聚焦,专门打磨面向具体场景可复用的泛化技能,并非直接把通用底层模型拿来上线使用。
作为物理原生智能的首个模型化实现,物理原生世界模型ActEffect 完成三方面技术创新,在 LIBERO、LIBERO‑PLUS 和 RoboCasa‑GR1 三项国际通用机器人操作基准测试中分别取得 98.8%、80.3% 和 67.5% 的平均成功率,多项指标实现对比领先;该模型可一次性生成三套精细程度各异的动作方案,并对各方案的潜在执行结果开展预测比对,从中选出最优方案,还会按层级迭代优化动作方案以规避虚假改进,要求精调方案预测效果优于粗调方案、粗调方案优于初始方案,同时依靠技术机制保障精调方案的性能提升源于自身迭代优化,并非靠压低其余方案的评估得分实现。
在谈及算法护城河的构建。吕尧认为,光象的壁垒来自数据与算法双重维度。数据层面,高保真仿真资产如何大规模产出反事实、动作干预类训练信号,再通过强化学习挖掘这些信号学习世界状态转移规律,其中蕴藏大量行业 Know‑how。
即便对手可以通过模型蒸馏复制最终模型的输出能力,整套强化学习训练流程却很难被复刻。调度大规模并行仿真环境、调配不同质量等级的训练数据,这属于训练过程层面的逻辑,不属于模型权重承载的知识,蒸馏手段无法把这部分核心能力直接带走。
“真正稀缺的是能够帮助模型理解物理世界状态如何转移,以及何种动作导致任务成功或失败的数据。从中学习客观的物理准则和因果规律,这是模型最核心的能力来源。”吕尧坦言。