街坊秀 街坊秀

当前位置: 首页 » 街坊资讯 »

强化学习之父Sutton最新访谈:合成数据是巨大错误,大模型只完成了四分之一的智能

  炒股就看金麒麟分析师研报,权威,专业,及时,全面,助您挖掘潜力主题机会!

(来源:DeepTech深科技)

当前,大模型主要通过预训练和后训练获得能力,上线后参数通常不再更新,只能借助上下文、知识库或重新训练适应变化。如何让 AI 在部署后持续学习,正成为行业需要突破的基础问题。

8 月 18 日,红杉资本旗下播客《Training Data》发布了一期围绕 AI 持续学习的对谈,受访者为强化学习奠基人、2024 年图灵奖得主 Rich Sutton。此外,参与访谈的嘉宾还有 Sutton 的前学生、Oak Lab 联合创始人 Khurram Javed,对谈由红杉资本合伙人 Sonya Huang 和 Alfred Lin 主持。

访谈从 Sutton 2019 年发表的《苦涩的教训》谈起,延伸至合成数据、世界模型和持续学习,并讨论智能体如何从真实经验中形成抽象概念。Sutton 认为,部署后便停止改变的模型,还称不上完整的智能系统。大模型虽是重要突破,却主要解决了语言能力,只覆盖智能的一部分。

基于这一判断,Sutton 正将持续学习推进为一条完整的技术路线。就在上个月,他与 Khurram Javed 创立 AI 初创公司 Oak Lab,并提出以经验学习、时间抽象和规划为核心的 OaK 架构,希望智能体能从连续经历中实时学习,不断更新认知并改进决策。

“止步不前”的智能

在今天,大模型看起来无所不知,却有一个容易被忽略的特点:它们的大部分能力都在上线前形成,经过预训练和后训练后,模型参数便基本固定。此后即使每天接触大量用户和新信息,也不会像人一样把这些经历转化为新的长期能力。

图|访谈现场(来源:YouTube)

Sutton 认为,这种静态范式混淆了知识与学习的边界。尽管模型可以记住一段对话,也可以借助外部知识库回答最新问题,但这些都不等于真正的学习。

这是因为上下文只是暂时改变模型当前能够看到的信息,模型内部的知识结构并未随之更新。另外,当对话结束或窗口被清空后,这些信息也可能随之消失。

这一区别在产品端并不明显。一个 AI 助手可以根据用户反馈修改答案,甚至借助记忆功能表现得越来越了解用户,给人一种“它正在学习”的感觉。但如果模型权重没有变化,那么它只是利用当前提供的信息完成推理,并没有形成可以长期保留的新认识。

不过,让模型继续更新参数,也没有想象中简单。Khurram Javed 等人在《Nature》发表的研究显示,标准深度学习模型在接连学习新任务时,吸收新知识的能力会逐渐下降。研究人员将这种现象称为“可塑性损失”,也就是模型训练得越久,反而越难学会新的东西。

为解决这一问题,现有训练方式往往会采用大量混合数据。Khurram Javed 解释,现有训练通常借助大批量数据,减弱单个样本对原有能力的冲击。但随着真实经验不断增多,而智能体需要保存并反复训练全部历史数据,计算和存储成本将答复增加。

合成数据因此被不少研究者视为一种解决方案。既然高质量的人类数据有限,就让模型自动生成题目、回答或模拟环境,再用这些内容训练下一代模型。

不过,Sutton 在访谈中将这种路径称为一个“巨大的错误”。在他看来,它扩大了数据规模,却没有改变 AI 依赖外部数据生产者的基本方式。

Sutton 指出,任何模拟环境都只能保留现实的一部分,许多因素很难被完整写入模拟器。合成的世界可以很大,但它仍然由有限规则构成,与现实的复杂程度存在差距。

在访谈中,Sutton 又以自动驾驶为例。企业可以让车辆在模拟环境中行驶数十亿公里,再由工程师根据真实路测调整系统。他认为,更合理的路径应当是让车辆直接从驾驶经验中发现预测偏差、修正环境模型,并将新的认识用于下一次决策。

这也是 Sutton 重提“苦涩的教训”的原因。他认为,能够利用更多计算资源、从数据中自主发现规律的通用方法,最终将胜过植入大量专家知识的系统。例如,AlphaGo Zero 未使用人类棋谱训练,仅凭自我对弈便击败此前的 AlphaGo。

大语言模型在一定程度上延续了这条路线。尽管它没有依靠专家逐条编写规则,而是从大规模文本和计算中学习语言结构。但 Sutton 认为,互联网文本终究是由人类整理出来的有限知识,如果模型始终依赖更多文本和人工反馈,它的进步仍会受到人类数据供给能力的限制。

不过,Sutton 也明确表示,他并不主张抛弃已有知识。而问题在于,当前模型常常把这些知识固定在部署前的参数中,此后只负责调用,很少用新的经历检验和修正它们。

他预测,当前大模型可能只覆盖了智能的四分之一,剩余部分还包括感知、行动、规划,以及在长期经验中持续改变自身的能力。缺少这些环节,模型即使再博学,也只能停留在上线时的状态。

Oak Lab 要实现持续学习

Sutton 团队认为,实现真正的持续学习,核心在于解决深度学习中的灾难性遗忘问题。朴素的单样本权重更新会快速覆盖原有知识,让模型失去之前积累的能力,这也是过去持续学习难以落地的核心障碍。

为解决这一问题,他们提出两个关键的技术方向:第一个方向是“步长优化”,通过为不同参数设置不同的更新速度,已经承载稳定知识的参数变化较慢,需要学习新内容的部分则可以更快调整。第二个是“生成与检验”,即不断提出新的内部特征或神经单元,再检验它们是否有助于模型学习。

基于上述思路,团队提出“持续反向传播”算法,相关成果此前已于《Nature》发表。这种算法在标准反向传播的基础上,持续加入少量随机初始化的新单元,再由反向传播检验其价值。Sutton 认为,如果将这一机制与步长优化结合,有望形成新一代持续深度学习算法。

不过,这类算法不能直接套用在已经训练好的静态模型上,而要用它们从头训练新的基础模型。模型在积累知识的同时,也会学习今后应当如何更新自身,从而有望在吸收新知识时减少对原有能力的破坏。

持续深度学习只是第一步,更长远的目标是让模型自主构建抽象与世界模型。Sutton 认为,当前的 AI 系统要么使用人类预设的规则模型,要么只能做低层级的时序预测,目前还无法自主生成高层抽象并基于抽象进行规划推理。

Sutton 团队最大的野心,是构建覆盖从微观细节到宏观决策的全谱系知识系统。真正的心智应该可以持续更新,同时始终保持内在的自洽与连贯,不会因为持续学习陷入混乱。

图|Oak Lab首页(来源:公司官网)

这也正是 Oak Lab 的核心使命。这家成立于 2026 年 7 月的初创公司,目标是在五到十年内打造出万亿参数规模、运行功耗仅 20 瓦的持续学习心智模型。

20 瓦大致和人类大脑的功耗水平相当,这意味着智能的提升不再单纯依赖算力堆砌,而是通过算法效率的飞跃实现。

针对这一目标,Sutton 按照摩尔定律作出估算:如果计算效率每 18 个月提高一倍,10 年大约可以带来两个数量级的提升。这意味着,假如现在能以约 2,000 瓦实现相应规模,未来将可能将功耗降至 20 瓦。

不过,最终形态不会是一个无所不能的单一心智。由于没有任何单个系统可以学完所有知识,同一种基础架构会衍生出大量不同的实例。按照两人的设想,同一种基础架构会产生多个智能体,它们因所处环境和自身经历不同,形成各自的知识与能力。

谈到公司的未来,Khurram Javed 表示,Oak Lab 初期不会追求快速扩张。新范式需要团队成员对研究方向形成高度共识,因此公司将从小规模团队起步,再逐步扩充至数个核心小组,以保持研究效率和方向一致。

参考资料:

1.https://www.youtube.com/watch?v=xH7U7w9Qzlo

2.https://oaklab.ai/mission

运营/排版:何晨龙

注:封面/首图由 AI 辅助生成

未经允许不得转载: 街坊秀 » 强化学习之父Sutton最新访谈:合成数据是巨大错误,大模型只完成了四分之一的智能