(来源:让你更懂AI的 PaperWeekly)
DeepMind 最新工作证明,优化大模型未必需要继续堆参数。改变 Transformer 内部状态传播方式,同样可以释放新的性能空间。
模型训练结束,Transformer 的架构就彻底定型了吗?
DeepMind 最近的一项工作,把改动放到了 Transformer 的内部信息流上。基础模型权重保持不变,只在推理阶段打通一条信息回路,深层已经形成的状态就能重新进入后续计算。
这套机制被称为 Recirculation。它针对的是 Transformer 一个长期存在的结构限制。
语义消歧和状态更新往往要到较深的 layer 才逐渐稳定下来,但前馈结构决定了浅层计算不会重新读取这些后来形成的信息。后续 token 因而很难持续利用已经在深层完成更新的状态。
更重要的是,这一机制无需修改原模型权重,基础版本甚至可以直接作用于已经训练好的模型。
研究团队随后又加入一个小型 MLP,根据当前 token 在源层和目标层的表示,逐维预测回流系数。
Gemma3 主体权重依旧冻结,在 9 个语言建模数据集上,平均困惑度降幅达到 23.0%,略高于全量微调的 21.6%。
论文标题:
Recirculation
论文地址:
https://arxiv.org/abs/2608.17981
Transformer 为何需要一条回路?
在包含 fishing pole 的上下文中,模型在较深 layer 已经能够将 bank 正确理解为“河岸”。但继续往后询问附近有没有 ATM,它仍可能重新受到 bank 与金融机构之间强关联的影响。
〓上下文语义消歧案例
此前相关研究做过一次激活干预,将已经完成消歧的深层表示重新注入浅层,这类上下文化错误随之减少约 60%。
标准 Transformer 中,一个 token 的状态主要沿网络深度逐层更新。如果某个重要状态直到较深的位置才形成,它留给后续串行计算的空间也已经很少。
另一种延长计算过程的方式是 CoT。它可以把中间结果显式写入 token 序列,从而增加额外的串行计算步骤,但更适合复杂推理。Recirculation 关注的是内部状态本身如何在后续 token 中持续更新。
〓Recirculation 引入的深浅层回流通路
深层激活如何重新流回浅层
基础 Recirculation 的计算并不复杂。模型处理当前 token 时,从较深的源层 (s) 读取激活,再与较浅目标层 (d) 的原有状态混合。
其中, 控制深层状态的回流强度, 控制目标层原有状态保留多少。论文默认使用凸组合,即 。
不同 layer 的残差流尺度并不一致,直接相加容易让某一侧占据主导,因此源层激活还要先对齐到目标层的 L2 范数。
论文认为,这种跨层融合与 Transformer 残差流中不同 layer 的表示共享同一残差表示空间有关,使深层信息具备直接参与后续计算的可能。
在 Gemma3 上,1B、4B、12B 找到的较优源层→目标层组合分别是11→4、18→9、35→16。
这种设计和常见的 Looping(层循环)也并不相同。后者主要在网络深度方向重复执行若干层,Recirculation 则同时跨越网络深度和 token 时间,同一 Layer 可以持续承载更新后的状态。
论文主体实验只增加一次回流,如果不断重复,整个系统会逐渐呈现真正循环神经网络的特征。
〓Looping 与 Recirculation 对应不同的状态传播方式
权重不动,收益已经出现
在 Gemma3 1B、4B、12B 上测试 10 个数据集后,Recirculation 在其中 9 个上表现出跨规模的稳定改善。
以 12B 为例,PG19 的困惑度下降 35.40%,BookSum 下降 32.91%,GovReport 下降 30.74%。Lambada 是主要例外。
〓不同模型规模下的语言建模性能变化
不过,目前最稳定的收益主要还是集中在语言建模上。到了下游任务,效果对具体任务和设置更加敏感,并不是所有实验都会一致提升。
研究团队继续测试 Qwen3 1.7B、Pythia 1B、Ministral3 3B 和 Phi2 2.7B,五个模型家族都观察到了有效的源层—目标层组合。
Gemma3 的收益大约在 5%,其余模型在没有针对各自架构重新优化归一化和回流强度的情况下低于 0.5%。
〓不同 Transformer 架构的有效回流区域
研究团队还单独追踪了一个 token 回流之后的影响。收益会随着 token 间距逐渐衰减,但在相隔 256 token 时仍然可以测到。
不同词性的差异也很明显,副词、形容词和动词受益较多,数词、限定词和代词相对较少。
〓回流影响的 token 距离与词性分析
指令遵循实验中,Gemma3 4B 的准确率从 82.3% 提升到 87.3%,12B 从 93.0% 提升到 98.4%。
但标准单 token 任务总体只有小幅改善,上下文化测试中也有部分设置没有获得收益。
工程代价主要落在 Prefill。自回归生成时,两套 Transformer 计算可以并行执行,论文报告额外生成延迟几乎可以忽略。
Prefill 则必须按 token 顺序更新回流状态,长上下文下会明显拖慢处理速度。
小模块反超全量微调
固定的 和 会对所有 token 和隐藏维度使用相同的控制策略,但不同 token 和不同状态需要融合深层信息的程度并不相同。
研究团队因此训练了一个小型 MLP,根据当前 token 在源层和目标层的表示,动态生成逐维回流系数。
这里的 Gemma3 主体始终冻结,训练的只有控制回流方式的模块。
实验比较了固定系数、可学习标量、token 条件标量、固定向量、token 条件向量以及全量微调等方案。
结果显示,逐维控制优于标量控制,根据当前 token 动态生成系数又优于固定参数。
最终的 Adaptive Recirculation 在 9 个语言建模数据集上的平均困惑度降幅达到 23.0%。固定基础版本为 8.5%,对加入回流结构的 Gemma3 1B 进行全量微调后达到 21.6%。
〓token 条件的逐维回流取得最高平均困惑度降幅
在数学推理任务 GSM8K 上,Adaptive Recirculation 也同样带来了性能提升。
Gemma3 4B 的 pass@1 从基础模型的 29.3% 提升至 35.5%,相对提升约 21%;pass@128 则从 94.9% 提升至 96.0%。
论文也发现,Adaptive Recirculation 的效果依赖用于训练 MLP 控制器的数据分布,在不同任务数据上训练可能导致收益变化。
结语
Recirculation 的价值并不只是降低困惑度,而是在 Transformer 已经广泛应用的结构中,重新探索信息流动方式。
它目前还不是一个可以直接替代微调的通用方案,但证明了一个重要可能:冻结模型权重后,改变内部状态传播方式,同样可以释放新的性能空间。