Together AI 提出 Parcae:稳定循环架构用更少参数达到同等质量
Parcae: Doing more with fewer parameters using stable looped models
Together AI 发布 Parcae,一种通过约束输入注入矩阵谱半径小于 1 来保证训练稳定的循环架构,验证困惑度比此前大规模循环模型最多降低 6.3%。其 770M 模型在相同数据上达到 1.3B Transformer 的质量,用约一半参数取得同等表现,并首次给出循环的缩放规律,发现计算最优训练需要同步增加循环次数与数据量。团队已开源训练代码与模型。
Parcae 用稳定性约束让循环架构可训练,并给出循环的缩放规律,为参数受限场景提供了一条可复用的思路。
译文尚不完整,完整内容请切换到原文。

充分利用你的参数
传统的缩放定律告诉我们,为了达到最佳性能,我们需要扩展 FLOPs,通常需要更多参数或数据。但随着模型走向边缘,推理成本飙升,我们不禁要问:我们能否在不增加内存占用的情况下提升质量?
为此,我们一直在探索循环架构,即通过将激活多次传递通过相同层来增加计算的模型。虽然前景广阔,但这些模型训练不稳定。我们直接解决了这个问题,并推出了 Parcae,一种稳定的循环架构,它:
- 优于先前的循环模型:Parcae 相比之前的大规模循环方案,验证困惑度最多降低 6.3%。
- 以小博大:我们的 770M Parcae 达到了在相同数据上训练的 1.3B 参数 transformer 的质量,以大约一半的参数实现了相同的性能。
- 可预测地扩展:我们建立了首个循环缩放定律,发现计算最优训练需要同步增加循环次数和数据量。
循环模型很酷,但实际训练很难
随着模型走向边缘,推理部署占据的计算比例越来越大,人们对在不增加参数的情况下提升模型质量越来越感兴趣。我们一直感到兴奋的一种机制是层循环,早期工作已经训练出循环模型,其质量可与更大的固定深度架构相媲美。
要将普通 Transformer 转变为循环模型,我们遵循先前工作,将其层划分为三个功能块:一个前奏($\mathcal{P}$)、一个循环($\mathcal{R}$)和一个尾声($\mathcal{C}$)。前向传播分三个阶段进行:
- 嵌入:前奏将输入转换为潜在状态 $e$。
- Recurrence: The recurrent block iteratively updates a hidden state $h_t$ for $T$ loops. To maintain the input’s influence, $e$ is injected into each loop, typically via addition <a id="cite-1" href="#ref-1">[1]</a> ($h_{t+1} = \mathcal{R}(h_t + e)$) or concatenation with projection <a id="cite-2" href="#ref-2">[2]</a> ($h_{t+1} = \mathcal{R}(W[h_t; e])$).
- 输出:尾声处理最终的 $h_T$ 以生成模型的输出。

Unfortunately, looped models are a headache to train <a id="cite-2b" href="#ref-2">[2]</a><a id="cite-3" href="#ref-3">[3]</a><a id="cite-4" href="#ref-4">[4]</a>. We personally found them to suffer from residual state explosion and loss spikes. What makes looped models even trickier is that the recurrent block is composed of several vanilla Transformer blocks, making it difficult to reason about the source of instability.

理解循环的不稳定性
虽然不稳定性是个难以捉摸的敌人,但我们观察到,一个简单的线性框架捕捉到了不稳定的一个重要来源。具体来说,我们将循环重新表述为残差上的非线性时变动力系统,其更新规则为:
$$h_{t+1} = \overline{A} h_t + \overline{B} e + \overline{\mathcal{R}}(h_t, e)$$
其中 $\overline{A}, \overline{B}$ 执行注入,$\overline{\mathcal{R}}$ 是 Transformer 块对残差流的贡献。对于关注次二次序列混合的爱好者来说,请注意,如果我们忽略非线性项 $\overline{\mathcal{R}}$,所得系统在模型深度上是一个关于残差状态的离散线性时不变(LTI)动力系统。
很酷的是,对于离散 LTI 系统,其稳定性和收敛性由 $\overline{A}$ 的特征值决定。具体来说,稳定性使用谱范数 $\rho(\overline{A})$(即 $\overline{A}$ 的绝对值最大的特征值)来分类,稳定系统(收敛)为 $\rho(\overline{A})<1$,不稳定(发散)系统为 $\rho(\overline{A})=1$。

虽然这一分析绕过了循环的非线性(例如 Attention 和 MLP 单元),但上表和上图证实了我们的分析在经验上很重要:发散的运行学习到的谱半径为 $\rho(\overline{A}) \geq 1$,而收敛的运行保持 $\rho(\overline{A}) < 1$。当我们用 Parcae 维持 LTI 条件时,循环模型对超参数选择变得显著更加鲁棒。
Parcae:一个稳定、省心的循环模型
那么我们如何稳定呢?我们设计了一个新的循环模型 Parcae,它通过构造显式地维持上一节中观察到的稳定性条件。具体来说,我们使用连续公式 $A, B$ 来参数化输入注入参数,并用 ZOH 和 Euler 方案将其离散化(即 $\overline{A} = \exp(\Delta A)$ 和 $\overline{B} = \Delta B$),使用一个学习到的 $\Delta \in \mathbb{R}^{d_h}$。然后我们将 $A := \texttt{Diag}(-\exp(\texttt{log}_A))$ 约束为负对角矩阵,其中向量的 $\texttt{Diag}(-\exp(\cdot))$ 强制为负,$\texttt{log}_A\in \mathbb{R}^{d_h}$ 是我们的可学习向量。这确保了 $\rho(\overline{A}) < 1$!
那么,我们是否已经解决了所有问题并稳定了循环模型?不幸的是,为了干净地训练 Parcae,仍然需要几个其他小技巧。有兴趣的读者请查看我们的[论文](link)。
回到语言建模:扩展 Parcae
Parcae 不仅训练更可靠,而且我们发现与之前的 RDM 相比,它能产生更高质量的模型。使用 RDM <a id="cite-2c" href="#ref-2">[2]</a>(一个先前的循环模型)的完全相同设置,我们针对参数和数据匹配的 RDM 进行了测试,观察到 Parcae 将验证困惑度降低了多达 6.3%。
| 参数 & 模型 | 验证 PPL (↓) |
|---|---|
| 100M 规模 | |
| └ RDM | 14.23 |
| └ Parcae | 13.59 |
| 350M 规模 | |
| └ RDM | 10.76 |
| └ Parcae | 10.09 |
当将一个非常强的 Transformer 基线改装为 RDM 时,在没有任何超参数调优的情况下,我们发现 Parcae 对 RDM 具有鲁棒性(而 RDM 直接发散了)。
| 参数 & 模型 | 验证损失 (↓) | Core (↑) | Core-Extended (↑) |
|---|---|---|---|
| RDM | 发散 | 发散 | 发散 |
| + Parcae 约束 A | 2.97 | 13.2 ± 0.2 | 9.1 ± 0.5 |
| + 所有 Parcae 技巧 | 2.95 | 14.0 ± 0.2 | 9.7 ± 0.3 |
我们还把 Parcae 用作标准固定深度 Transformer 的直接替代品。使用受 nanochat 启发的设置,我们在 FineWeb-Edu 上训练了一系列语言模型,参数量最高达 1.3B。我们发现 Parcae 在所有参数和数据匹配的 Transformer 上都表现更优,我们的 770M Parcae 模型几乎达到了其两倍大小的 Transformer 的下游质量!
| 参数与模型 | 验证困惑度 (↓) | 核心 (↑) | 核心扩展 (↑) |
|---|---|---|---|
| 140M 规模 | |||
| └ Transformer | 21.48 | 13.00 ± 0.15 | 8.80 ± 0.21 |
| └ Parcae | 19.06 | 14.04 ± 0.20 | 9.67 ± 0.28 |
| 370M 规模 | |||
| └ Transformer | 15.79 | 17.46 ± 0.03 | 11.71 ± 0.22 |
| └ Parcae | 14.49 | 20.00 ± 0.06 | 12.75 ± 0.31 |
| 770M 规模 | |||
| └ Transformer | 13.08 | 22.42 ± 0.20 | 14.20 ± 0.63 |
| └ Parcae | 12.49 | 25.07 ± 0.33 | 15.19 ± 0.43 |
| 1.3B 规模 | |||
| └ Transformer | 11.95 | 25.45 ± 0.08 | 15.90 ± 0.23 |
| └ Parcae | 11.42 | 28.44 ± 0.28 | 17.08 ± 0.09 |
循环,还是不循环
但循环实际上对 FLOP 高效吗?为了研究这一点,我们探索了一种设置:在固定参数数量和 FLOP 预算下,我们在训练中权衡平均循环次数与数据(例如,如果增加平均循环次数,就减少训练数据以保持固定的 FLOP 预算)。

在两个规模上,我们发现增加训练中使用的平均循环次数 $mu_{\text{rec}}$ 同时按比例减少 token 数量,比使用低循环次数和更多数据训练能获得更低的验证损失。更酷的是,如果我们使用抛物线拟合来提取每个 FLOP 水平下的最优 $mu_{\text{rec}}$ 和 token 预算,我们发现它们都遵循具有一致指数的幂律。

好吧,好吧。但我们能击败固定深度模型吗? 使用我们的最优循环缩放定律,我们与固定深度的 Parcae 模型(即 $\mu_{\text{rec}}=1$ 的模型)以及遵循我们缩放定律预测的最优平均循环次数的循环 Parcae 模型进行比较。我们发现循环为验证损失创建了更严格的帕累托前沿(下图),这转化为更好的下游质量(下表)。

下一步及亲自尝试 Parcae
我们对参数效率能推到多远感到非常兴奋。随着推理过程中内存开销成本的不断增长,我们认为在层循环等参数重用方法中还有很多值得探索的地方。为了帮助加速这一进程,我们发布了训练代码和模型。我们还没有完成;我们有很多新想法来进一步推动循环模型,所以请继续关注接下来的内容!
如果您有任何问题,或者想与我们一起研究 Parcae 的下一步,请通过 [email protected] 联系 Hayden Prairie。

PaRCae 这个名字是对三位罗马命运女神的致敬:Nona(前奏块 $\mathcal{P}$),她初始化了计算的生命之线;Decima(循环块 $\mathcal{R}$),她测量线并在模型深度中演化;以及 Morta(尾声块 $\mathcal{C}$),她通过剪断线来最终确定序列以产生最终输出。
致谢
我们要感谢 Together AI 与我们合作并为这些实验提供计算资源。我们还要感谢 Austin Silveria 和 Jonah Yi 对这篇博客文章的有益反馈。
参考文献
- Liu Yang、Kangwook Lee、Robert D. Nowak 和 Dimitris Papailiopoulos。Looped Transformers Are Better at Learning Learning Algorithms。载于The Twelfth International Conference on Learning Representations,2024。↩
- Jonas Geiping、Sean Michael McLeish、Neel Jain、John Kirchenbauer、Siddharth Singh、Brian R. Bartoldson、Bhavya Kailkhura、Abhinav Bhatele 和 Tom Goldstein。Scaling Up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach。载于The Thirty-Ninth Annual Conference on Neural Information Processing Systems,2025。↩
- Ahmadreza Jeddi、Marco Ciccone 和 Babak Taati。LoopFormer: Elastic-Depth Looped Transformers for Latent Reasoning via Shortcut Modulation。载于The Fourteenth International Conference on Learning Representations,2026。↩
- Sean McLeish、Ang Li、John Kirchenbauer、Dayal Singh Kalra、Brian R. Bartoldson、Bhavya Kailkhura、Avi Schwarzschild、Jonas Geiping、Tom Goldstein 和 Micah Goldblum。Teaching Pretrained Language Models to Think Deeper with Retrofitted Recurrence。arXiv preprint arXiv:2511.07384,2025。↩
来源:Together AI Blog · together.ai