大模型预训练一直是一件”既要又要”的事情:既希望训练稳定、可持续扩展,又希望训练效率达到极致。这一过程就像“戴着镣铐跳舞”,既要满足各种约束,又要尽可能发挥模型潜力,无疑是一门兼具理论与工程之美的 AI 艺术。
近日,微软亚洲研究院的研究员们提出了一个全新的优化器Spectral Sphere Optimizer(SSO)。该工作从 μP(Maximal Update Parametrization)理论出发,首次将训练稳定性与最速下降目标统一到同一个理论框架中,推导出了兼顾稳定性与训练效率的唯一数学解。在工程实现上,SSO 通过谱球约束、切空间更新与谱球回缩等设计,在无需依赖 Weight Decay 等传统稳定化技巧的情况下,实现了更加稳定、高效的大模型预训练。相关论文已被ICML 2026作为Oral工作接收。
论文信息已整理至文末,欢迎点击相关链接,了解更多技术详情。
什么才是真正的训练稳定性?
“快”其实很好定义——让 Loss 下降得最快即可,也就是经典的最速下降(steepest descent)。真正困难的是,”稳”究竟应该如何定义?
研究员们认为,从根本上讲,可持续、可扩展的稳定性,应当来自模型自身的”健康指标”。如果模型所有层的输入输出始终保持统一的尺度,并且这一尺度与层的形状无关,那么激活值(activation)才真正达到了稳定。
事实上,这正是经典 μP 理论所描述的性质。满足 μP后,模型即使扩展到任意宽度,也能够保持一致的训练动态,并带来许多重要优势,例如:小模型搜索得到的学习率等超参数,可以直接迁移至更大的模型;无需重新调参即可完成模型扩展;可以用于拟合规模法则(scaling law),并预测模型最终能够达到的最优 Loss。
一句话概括,本篇论文从μP 理论作为稳定性最佳度量这一视角出发,推导出了使Loss 最速下降的优化器,而 SSO 正是这一问题唯一的数学解。

为什么需要谱球约束?
那么,在 SSO 出现之前,人们是如何保证大模型训练稳定性的?
方法其实很多。最常见的是 AdamW 引入的Decoupled Weight Decay(解耦式权重衰减)。它通过不断将权重向 0 拉近来稳定训练,但这也会导致相对更新量(Δw/w)不断变化,并与学习率耦合,从而带来复杂且难以分析的训练动态。因此,学术界又提出了各种Weight Decay Scheduler(权重衰减调度策略),希望进一步改善这一问题。
本质上,”权重往 0 拉”与学习率始终处于一种博弈关系。虽然理论上能够给出权重上界(约为1/λ),但实际训练过程中仍然容易出现各种不稳定现象。
另一方面,各种初始化技巧也无法从根本上解决问题,因为随着训练不断进行,权重最终都会逐渐偏离初始化尺度。
除此之外,还有大量依赖架构设计的稳定化技巧,例如,QK-Norm 用于稳定Attention Logits,Sandwich Norm 用于同时约束输入与输出尺度。这些方法虽然能够提升稳定性,却往往需要额外调参,甚至可能牺牲模型能力上限,并不是一种足够优雅的解决方案。
因此,研究员们希望找到一种更加统一的方法:既能够摆脱 Weight Decay(权重衰减),又能够尽可能地减少额外的Norm 设计。
从 μP 理论推导唯一数学解
如果希望模型激活值满足 μP 理论,那么前向传播中的权重W,以及反向传播中的更新量 Φ=ΔW,都必须满足:

其中谱范数定义为:

研究员们发现,μP 理论实际上天然要求权重和更新都位于谱范数球(Spectral Sphere)的球面上。
进一步观察还发现,Muon 优化器的更新规则恰好满足了 μP理论中的后一条要求,即约束更新量的谱范数。这一巧合也启发研究员们思考:如果能够同时满足 μP 理论的全部要求,是否能够得到一个更加理想的优化器?
既然通过谱球约束已经保证了稳定性,接下来需要解决的问题,就是如何在这一约束下,使 Loss 下降得最快。
Loss 是关于权重 W 的函数。研究员们首先在当前权重处对 Loss 做一阶泰勒展开,从而得到最速下降对应的更新量 Φ:

结合前述谱球约束,并将谱球半径记为:

便可以得到兼顾”又稳又快”的优化目标:

这里,更新量的谱范数约束写成 1,是因为此处考虑的是单位更新,实际训练时半径R 可以直接吸收到学习率(learning rate)中。
让更新始终贴着球面下降
接下来,要对上述优化目标继续化简。研究员们首先将最后两式相减,可得到:

其中,

表示当前权重在谱球面上的梯度方向,也就是谱球面的法向方向。
为了使上式恒成立,则需要满足:

这意味着,更新方向必须始终位于谱球的切空间(tangent space)内。
从几何角度理解,就是更新始终贴着球面下降,而不是直接向球心收缩。这样既能够保持权重一直位于谱球面上,又不会损失梯度在法向方向上的有效信息。
于是,整个问题便转化为一个经典的线性优化问题:

研究员们进一步采用拉格朗日乘子法进行求解,构造拉格朗日函数:

约束条件为
最终便可得到最速下降对应的最优更新
,其中拉格朗日乘子 ![]()
满足

与 Muon 对比,可以更直观地理解这一结果。Muon 的更新规则为:

而 SSO 则引入了一个微扰项:

使更新方向能够严格投影到谱球切空间,从而在满足 μP 理论约束的同时,实现真正意义上的最速下降。
除了上述代数推导之外,本篇论文还给出了对应的几何解释,使整个优化过程具有更加直观的物理意义。

如何让SSO 高效运行
进一步观察还能发现,拉格朗日函数 h(λ) 单调递增,并且其零点有界,但目前尚未找到解析解,因此实际求解仍需要借助数值迭代。最直接的方法就是二分搜索,而 SSO 的实现也正是采用了这一策略。
研究员们还观察到,λ 的形式似乎可以写成一个仅依赖梯度 G 的均值(mean)和标准差(std)的数学表达式,而与当前权重 W 无关。不过,目前这一结论尚未完成严格证明,因此论文只给出了一个较宽松的理论界,也期待未来进一步完善。

至此,SSO 的理论推导已经基本完成。其本质上就是一个满足双谱球约束的最速下降问题。借助拉格朗日函数单调且零点有界这一关键观察,通过二分搜索即可求得拉格朗日乘子,进而得到实际更新方向。
不过,在实际工程训练中,只依赖一阶切空间更新,经过长时间训练后仍可能不断累积数值误差,使权重的谱范数逐渐偏离目标谱球。因此,SSO引入了一步简单而有效的谱球回缩(Spectral Retraction):

即对整个权重矩阵进行统一缩放,使其最大奇异值始终保持为目标半径 R,以消除训练过程中不断积累的误差。
相比计算 msign,利用幂迭代法(Power Iteration)求取最大奇异值的代价要低得多。研究员们观察发现,模型训练过程中谱范数变化通常较为平缓,对应的左右奇异向量u、v 也具有较好的连续性。因此,研究员们将上一轮计算得到的奇异向量缓存下来,作为下一轮Power Iteration 的初始化,仅需少量迭代即可达到几乎相同的计算精度,从而显著降低了额外的计算开销。
另一方面,研究员们也尝试过 mclip 方案,即仅对最大奇异值进行裁剪,而保持其他奇异值不变。从理论上看,这是一种更加精细的谱约束方式。但在实际实验中,该方案仍然遇到了较难克服的数值精度问题,同时需要引入更多的msign 计算,整体收益并不明显,因此最终没有采用。
用谱球替代权重衰减
谱球回缩还有一个重要收益:它基本消除了隐藏层使用权重衰减的必要性。既然谱球半径 R 已经定义了权重的最佳尺度,并且训练过程中始终保持在这一尺度上,那么权重衰减的作用实际上已经被替代。因此,SSO成功移除了隐藏层权重衰减这一历史遗留超参数,大幅降低了调参复杂度。
与此同时,研究员们也获得了对每个 Attention / FFN 模块输入输出尺度的完全控制能力。通过调节参数c,即可整体控制各模块输出尺度,使激活值rms在整个网络中保持一致,同时有效抑制异常值,训练过程表现得更加健康、稳定。

进一步来看,c 还可以理解为Attention/FFN 分支与残差流之间的混合比例,它同时决定了模型最优初始化尺度以及最优激活值尺度,也是未来值得深入研究的重要方向。
SSO:兼顾稳定性与训练效率的新优化框架
至此,SSO 的整体流程已经十分清晰:计算最大奇异值 → 回缩至谱球面 → 在谱球切空间内计算更新 → 完成参数更新,如此循环,即构成了完整的 SSO 优化流程。
实验结果也验证了这一设计。从模型的“内科”指标来看,SSO 能够保持几乎理想的激活值rms曲线,并显著抑制异常值。相比之下,AdamW 的异常值往往会增长到百倍以上。
从最终训练效果来看,SSO 在不同模型规模下均取得了比AdamW 和 Muon 更低的 Loss,同时保持了优秀的学习率转化能力,实现了训练稳定性与训练效率的统一。
Controlled LLM Training on Spectral Sphere (ICML 2026 Oral)
论文链接:https://arxiv.org/abs/2601.08393 (opens in new tab)
项目页面:https://github.com/Unakar/Spectral-Sphere-Optimizer (opens in new tab)
Megatron代码:https://github.com/Unakar/Megatron-LM/tree/SSO_main (opens in new tab)