UT Austin 等机构最新预印论文《ISO: An RLVR-Native Optimization Stack》给出一个极其深刻的观察:RLVR(可验证奖励强化学习)并没有改变大模型的容量结构,它改变的只是模型的特征映射方向。
作者把每个权重矩阵拆成 SVD:奇异值谱(spectrum)决定各模式的强弱,左右奇异向量帧(singular frames)决定输入和输出方向。
实验发现,RLVR 后的模型奇异值谱与基座模型非常接近;把谱换回基座谱、保留训练后的方向,性能仍基本保住。这被称为“谱继承”(spectral inheritance)。
据此提出 ISO(Isospectral Optimization):
🔷 ISO-Optimizer:训练时固定基座谱,只用 AdamW/Muon 更新左右 frames,再用 polar retraction 保持正交约束。
🔷 ISO-Merger:把同一基座训练出的多个 RL 专家,直接在 frame 坐标中合并;无需合并后的数据、rollout、梯度更新或 on-policy distillation。
🔷 8B 数学 RLVR 中,ISO-AdamW 在 100 步达到普通 AdamW 270 步的 0.495 聚合准确率,并在 210 步达到 0.509;普通 AdamW 同步数为 0.487。
它真正有意思的地方,不是又换了一个 optimizer,而是把 RLVR 的“可变部分”从整个权重矩阵收缩为方向结构。对于多专家合并、推理模型后训练和 RL 系统工程,这是一种很具体的结构化优化思路。
适合做 RLVR、模型合并、矩阵优化和推理模型训练的研究员可以Mark看看了,论文已经上传啦~ 👇🏻




