TensorX

TensorX · Paper Blog

On the Scaling of PEFT: Towards Million Personal Models of Trillion Parameters

Mind Lab · 2026-05-02

PEFTLoRAMoEMemory-Augmented LLMMulti-Agent Simulation

本文探讨了小参数量适配器(Adapter)作为大模型上持久化本地状态的可能性。研究通过Scale Up、Scale Down和Scale Out三大维度,构筑起支持数百万高智商、低算力开销的个性化模型生态系统。

💡 核心创新点

🚀 从“省钱替代方案”到“多租户持久化状态”

传统的参数高效微调(PEFT,尤其是LoRA)通常仅被视作全量微调(Full Fine-Tuning)的“廉价替代品”。然而,这篇来自 Mind Lab 的重磅论文彻底打破了这一传统假设。作者指出,PEFT的真正价值在于作为底层万亿模型上承载个性化行为和动态上下文的持久化本地状态(Persistent Local State)

PEFT的三维缩放概念生物学类比

🎯 核心结论:底层的基础大模型提供了通用的物理常识与推理框架,而仅占模型参数总量极小比例(例如 <0.5%)的微型适配器,则可以像人类基因组中少于 1% 的变异一样,实现千人千面的个性化行为、工作流习惯、知识增量与工具倾向。

这种架构设计使得个人模型在拥有万亿参数大模型先验能力的同时,无需为每个人单独部署一台万亿参数实体。这在根本上打破了“算力成本”与“高智能个性化”之间的不可能三角,为支持数百万个百万级个性化智能体共生的生态圈(MinT)奠定了理论根基。

🔍 背景与动机

💔 大模型个性化的“不可能三角”

现有的个性化方案(如长上下文提示词、外置向量数据库检索或用户画像过滤)在真实的多轮交互场景中常常力不从心。它们的硬伤在于没有修改模型深层的行为策略和状态表达。当系统遭遇复杂的工具链调用或精细的用户风格对齐时,浅层的上下文注入极易发生“漂移”和“注意力耗尽”。

为了展示大模型底座在个性化微调中的绝对优越性,研究人员在相同算力预算下,对比了全量微调(Full RL)的 1.5B 级别小模型与配有极小 LoRA 适配器的万亿底座。测试结果给出了非常直观的佐证。

不同规模大底座配合小LoRA在强化学习下的增益表现

在相同的 RL 训练预算下,高参数量的底座模型加上极其微小的 LoRA,其表现远远超出了独立微调的小模型。例如采用底座 Qwen3-32B 配合仅 r=8(约 0.07B 可训练参数)的极小 LoRA 适配器,在 AIME 2025 上的标准化得分提升幅度达到了惊人的 20.61%,而全量 RL 的 1.5B 小模型增益仅有 8.33%。这表明,高强的先验模型提供了极宽的探索边界,强化学习只需要极少量的参数即可将这些潜在能力引导、稳固并释放出来。

📊 数据集与实验环境

🖥️ 兆亿参数MoE训练平台与评测基准

本研究使用了前沿的大型多混合专家架构(MoE)底座,并通过精心调优的工程设施使其具备生产可行性。

  • 模型底座与参数配置:实验主体涉及 Kimi K2(1.04T 总参数量,32.6B 激活参数量)和 Qwen3 系列(Qwen3-8B、Qwen3-30B、Qwen3-235B-A22B)等。
  • 训练超参:采用 PPO 或 DAPO 进行对齐,学习率固定在 learning_rate=1x10^-5 或使用 Triquetra 转移规则。实验中的有效 Batch Size 在不同尺度下设定为 32 或更高,在 Qwen3-8B 上一共运行了 216 次 不同的实验 Sweep 以确定秩的稳定性规律。
  • 评测数据集:采用 DishNameBenchmark 进行 LoRA 记忆容量研究。该基准将内存操作抽象成对插槽(slots)的写入、覆盖、冲突解决等基础单元。同时在真实的个性化能力和协作能力评测上,使用了 AIME24GPQA DiamondIFEvalHotpotQA 等高难度的推理和语义理解数据集。对于大规模社交模拟,则基于 OASIS 社区环境在 N={128, 256, 512} 的用户规模下进行实测。

🛠️ 核心机制与研究方法

研究团队沿着 Scale Up(底座升级)、Scale Down(极微化)与 Scale Out(群体涌现)三大轴线对 PEFT 展开了深度理论重构。下面我们 step-by-step 拆解其底层算法机制:

⚙️ 三维缩放的协同架构

🌟 Scale Up:在万亿混合专家(MoE)模型上部署LoRA RL

在万亿级别的 MoE 架构(如 Kimi K2 1T)中进行强化学习面临致命的工程问题。MoE 模型的路由选择对极其微小的数值波动都十分敏感。在训练和推理(Rollout)环境不完全等价的情况下,由于微调带来的参数改变会导致 Token 路由到完全不同的专家中,引发 训练-推理不一致(TIM,Training-Inference Mismatch),导致模型表现断崖式下跌。

为了解决这个问题,Mind Lab 提出了 Router Replay R3(路由重放机制)。该机制在 Rollout 阶段精确记录 Token 路由的专家 ID,并在 Training 反向传播时进行 100% 强制对齐重放,防止激活路径发生漂移。通过在密集的线性层和专家内层附加精细的 LoRA,最终将万亿参数 RL 训练的显存与计算量开销压缩到了全量 RL 的约 10% 左右。

### 📉 Scale Down:低秩不稳定性与OLoRA-tail初始化

在对个人模型进行微型化改造时,适配器需要缩减到极限的极低秩状态(如 r=1r=2)。但在传统的随机高斯初始化中,极低秩会带来严重的性能塌陷和跨种子随机性。适配器因为探索方向过少,极易由于一次不当的梯度更新而彻底“死锁”在次优解中。

Qwen3-8B PPO在不同LoRA秩下的增益以及Token效率变化

💡 关键技巧:在低秩范围,例如从 r=16 骤降到 r=1 时,平均表现(Mean Gain)出现了剧烈的下滑,同时多随机种子间的差异性(Seed Spread)呈现灾难性拉大。这意味着极小适配器的瓶颈不是表达能力(Expressivity),而是稳定性(Stability)

为此,作者提出了 OLoRA-tail 初始化。传统的 SVD(奇异值分解)初始化(如 PiSSA 或 MiLoRA)偏好对模型更新投影到最大的特征根方向,但在 RL 的 KL 约束机制下,大特征根上的微小修改会引发政策分布的剧变(熵暴增),导致模型训练崩溃。OLoRA-tail 反其道而行之,通过抽取冻结权重的**尾部奇异向量(Minor Singular Vectors)**来初始化适配器的低秩矩阵,并去除了奇异值缩放因子,让模型在最钝、最温和的子空间中寻找对齐方向。极大地增强了 RL 的收敛平稳度。

🔄 状态流转机制:从静态LoRA到动态状态机 δ-mem

LoRA 的局限在于其参数更新后便成为“死物”,无法随着每一句对话动态更新内部的上下文状态。论文提出了全新的动态状态机制 δ-mem。它将 PEFT 视作在主模型注意力和本地循环关联状态矩阵之间的读写通道。

δ-mem的内部读写流转机制示意

δ-mem 维持一个低秩的动态在线状态矩阵 St:

St=Diag(λt)St1+Diag(βt)(vtmSt1ktm)(ktm)\mathbf{S}_t = \text{Diag}(\boldsymbol{\lambda}_t)\mathbf{S}_{t-1} + \text{Diag}(\boldsymbol{\beta}_t) (\mathbf{v}^m_t - \mathbf{S}_{t-1}\mathbf{k}^m_t) (\mathbf{k}^m_t)^{\top}

在该状态更新方程中,St1\mathbf{S}_{t-1} 代表前一步的关联记忆状态,ktm\mathbf{k}^m_tvtm\mathbf{v}^m_t 是当前输入的记忆键与记忆值,λt\boldsymbol{\lambda}_tβt\boldsymbol{\beta}_t 则是动态控制记忆遗忘与写入强度的门控因子。它的核心创新在于模型写入的是**预测残差(Prediction Residual)**而非原始信息的无脑累加。这使得可写适配器的开销只占基础模型参数的 0.12%(约 4.87M 参数),却带来了能够自我纠偏的高级时序关联记忆。

⚖️ 缩放法则:学习率与秩(Rank)的Triquetra传递定律

在实际生产中,由于成本或显存限制,用户可能随时需要更改 LoRA 的秩。如果每次改动都需要重新扫一遍超参数(网格搜索最佳学习率),其计算成本将是灾难性的。在经典的 LoRA 更新中,增量权重定义为:

ΔW=αrrBA\Delta W = \frac{\alpha_r}{r}BA

这里 αr\alpha_r 为秩比例因子,rr 为当前的秩。论文通过对 AdamW 早期更新规律的导数推导证明,当采用 αrr\alpha_r \propto \sqrt{r}(即平方根缩放律)时,秩的依赖性可以在初始梯度步中被消解。这提供了一个黄金超参转换公式:更换不同秩的适配器时,只需令其缩放因子 αr=8r\alpha_r = 8\sqrt{r},便可直接复用旧的物理学习率 η\eta,无需任何重新调试,从而实现适配器全自动的跨Rank部署。

📈 结果与深度分析

📊 实证研究与消融实验分析

🏆 AIME2024 与 GPQA 任务上的表现

为了验证动态可写机制 δ-mem 的统治级表现,作者在 Qwen3-4B-Instruct 上进行了大范围的消融实测:

δ-mem与主流检索/轻量微调在各项基准测试中的性能比对

从实测数据来看,在需要深度多轮语义关联的 HotpotQA 测试中,采用令牌级写入的 δ-mem (TSW) 变体取得了 49.41% (EM) / 63.66% (F1) 的耀眼成绩,显著超出了常规 Context2LoRA 适配器(37.85% / 50.88%)以及传统 BM25 检索增强(40.35% / 52.83%)。而在全基准的综合平均得分(Avg)上,δ-mem 系列相较于无适配器底座实现了从 46.79% 到 51.66% 的重大性能飞跃,且只引入了不可思议的超低开销。

🤝 协作智能:多样性非采样噪声的实证

当无数个拥有不同微调轨迹的微型 Adapter 聚在一起,可以产生令人瞩目的“集体智慧(Collective Intelligence)”。本论文设计了一个优雅的协作投票实验,通过聚合 kk 个不同的 LoRA 变体来进行 majority voting(多数派投票)。

模型协作数量对AIME24准确率的对数线性增长表现

🚀 重大突破:协作带来的性能提升与模型数量的对数关系服从公式:Accuracy ≈ 0.386 + 0.0172 ln(k),该对数关系在高达 k=198k=198 的尺度上依然表现出惊人的贴合度 (R20.888R^2 ≈ 0.888)。AIME24 的求解准确率从最基础单模型底座的 36.44% 一路狂飙至多适配器集成投票后的 48.67%

这种提升不能仅用随机采样(解码器温度带来的多样本去噪)来解释,因为同一个模型进行 kk 次温度采样(Repetition)会在 k=24k=24 附近迅速进入饱和(上限为 43.78%)。而通过在不同掩码、数据流上训练出的轻量级 Adapter 提供了非同质化的多向思维路径,它们之间的协作产生了货真价实的群体涌现智能。

⚠️ 局限性与未来展望

虽然本项工作在理论上极具前瞻性,但作者在文末也真诚地指出了当前生态下的局限性:

  • 真实环境落地验证尚浅:尽管论文在 OASIS 社交网络、AIME 等学术级基准上取得了极其亮眼的数据,但是在真实物理世界海量高并发用户交互下的个人模型(如个性化本地设备服务)中,依然面临物理显存调度和极致冷启动时延的挑战。
  • 未来方向:如何更好地将这种基于残差的状态机制(如 δ-mem)与外置的长上下文知识图谱(KGs)有机结合,并建立更加弹性的百万级轻量适配器云原生分发网络,将是接下来推动“百万人拥有万亿模型”宏伟蓝图最终落地的核心战役。

北京市昌平区探索星信息技术及软件开发工作室

京ICP备2026059466号