Pin Once, Swap Light: Subspace-Aligned Centroid-Residual Training for Efficient Ultra-LoRA Serving
SALT(Subspace-Aligned LoRA Training)是一个面向多租户 LoRA 服务的分层微调框架,通过三阶段流程解决高秩适配器占用显存大、低秩适配器性能差的问题:先联合训练域质心,再微调超低秩任务残差适配器,推理时固定质心并动态换入任务残差。
发展脉络
- 首次出现Pin Once, Swap Light: Subspace-Aligned Centroid-Residual Training for Efficient Ultra-LoRA ServingarXiv cs.AI
- 当前判断该框架针对多租户 LoRA 服务的扩展性瓶颈,提出了一种服务感知的训练方法,可能推动 LoRA 服务从高秩适配器向超低秩适配器加质心的架构转变,影响推理基础设施的设计和成本模型。Agent Pulse · 分析
多租户 LoRA 服务系统同时承载数十到数百个适配器,面临服务效率与任务性能的权衡:高秩适配器性能好但显存占用和 PCIe 交换开销大,超低秩适配器(r≤2)开销小但性能下降。SALT 框架通过三阶段解决此问题:提供方在公共数据上联合训练域质心,使用对齐正则化器将域内任务子空间统一到同一基;用户基于冻结质心在私有数据上微调超低秩任务残差适配器;推理时质心固定在 GPU 显存,按需动态换入任务残差。
SALT 的核心创新在于将 LoRA 训练分为域质心和任务残差两层,通过对齐正则化器使任务子空间对齐到统一基,从而让超低秩残差适配器在保持低开销的同时提升性能。这改变了 LoRA 服务的部署模式:质心常驻显存,残差按需交换,可能显著降低 PCIe 传输量。
该框架针对多租户 LoRA 服务的扩展性瓶颈,提出了一种服务感知的训练方法,可能推动 LoRA 服务从高秩适配器向超低秩适配器加质心的架构转变,影响推理基础设施的设计和成本模型。
对提供多租户 LoRA 服务的平台,SALT 可能降低显存和带宽成本,提升单卡承载的适配器数量,从而改善服务毛利率和可扩展性。
后续可关注 SALT 在不同规模 LLM 上的性能数据、与现有推理系统的集成效果,以及是否出现基于质心-残差模式的商业化服务或开源实现。