Normalized Low-Rank Adaptation
NoRA (Normalized Low-Rank Adaptation) 是一种对 LoRA 的改进方法,通过在训练中或仅在初始化时对下投影矩阵进行归一化,在预训练、监督微调和强化学习中加速收敛、提升性能和训练稳定性,并缓解灾难性遗忘,且不增加额外参数或推理计算。
Development
- First ReportNormalized Low-Rank AdaptationHugging Face Daily Papers
- Industry ResponseNormalized Low-Rank AdaptationarXiv cs.LG
- Current AssessmentNoRA 作为 LoRA 的即插即用增强,可能降低微调成本并提升效果,对依赖参数高效微调的行业有吸引力。其无需额外参数或推理计算的特点,使其易于集成到现有流程。但论文未提供具体数值,实际收益需进一步验证。Agent Pulse · analysis
LoRA 广泛用于参数高效模型适配,但其训练动态的规范化研究不足。由于 LoRA 将上投影初始化为零,早期优化动态主要由下投影主导。基于此,研究者提出 NoRA,在训练中对下投影矩阵进行归一化,并证明仅在初始化时应用同样有效。在预训练、监督微调和强化学习场景中,NoRA 一致地加速收敛、提升性能和训练稳定性,并缓解灾难性遗忘。这些优势无需额外可训练参数或推理计算,使其成为 LoRA 的简单且广泛适用的增强。
NoRA 的核心洞察是 LoRA 早期训练动态由下投影主导,因此归一化下投影可稳定优化。该方法在训练中或仅初始化时归一化下投影,不增加参数或推理开销。实验覆盖预训练、SFT 和 RL,显示收敛加速、性能提升和稳定性改善,并缓解灾难性遗忘。这提示 LoRA 的初始化策略对训练动态有显著影响,归一化可作为通用正则化手段。
NoRA 作为 LoRA 的即插即用增强,可能降低微调成本并提升效果,对依赖参数高效微调的行业有吸引力。其无需额外参数或推理计算的特点,使其易于集成到现有流程。但论文未提供具体数值,实际收益需进一步验证。
NoRA 可能降低模型适配成本,提升微调效率,对提供微调服务或依赖快速迭代的企业有潜在价值。其简单性利于快速落地,但需实证数据支撑。
后续可关注 NoRA 在更大规模模型和更多任务上的验证,以及其与量化、蒸馏等技术的结合。若被广泛采用,可能成为 LoRA 的标准配置。