LoRA(低秩适配)是一种高效微调大模型的方法:冻结原模型、只训练少量低秩矩阵,用极低算力与显存让大模型适配新任务或新风格,是当前最主流的高效微调技术。
AI Glossary
LoRA(Low-Rank Adaptation,低秩适配)是一种高效微调大模型的方法:微调时冻结原模型全部参数,只在旁边额外训练一组很小的低秩矩阵(两个小矩阵的乘积近似增量)。这样需要训练的参数量从几十亿降到几百万,显存与算力需求大幅下降——普通消费级显卡也能微调大模型。它解决了"全量微调太贵"的痛点,是当前最主流的高效微调(PEFT)技术。
LoRA 基于一个观察:大模型微调时的权重变化(增量)可以用低秩矩阵近似。于是它不直接更新原权重,而是:
相比全量微调,LoRA 的优势:显存占用低(普通显卡可跑)、训练快、产物小(便于分发与多风格管理)、不破坏原模型(可随时还原)。典型场景:给文生图模型微调专属画风/LoRA 模型、给 LLM 微调角色人设、垂直任务适配(客服、法律、医学)、多任务并存(同一基座挂多个 LoRA)。
LoRA 适合中小规模适配,效果在任务与原模型差距很大时可能不如全量微调;需选择合适秩 r(过大易过拟合、过小欠拟合)并配合高质量数据集。理解 LoRA,就理解了"如何低成本地让大模型变成你的模型"。