跳到主要内容
注册无需实名认证
安云主机 AnYun VPS

术语表 · GPU 与算力

LoRA

LoRA (Low-Rank Adaptation)

又写作

低秩适配QLoRALoRA 微调适配器

要点

什么是LoRA?

LoRA(低秩适配)是一种参数高效微调方法:冻结原模型权重,只训练一组新增的低秩矩阵,显存占用与产出文件都远小于全参数微调,是消费级显卡上最常用的微调方式。

产出不是一份完整的模型,而是一个几十到几百 MB 的适配器文件,加载时叠加到底模上。因此同一个底模可以挂不同的 LoRA 切换风格,多个适配器也能共存——这在出图圈里已经是标准做法,画风、人物、构图各训一个。

QLoRA 是它的常见变体:底模先做 4-bit 量化再挂 LoRA 训练,把单卡能微调的模型规模又推上一档。代价是训练速度变慢,以及量化本身带来的精度损失。

常见误解

LoRA 对学习率、秩(rank)与训练轮数比全参微调更敏感,过拟合的典型表现是「除了训练数据里的问法,什么都答不好」。在这上面,数据质量与去重带来的提升,通常远大于多训几个小时。

本站相关页面

适合跑 LoRA 的配置

相关术语

和「LoRA」一起看 4 条

微调 Fine-Tuning

微调指在已经预训练好的模型上用自己的数据继续训练,使它适应特定任务、格式或语气,是中小团队最现实的定制方式——从零训练一个大模型的成本,与租几张卡跑几个小时不在一个数量级。

量化 Quantization

量化指把模型权重从 16 位浮点降到 8 位或 4 位整数存储,用可接受的精度损失换取显存占用的成倍下降,是让大模型挤进单张消费级显卡的标准手段。

显存 VRAM (Video Memory)

显存是显卡上独立于系统内存的高速存储,模型权重、激活值与缓存都必须放进显存,因此显存容量决定一块 GPU 能不能跑某个模型——放不下就完全跑不起来,而算力不足只是跑得慢。

炼丹 Model Training (slang)

炼丹是中文机器学习圈对训练模型的戏称,取自结果难以预测、只能反复调参试出来的过程;「炼丹炉」指用来训练的机器,「丹」指训练出来的模型权重。

联系 工单
扫码
手机访问

扫码在手机上打开