Unsloth LoRA教程2026:带可运行示例的轻量微调详解
LoRA是让微调变得便宜的思想,但教程很少解释它为什么有效。这篇先讲机制,再用Unsloth跑一次真实LoRA微调。
💡 你将学到
LoRA是让微调变得便宜的思想,但教程很少解释它为什么有效。这篇先讲机制,再用Unsloth跑一次真实LoRA微调。
让微调变小的思想
全量微调要更新7B模型的每一个权重——几百亿参数。LoRA(低秩适配)建立在一个研究观察上:新任务需要的权重更新住在一个低维子空间里。所以它不学完整的更新矩阵W,而是学两个小矩阵A和B,其乘积近似更新量。可训练参数从几十亿降到约1-2%(星数2026-08-12获取:Unsloth 70,038)。
为什么LoRA质量通常够用
因为冻结的底座模型已经懂语言,适配器只负责引导风格、格式和领域知识。大多数真实任务——聊天风格、文档格式、行业术语——LoRA适配器就抓得住。底座真的缺某种能力时才需要全量微调。
控制一切的两个数字
r(秩):A和B的大小。多数任务r=8-16,更难的领域更高(32-64)。r越大容量越大内存越多。lora_alpha:适配器贡献的缩放,常用规则是alpha等于2倍r。
可运行示例(Qwen2.5-7B,单GPU)
FastLanguageModel加载4-bit模型,get_peft_model配r=16、lora_alpha=32、注意力投影做目标模块。用SFTTrainer在数据集上训练,最后save_pretrained_merged存成merged_16bit。
预算现实
7B上r=16的适配器约40MB,对比完整模型约14GB——这就是全部经济学。训练:24GB卡200步batch 2约1小时;8GB卡用4-bit加小上下文要几小时。部署:合并后的模型运行时不需要LoRA或Unsloth。
什么时候全量微调仍然赢
底座模型即使提示词和检索都做好还是不行;需要模型学真正的新知识而不是风格;GPU预算和数据质量都够。其他所有情况,LoRA都是正确的默认——更便宜、更快、更容易迭代。
FAQ
秩r用大白话怎么说? 适配器有多少'空间'去改变模型。太小欠拟合,太大浪费内存还可能过拟合。 要动底座权重吗? 不用,LoRA保持冻结,适配器是独立可换的产物。 LoRA能跟量化组合吗? 能,那就是QLoRA:4-bit底座加LoRA适配器。
