大模型微调 #
LoRA #
LoRA(Low-Rank Adaptation,低秩适应)是一种轻量级大模型微调技术,用于在不修改原模型权重的前提下,用极少参数快速让模型适配新任务或风格。目前在 AI 绘画、大语言模型(LLM)领域最流行。
一、核心原理(通俗版) #
- 冻结原模型:完全不动预训练大模型(如 Stable Diffusion、LLaMA)的原始权重。
- 加小 “旁路”:在 Transformer 的注意力层(Attention)旁,插入两个极小的低秩矩阵(A、B)。
- 只训小矩阵:训练时只更新 A、B(参数通常只有原模型的 0.01%–1%)。
- 推理合并:用的时候把 A×B 加到原权重上,不增加推理耗时。
二、为什么要用 LoRA? #
- 极省显存:微调 7B/13B 大模型、Stable Diffusion,普通显卡就能跑。
- 速度快:几小时 / 几分钟训完一个风格 / 能力。
- 即插即用:一个 LoRA 文件几十 MB~几百 MB,可随时切换、组合多个 LoRA。
- 不破坏原模型:原模型保持通用能力,LoRA 只做 “定向增强”。
LoRA 的优势不只是“参数少”, 而是它直接作用在模型最敏感的权重空间, 同时又能做到参数高效、可合并、部署友好。
Prompt-Tuning #
提示词调优
Adapter #
Adapter(适配器) 是一种经典的大模型参数高效微调(PEFT)技术,核心是在冻结的预训练模型(如 Transformer)中插入小型、可训练的神经网络模块,仅微调这些新增模块来适配新任务。
训练稳定类 #
ECC是什么?为什么要开? #
ECC是显卡的内存数据保护技术,能自动检测并修复内存中的错误,防止系统崩溃或数据损坏。
大模型训练和长时间推理,本质是高温 + 高负载 + 高密度显存, 一次 bit flip 可能不会 crash,但会悄悄污染梯度或推理结果。