基础问题

大模型微调 #

LoRA #

LoRA(Low-Rank Adaptation,低秩适应)是一种轻量级大模型微调技术,用于在不修改原模型权重的前提下,用极少参数快速让模型适配新任务或风格。目前在 AI 绘画、大语言模型(LLM)领域最流行。

一、核心原理(通俗版) #

  • 冻结原模型:完全不动预训练大模型(如 Stable Diffusion、LLaMA)的原始权重。
  • 加小 “旁路”:在 Transformer 的注意力层(Attention)旁,插入两个极小的低秩矩阵(A、B)。
  • 只训小矩阵:训练时只更新 A、B(参数通常只有原模型的 0.01%–1%)。
  • 推理合并:用的时候把 A×B 加到原权重上,不增加推理耗时。

二、为什么要用 LoRA? #

  • 极省显存:微调 7B/13B 大模型、Stable Diffusion,普通显卡就能跑。
  • 速度快:几小时 / 几分钟训完一个风格 / 能力。
  • 即插即用:一个 LoRA 文件几十 MB~几百 MB,可随时切换、组合多个 LoRA。
  • 不破坏原模型:原模型保持通用能力,LoRA 只做 “定向增强”。

LoRA 的优势不只是“参数少”, 而是它直接作用在模型最敏感的权重空间, 同时又能做到参数高效、可合并、部署友好。

Prompt-Tuning #

提示词调优

Adapter #

Adapter(适配器) 是一种经典的大模型参数高效微调(PEFT)技术,核心是在冻结的预训练模型(如 Transformer)中插入小型、可训练的神经网络模块,仅微调这些新增模块来适配新任务。

训练稳定类 #

ECC是什么?为什么要开? #

ECC是显卡的内存数据保护技术,能自动检测并修复内存中的错误,防止系统崩溃或数据损坏。

大模型训练和长时间推理,本质是高温 + 高负载 + 高密度显存, 一次 bit flip 可能不会 crash,但会悄悄污染梯度或推理结果

推理部署类:vLLM、量化、并发 #