LoRA(Low-Rank Adaptation)是大模型微调最高效的技术:不微调模型的全部权重(几十 GB),只训练「插入模型的低秩矩阵」(通常只有几十 MB)——微调成本降低 100 倍以上。QLoRA(Quantized LoRA)进一步把基座模型量化到 4-bit 再训 LoRA——单张 48GB 卡就能微调 70B 模型。
对采购方的意义:LoRA/QLoRA 让「微调大模型」的显存门槛大幅降低——48GB 的 L40S/RTX 6000 Ada 就能微调 70B 模型(QLoRA)——不需要 HGX 基板整机。这直接影响 GPU 选型:推理+微调一体机(PCIe 卡)可能比训练集群更实用。
| 项目 | 数值 / 口径 |
|---|---|
| 核心思想 | 只训练低秩矩阵(不碰基座权重) |
| 显存降低 | QLoRA 4-bit 基座 + LoRA 微调 |
| 70B QLoRA 显存 | 约 48GB(单卡可行) |
| 训练成本 | 较全量微调降 100×+ |
B300 的 FP4/FP6 精度也可以用于 QLoRA——基座模型量化到 FP4 再训 LoRA 适配器——显存效率和训练吞吐都优于 INT4 QLoRA。但 FP4 QLoRA 的精度稳定性仍在研究中——建议 FP8 QLoRA 作为生产基线。