模型蒸馏(Knowledge Distillation)是把大模型(教师模型)的能力「蒸馏」到小模型(学生模型)的技术——学生模型学会模仿教师模型的输出分布(不只是标签),最终用远小于教师模型的参数量达到接近的精度。蒸馏是「模型压缩」路线的核心技术之一(与量化、剪枝并列)。
对采购方的意义:蒸馏直接影响 GPU 选型——「大模型蒸馏出小模型、小模型部署在便宜的卡上」是降本增效的常见路径——蒸馏的成本在训练侧(需要大卡跑教师模型),收益在部署侧(小卡跑学生模型)。蒸馏的性价比决定了「训练用大卡、部署用小卡」的分层策略是否成立。
| 项目 | 数值 / 口径 |
|---|---|
| 教师模型 | 大参数模型(提供软标签/中间特征) |
| 学生模型 | 小参数模型(学习模仿教师) |
| 蒸馏方式 | 软标签蒸馏 / 特征蒸馏 / 关系蒸馏 |
| 部署收益 | 小卡跑学生模型=推理成本大幅降低 |
B300 可以同时扮演两个角色:跑教师模型(大参数蒸馏源)+ 跑学生模型训练——蒸馏的训练成本在 B300 上一次投入,部署收益在推理侧长期兑现。B300 的 FP4/FP8 精度在蒸馏训练和部署两侧都有优势。