算力百科COMPUTEPEDIA

算力百科 › 技术概念 › 模型蒸馏

模型蒸馏

KNOWLEDGE DISTILLATION · 技术概念词条

概述OVERVIEW

模型蒸馏(Knowledge Distillation)是把大模型(教师模型)的能力「蒸馏」到小模型(学生模型)的技术——学生模型学会模仿教师模型的输出分布(不只是标签),最终用远小于教师模型的参数量达到接近的精度。蒸馏是「模型压缩」路线的核心技术之一(与量化、剪枝并列)。

对采购方的意义:蒸馏直接影响 GPU 选型——「大模型蒸馏出小模型、小模型部署在便宜的卡上」是降本增效的常见路径——蒸馏的成本在训练侧(需要大卡跑教师模型),收益在部署侧(小卡跑学生模型)。蒸馏的性价比决定了「训练用大卡、部署用小卡」的分层策略是否成立。

关键数字KEY NUMBERS

项目数值 / 口径
教师模型大参数模型(提供软标签/中间特征)
学生模型小参数模型(学习模仿教师)
蒸馏方式软标签蒸馏 / 特征蒸馏 / 关系蒸馏
部署收益小卡跑学生模型=推理成本大幅降低

在 B300 上的意义ON B300

B300 可以同时扮演两个角色:跑教师模型(大参数蒸馏源)+ 跑学生模型训练——蒸馏的训练成本在 B300 上一次投入,部署收益在推理侧长期兑现。B300 的 FP4/FP8 精度在蒸馏训练和部署两侧都有优势。

边界与注意LIMITS

  • 蒸馏不总是有效:某些任务(复杂推理/多语言)蒸馏后的精度下降明显——逐任务评估蒸馏的可行性。
  • 教师模型的许可约束:用闭源大模型(如 GPT-4)的输出做蒸馏可能违反服务条款——开源模型(LLaMA/Qwen/DeepSeek)的蒸馏更安全。
  • 蒸馏数据的质量要求:蒸馏的效果取决于训练数据的质量和多样性——「垃圾进垃圾出」的原则不变。

参考资料REFERENCES

  1. NVIDIA 官网 — Blackwell Ultra / HGX B300 产品页 https://www.nvidia.com/en-us/data-center/hgx/
  2. 行情与在售数据:萬安算交所(本库行情带)
版本与勘误|本词条由算力百科编辑部维护,AI 辅助起草、人工核验事实。更新于 2026-10-10 · 版本 v1.0 · 历次改动均留痕可查。
本库
编辑政策关于本库(利益声明)勘误通道
编辑宪法摘要
每条断言带出处缺点必写 · 勘误公开留痕不接受付费词条词条内零导流与销售元素行情数据仅作数据模块挂载
萬安家族
算力百科萬安算交所萬安资讯
行情数据来源:萬安算交所 · © 2026 算力百科 ComputePedia · 萬安出品