概述OVERVIEW
MoE(Mixture of Experts)是「稀疏激活」的大模型架构:总参数量很大,但每次推理只激活其中一部分「专家」网络。
典型如 DeepSeek R1:总参数 671B,每次推理仅激活约 37B——容量与算力成本解耦。
关键数字KEY NUMBERS
| 项目 | 数值 / 口径 |
|---|
| 示例总参数 | DeepSeek R1 671B |
| 每次激活 | 约 37B |
| 显存含义 | 全部参数仍需落卡 |
| B300 NVL8 对照 | 2.3TB 总显存可满血单机部署 |
在 B300 上的意义ON B300
MoE 的显存胃口按总参数算,不是按激活参数算——这是 B300 这类大显存机型的核心价值场景。
推理吞吐的瓶颈常在专家并行的通信上,互联与网络配套同样关键。
边界与注意LIMITS
- 全部参数必须装进显存,容量不足就只能量化或裁剪。
- 专家负载均衡是工程难题,实际效率因框架与配置差异极大。
参考资料REFERENCES
- NVIDIA 官网 — Blackwell Ultra / HGX B300 产品页 https://www.nvidia.com/en-us/data-center/hgx/
- 行情与在售数据:萬安算交所(本库行情带)
版本与勘误|本词条由算力百科编辑部维护,AI 辅助起草、人工核验事实。更新于 2026-10-09 · 版本 v1.0 · 历次改动均留痕可查。