MIG(Multi-Instance GPU)是 NVIDIA Ampere 架构引入的 GPU 切分技术:把一颗物理 GPU 切成最多 7 个独立实例——每个实例有专属的 SM 核心、L2 缓存、显存分区和带宽,实例间硬件级隔离(不是虚拟化共享)。
MIG 解决的是「一颗大卡跑多个小任务」的问题:推理服务(多个小模型各占一个实例)、开发/测试环境(多人共享一张大卡)、多租户 GPU 池化——单卡利用率从「跑一个大任务 100%」变成「多个小任务各分一块」。MIG 对数据中心运营商的价值是把「一颗 H100 141GB」切成 7 份卖给 7 个客户。
| 项目 | 数值 / 口径 |
|---|---|
| H200 NVL | 最多 7 实例 @ 16.5GB |
| H100 | 最多 7 实例 @ 12GB |
| A100 80GB | 最多 7 实例 @ 10GB |
| L40S | 不支持 MIG |
B300 系的 MIG 切分粒度更细(Blackwell 架构支持更多实例数和更灵活的分区比例)——但 MIG 切分的核心价值不变:把一颗大卡切给多个小用户/小任务。注意 MIG 不等于 vGPU:MIG 是硬件隔离(性能可预期),vGPU 是软件调度(灵活性高但性能波动)——两者定位不同。