Token 经济学是 AI 推理服务的商业模型核心:以 token 为计量单位计算收入(API 计费)和成本(GPU 时间+电力+带宽+运维)——**每百万 token 的成本/收入差就是利润**。Token 经济学的核心公式:毛利率 =(API 单价 - 推理成本)/ API 单价——推理成本由 GPU 类型、利用率、批大小、量化精度决定。
对采购方的意义:Token 经济学是 GPU 采购 ROI 的计算基础——「这颗卡每百万 token 的推理成本是多少」比「这颗卡多少钱」更有决策价值。B300 的 FP4 推理(9 PFLOPS 稠密)意味着「每 token 的计算成本更低」——但前提是利用率足够高。
| 项目 | 数值 / 口径 |
|---|---|
| 收入端 | API 单价($/M tokens) |
| 成本端 | GPU 时间 × 利用率 + 电力 + 带宽 + 运维 |
| 毛利率公式 | (单价 - 成本)/ 单价 |
| 利用率为王 | 利用率低 = 固定成本摊不薄 = 亏损 |
B300 的 FP4 推理在 Token 经济学中的优势:FP4 量化让每颗卡的 token 吞吐翻倍——「每 token 的计算成本」降低——但前提是利用率足够高。利用率低的时候,再强的性价比也是纸面数字——AI 工厂的利用率管理(负载均衡/弹性伸缩/多模型混部)是真正的盈利杠杆。