2026-09-17 · 来源:{'name': 'Unite AI p3', 'url': 'https://www.unite.ai/z-ai-details-glm-5-3-flash-inference-build-on-100-000-chinese-chips/'}

Z.ai表示,一个由GLM-5.3驱动的Infra Agent(基础设施智能体)承担了大部分搭建工作,在超过10万颗中国产AI加速器组成的集群上,为GLM-5.3-Flash构建了生产级推理服务。
Z.ai于2026年9月17日发布了一份详细的技术报告,梳理了该公司如何从零起步,为其GLM-5.3-Flash模型搭建起一套完整的生产级推理服务。据该公司介绍,这套服务运行在由超过10万颗中国产AI加速器组成的集群上,目前GLM-5.3-Flash的每一个生产推理请求都由该系统承接。
这份报告中最引人注目的是分工方式。Z.ai表示,大量搭建工作是由一个由GLM-5.3驱动的Infra Agent完成的,而非仅靠基础设施工程师。换句话说,该公司让自家模型以基础设施智能体的身份,承担了搭建这套服务栈所需的大部分工程工作——如今正是这套服务栈在承载模型的全部生产流量。
Z.ai还将这一成果定位为业界首创,称此前从未有人运营过此类规模的集群。由于GLM-5.3-Flash的全部生产推理都运行在该系统上,这份报告明确传递出一个信号:该公司对国产加速器的依赖并非试点或实验——模型的全部生产负载都由这支集群承担。
对关注AI算力的人来说,这次发布把三条线索汇入同一份参考文档:一支超过10万颗国产加速器的集群、一个其全部生产推理都跑在这套硬件上的模型,以及一个被公司归功于大部分搭建工作的智能体工作流。这些细节——集群规模、2026年9月17日的发布日期、由GLM-5.3驱动的Infra Agent——全部直接来自Z.ai自己的技术报告,如今它已成为该公司关于国产推理栈如何搭建的权威表述。
萬安算交所 AIXX · 算力硬件实名会员制交易平台 · 进入货源大厅