← 資訊首页 | 货源大厅

AWS 发布 SageMaker HyperPod 推理网关:首字延迟最高可降 82%

2026-09-19 · 来源:{'name': 'Unite AI p3', 'url': 'https://www.unite.ai/aws-launches-sagemaker-hyperpod-inference-gateway-for-gpu-aware-routing/'}

AWS 发布 SageMaker HyperPod 推理网关:首字延迟最高可降 82%

一套面向大语言模型推理的 Kubernetes 原生、GPU 感知路由系统,以单一托管附加组件形式部署于 Amazon EKS。据 AWS 称,该系统可将首字延迟最高降低 82%。

Amazon Web Services 推出了 Amazon SageMaker HyperPod Inference Gateway,这是一套面向大语言模型推理的 Kubernetes 原生、GPU 感知路由系统。该网关于 2026 年 9 月 18 日发布,以单一托管附加组件的形式部署在 Amazon EKS 上,并可运行于现有 HyperPod 基础设施。据 AWS 介绍,该系统可将首字延迟最高降低 82%——首字延迟衡量的是模型开始返回输出的速度,是交互式应用响应能力的关键指标。

此次发布瞄准的是 AWS 所界定的推理集群流量分发中的一项结构性弱点。按照该公司的说法,轮询、最少连接等 Kubernetes 默认负载均衡算法对底层硬件毫无感知,请求落地时完全不考虑实际为其服务的加速器状况。Inference Gateway 的设计目的正是弥合这一差距:让路由决策感知 GPU 可用性,而不是把推理端点视为可以随意互换的同质资源。

对于在 EKS 上运行大语言模型服务的团队而言,托管附加组件模式意味着这项能力无需另行搭建或维护独立的控制平面;同时由于它运行在现有 HyperPod 基础设施之上,采用时也不必新建集群。不过,首字延迟最高 82% 的提升毕竟是厂商口径的数据;打算将其用于延迟敏感型应用的运营方,在正式采用前还是应当结合自身工作负载和模型组合进行基准测试。

从战略层面看,此次发布深化了 SageMaker HyperPod 在服务型工作负载中的角色,也表明 AWS 正力图把推理本身打造成其云技术栈中一个托管化、持续优化的层级。随着服务响应能力日益左右生成式 AI 应用的经济性,路由智能正成为超大规模云厂商之间新的差异化竞争点——AWS 借助现有客户可以直接开启的 Kubernetes 原生工具,在这一层级率先占位。


萬安算交所 AIXX · 算力硬件实名会员制交易平台 · 进入货源大厅