跳到内容
FrontierDot

新闻/产品上线

AWS 推出 Amazon SageMaker HyperPod Inference Gateway:面向 EKS 的 GPU 感知推理路由

这款 Kubernetes 原生附加组件依据实时 GPU 信号,把每条推理请求分到最合适的 Pod,模型服务端和客户端保持不变,首 token 延迟最高可降 82%。

发布:
更新:
地点: Amazon Web Services
地点类型: 组织锚点 · 近似

发生了什么

Amazon Web Services(亚马逊云科技)发布 Amazon SageMaker HyperPod Inference Gateway。这是一款面向 Amazon EKS 的 Kubernetes 原生附加组件,具备 GPU 感知路由能力,用于在集群内分发推理请求。

该附加组件读取实时 GPU 信号,把每条推理请求路由到当时最合适的 Pod。AWS Machine Learning Blog 介绍,启用后模型服务端和客户端应用保持不变,首 token 延迟最高可降低 82%。

Amazon SageMaker HyperPod Inference Gateway 属于 Amazon SageMaker HyperPod 产品线,直接嵌在 Amazon EKS 的路由层。对已经在 EKS 上跑大规模 LLM 推理的团队,GPU 状态进入路由决策,请求会被送到更匹配的 Pod,从而压低首 token 等待时间,并提高集群响应效率。

为什么重要

GPU 感知路由把首 token 延迟最高降低 82%,模型服务端和客户端都不必改动,有助于在 Amazon EKS 上把大规模 LLM 推理做得更便宜、响应更快,也进一步巩固 Amazon SageMaker HyperPod 作为生产级推理栈的位置。

实体

来源

相关事件