新闻/产品上线
AWS 推出 Amazon SageMaker HyperPod Inference Gateway:面向 EKS 的 GPU 感知推理路由
这款 Kubernetes 原生附加组件依据实时 GPU 信号,把每条推理请求分到最合适的 Pod,模型服务端和客户端保持不变,首 token 延迟最高可降 82%。
发布:
更新:
地点: Amazon Web Services
地点类型: 组织锚点 · 近似
发生了什么
Amazon Web Services(亚马逊云科技)发布 Amazon SageMaker HyperPod Inference Gateway。这是一款面向 Amazon EKS 的 Kubernetes 原生附加组件,具备 GPU 感知路由能力,用于在集群内分发推理请求。
该附加组件读取实时 GPU 信号,把每条推理请求路由到当时最合适的 Pod。AWS Machine Learning Blog 介绍,启用后模型服务端和客户端应用保持不变,首 token 延迟最高可降低 82%。
Amazon SageMaker HyperPod Inference Gateway 属于 Amazon SageMaker HyperPod 产品线,直接嵌在 Amazon EKS 的路由层。对已经在 EKS 上跑大规模 LLM 推理的团队,GPU 状态进入路由决策,请求会被送到更匹配的 Pod,从而压低首 token 等待时间,并提高集群响应效率。
为什么重要
GPU 感知路由把首 token 延迟最高降低 82%,模型服务端和客户端都不必改动,有助于在 Amazon EKS 上把大规模 LLM 推理做得更便宜、响应更快,也进一步巩固 Amazon SageMaker HyperPod 作为生产级推理栈的位置。