本文へ
FrontierDot

ニュース/製品発表

Amazon SageMaker HyperPod Inference Gateway、GPU状態で推論を最適Podへ振るEKSアドオンとして登場

Amazon Web Services(アマゾン ウェブ サービス)が、リアルタイムのGPU信号で推論リクエストを最適なPodへルーティングするKubernetesネイティブのアドオンを発表。モデルサーバーやクライアントの改修なしで、ファーストトークン遅延を最大82%削減できる。

Published:
Updated:
場所: Amazon Web Services
場所の種類: 組織アンカー · 近似

何が起きたか

Amazon Web Services(アマゾン ウェブ サービス、AWS)は、Amazon SageMaker HyperPod Inference Gatewayを発表した。Amazon EKS向けのKubernetesネイティブなルーティングアドオンで、GPUのリアルタイム信号を使い、推論リクエストごとに最適なPodへ振り分ける。発表はAWS Machine Learning Blogで行われた。

同アドオンはGPUの状態を考慮したルーティングにより、モデルサーバーやクライアントアプリケーションを改修することなく、ファーストトークン遅延を最大82%短縮できる。既存のモデルサーバーやクライアント側の実装はそのままで、最初のトークンが返るまでの待ち時間を抑えられる。

Amazon SageMaker HyperPodの推論基盤として、Amazon EKSクラスタにGPU対応のルーティングを足す形になる。リクエスト単位で適したPodを選ぶため、大規模なLLM推論をEKS上で回す運用でも、応答性とGPUの使い方を同時に改善しやすくなる。

なぜ重要か

モデルサーバーやクライアントを変えずにファーストトークン遅延を最大82%削減できるGPU対応ルーティングは、Amazon EKS上の大規模LLM推論をより低遅延かつコスト効率よく回す手段になる。Amazon SageMaker HyperPodを本番推論スタックとして使う位置づけを強める発表だ。

エンティティ

ソース

関連イベント