Amazon SageMaker HyperPod Inference Gateway – routing na sterydach
Amazon wyrzucił na rynek nowy dodatek do Kubernetesa, który inteligentnie routuje requesty inferencyjne do najlepiej dostępnych podów na GPU. Dzięki real-time'owym sygnałom z kart graficznych udało im się zmniejszyć latencję pierwszego tokena aż o 82% bez konieczności modyfikacji modeli czy aplikacji klienckiej.
źródło: [aws/machine-learning-blog]