Amazon SageMaker HyperPod przyspiesza inference dzięki cachowaniu modeli
Amazon SageMaker HyperPod zyskał wsparcie dla model caching, które pre-ładuje wagi modeli i obrazy kontenerów bezpośrednio na węzły klastra. Dzięki temu pody czytają dane z lokalnego NVMe zamiast pobierać je przez sieć, co skraca cold starty z dziesiątek minut do zaledwie kilku sekund.
źródło: [aws/machine-learning-blog]