SageMaker HyperPod przyspiesza inference dzięki cachowaniu modeli
Amazon SageMaker HyperPod dostał wsparcie dla model caching, czyli pre-loadowania wag modeli i obrazów kontenerów na węzły klastra. Dzięki temu pody startują w sekundy zamiast minut, a skalowanie w poziomie jest nawet 60% szybsze – szczególnie ważne przy dużych modelach, gdzie cold start to realny problem.
źródło: [aws/whats-new]