Tiered KV cache dla dużych LLM-ów na Amazon SageMaker HyperPod
Amazon SageMaker HyperPod z Curvine rozwiązuje klasyczny problem przy skalowaniu inferencji LLM-ów: zamiast wybierać między droższymi GPU-ami a wolnym czasem do pierwszego tokena, można teraz rozszerzyć cache na rozproszoną pulę NVMe. Repliki modelu korzystają z cache'u prawie z prędkością lokalnego dysku, ale na znacznie tańszych instancjach.
źródło: [aws/machine-learning-blog]