bartek@aws: ~/news
$ whoami
$ AWS Architect · DevOps · Cloud

tag: Curvine

pokaż wszystkie
środa, 12 sierpnia 2026

Tiered KV cache dla dużych LLM-ów na Amazon SageMaker HyperPod

Amazon SageMaker HyperPod z Curvine rozwiązuje klasyczny problem przy skalowaniu inferencji LLM-ów: zamiast wybierać między droższymi GPU-ami a wolnym czasem do pierwszego tokena, można teraz rozszerzyć cache na rozproszoną pulę NVMe. Repliki modelu korzystają z cache'u prawie z prędkością lokalnego dysku, ale na znacznie tańszych instancjach.

źródło: [aws/machine-learning-blog]