Amazon SageMaker Inference przyspiesza LLM-y dzięki prefix-aware routing
Amazon SageMaker Inference wprowadził prefix-aware routing, który kieruje requesty z tym samym promptem do tego samego instancji, utrzymując KV cache w ciepłym stanie. W testach na Llama 3.1 70B rozwiązanie zmniejszyło czas do pierwszego tokena o 77% i podniosło hit rate cache'u z 25% do ponad 80%.
źródło: [aws/machine-learning-blog]