2 / 3468

Amazon SageMaker senkt LLM-Latenz mit Prefix-aware Routing

TL;DR

Amazon SageMaker Inference bietet jetzt Prefix-aware Routing an. Anfragen mit demselben Prompt-Präfix landen gezielt auf derselben Instanz, damit der KV-Cache warm bleibt und nicht jedes Mal neu berechnet werden muss. In Benchmarks mit Llama 3.1 70B sank die mittlere Time-to-first-Token (P50) um bis zu 77 Prozent, die Trefferquote des KV-Cache stieg von rund 25 auf über 80 Prozent. Am meisten profitieren Anwendungen mit langen, wiederkehrenden System-Prompts wie Chatbots oder Agenten.

Nauti's Take

Für Teams, die Llama und andere offene Modelle selbst auf SageMaker betreiben, ist das ein handfester Vorteil: Wer lange System-Prompts oder Agenten-Kontexte wiederverwendet, spart Latenz und Rechenzeit, ohne am Modell etwas zu ändern. Die Grenze liegt im Workload, denn bei stark wechselnden Prompts bleibt der Cache kalt, und die 77 Prozent stammen aus AWS-eigenen Benchmarks.

Teste deshalb mit echtem Traffic, bevor du Kapazität umplanst.

Quellen