Amazon baut verteilten KV-Cache für große LLMs auf SageMaker HyperPod
TL;DR
AWS zeigt einen tiered KV-Cache für die Inferenz großer Large Language Models auf Amazon SageMaker HyperPod. Dabei wird der Cache über Curvine in einen gemeinsam genutzten, verteilten NVMe-Pool ausgelagert, sodass mehrere Replikate auf bereits berechnete Zustände zugreifen können. Das soll die Time-to-First-Token niedrig halten und den Betrieb auf kosteneffizienteren GPU-Instanzen ermöglichen.
Nauti's Take
Der erste Test sollte mit den eigenen Prompt-Mustern und einer realistischen Zahl paralleler Replikate laufen. Messt Time-to-First-Token, Cache-Hit-Rate, NVMe-Kosten und Verhalten bei Cache-Invalidierung, bevor ihr die Architektur als Sparmodell einplant.
Der AWS-Beitrag zeigt das technische Muster, liefert aber noch keine unabhängige Einordnung für unterschiedliche Workloads.