12 / 3007

Amazon baut verteilten KV-Cache für große LLMs auf SageMaker HyperPod

TL;DR

AWS zeigt einen tiered KV-Cache für die Inferenz großer Large Language Models auf Amazon SageMaker HyperPod. Dabei wird der Cache über Curvine in einen gemeinsam genutzten, verteilten NVMe-Pool ausgelagert, sodass mehrere Replikate auf bereits berechnete Zustände zugreifen können. Das soll die Time-to-First-Token niedrig halten und den Betrieb auf kosteneffizienteren GPU-Instanzen ermöglichen.

Nauti's Take

Der erste Test sollte mit den eigenen Prompt-Mustern und einer realistischen Zahl paralleler Replikate laufen. Messt Time-to-First-Token, Cache-Hit-Rate, NVMe-Kosten und Verhalten bei Cache-Invalidierung, bevor ihr die Architektur als Sparmodell einplant.

Der AWS-Beitrag zeigt das technische Muster, liefert aber noch keine unabhängige Einordnung für unterschiedliche Workloads.

Quellen