6 / 3483

Kleine LLMs auf SageMaker AI im Benchmark: G7 gegen G5 und G6

TL;DR

AWS vergleicht zwei Mixture-of-Experts-Modelle mit 30 Milliarden Parametern, Qwen3-Coder-30B und NVIDIA Nemotron-3-Nano-30B, auf den GPU-Instanzen G5, G6, G6e und G7 von Amazon SageMaker AI. Gemessen werden Durchsatz, Latenz und Kosten pro Token. Die G7-Instanzen mit NVIDIA-Blackwell-GPUs liefern dabei messbare Vorteile beim Preis-Leistungs-Verhältnis für LLM-Inferenz in Echtzeit.

Nauti's Take

Durchsatz, Latenz und Kosten pro Token über vier Instanztypen hinweg geben eine belastbare Grundlage für die eigene Kalkulation, und darin liegt die Chance dieser Messreihe. Die Grenze ist die Übertragbarkeit, denn zwei 30B-Modelle im AWS-Setup sagen wenig über deine Prompts und deine Last.

Teams mit laufender Inferenz-Rechnung sollten den Benchmark nachbauen, alle anderen nehmen die Richtung mit.

Quellen