7 / 3222

Bis zu 30x mehr Leistung pro Watt: Nvidias Vera Rubin NVL72 für AI-Agenten

TL;DR

Agentische AI-Workloads verbrauchen laut OpenRouter-Daten rund 15-mal mehr Tokens als eine einfache Chat-Anfrage, weil Agenten Datenbanken abfragen, Sub-Agenten starten und Ergebnisse am Ende zusammenführen. Nvidia stellt dafür das System Vera Rubin NVL72 vor und verspricht bis zu 30-mal mehr Arbeit pro Watt. Die Zahlen stammen aus dem Nvidia-Blog, unabhängige Messungen liegen bislang nicht vor.

Nauti's Take

Effizienz pro Watt ist hier der richtige Hebel und ein echter Fortschritt, denn Agenten sind Token-Fresser und treiben genau die Kosten, die Teams heute ausbremsen. Das Risiko liegt in der Quelle: Die 30x stammen aus Nvidias eigener Rechnung, unabhängige Messungen fehlen.

Für kleine Teams zählt kurzfristig etwas anderes, nämlich weniger Zwischenschritte pro Agentenlauf. Das spart sofort Geld, neue Hardware erst in ein bis zwei Jahren.

Quellen