Token-Preis täuscht: So findest du das richtige OpenAI-Modell auf Amazon Bedrock
TL;DR
Wer AI-Modelle nur nach Dollar pro Million Tokens vergleicht, rechnet an der Realität vorbei. AWS zeigt ein Open-Source-Benchmarking-Harness, das misst, was der Betrieb wirklich kostet: Preis pro korrekter Antwort, Kosten einer kompletten Agent-Trajektorie und die Qualität der Ergebnisse nach festem Bewertungsraster. Getestet werden die OpenAI-Modelle auf Amazon Bedrock. Das billigste Modell pro Token ist dabei selten das günstigste für deinen Workload.
Nauti's Take
Der Benchmark misst endlich die Größe, die im Betrieb zählt: Kosten pro korrekter Antwort statt Preis pro Million Tokens. Das ist ein handfester Vorteil für Teams, die Agents produktiv betreiben und bisher im Blindflug budgetiert haben.
Das Risiko liegt in der Übertragung: Die Zahlen gelten für Bedrock und für die Aufgaben im Harness, die Rubric-Wertung bleibt Auslegungssache. Wer echte Workloads fährt, sollte den Test mit eigenen Aufgaben wiederholen.