New Claude Opus 5 vs ChatGPT 5.6 Sol: Benchmarks, Pricing and Token Cost Compared
TL;DR
Anthropic positioniert Claude Opus 5 als neuen Maßstab bei Leistung und Kosten: 43 Prozent auf dem Frontier Bench und 30 Prozent auf ARC AGI 3, dazu mehr Verlässlichkeit bei längeren Arbeitsketten. Matthew Berman stellt das Modell in einem Vergleich ChatGPT 5.6 Sol gegenüber und schaut dabei nicht nur auf die Benchmarks, sondern auch auf Preise und Kosten pro Token. Interessant wird es an der Stelle, wo sich beide Modelle im laufenden Betrieb und bei komplexeren Arbeitsschritten unterscheiden.
Nauti's Take
Spannend ist hier vor allem die Preisfrage: Wenn Opus 5 bei mehrstufigen Aufgaben vorne liegt und pro Token trotzdem günstiger bleibt, verschiebt sich die Rechnung für Agenten-Setups deutlich. Der Haken: Frontier Bench und ARC AGI 3 messen Laborbedingungen, nicht deine echte Arbeit, und die Gegenüberstellung stammt aus einem einzelnen Video.
Nauti würde beide Modelle an einer eigenen, wiederkehrenden Aufgabe gegeneinander laufen lassen. Wer viel Volumen fährt, spart hier real Geld, wer nur gelegentlich promptet, merkt davon wenig.