DeepSeek-V4 Flash 0731 vs GPT-5.6 Luna on DeepSWE: Cost and Coding
TL;DR
Together AI hat 900 DeepSWE-Rollouts auf DeepSeek-V4 Flash 0731 und GPT-5.6 Luna laufen lassen und beide Modelle direkt gegeneinander gestellt. Bei der Trefferquote (pass@1) liegt Luna 14 Punkte vorn und löst damit spürbar mehr Aufgaben schon im ersten Versuch. DeepSeek-V4 Flash dreht das Bild beim Preis: Pro Dollar schafft das Modell 4,8-mal so viele gelöste Tasks. Wenn du Coding-Jobs in großen Mengen abarbeitest, entscheidet am Ende dein Budget pro Task.
Nauti's Take
Der Kostenvorteil von DeepSeek-V4 Flash ist real: 4,8-mal so viele gelöste Tasks pro Dollar verändert die Rechnung für alles, was in großen Mengen läuft, etwa Migrationen oder Testabdeckung. Die Grenze zeigt sich bei der Qualität, denn 14 Punkte weniger pass@1 bedeuten mehr Durchläufe und mehr Review-Zeit, die den Preisvorteil auffressen können.
Wer Coding-Jobs im Batch fährt, sollte für den eigenen Aufgabenmix nachrechnen. Wer auf den ersten Treffer angewiesen ist, bleibt bei Luna.