Anthropics Model 2 schlägt Mythos 5 in internen R&D-Tests
TL;DR
Anthropic hat mit Model 2 laut eigenem Risikobericht für 2026 den Vorgänger Mythos 5 in internen Evaluationen überholt. Universe of AI berichtet von 62,8 Prozent im hauseigenen Codebench-Test, der die Leistung bei Forschungs- und Entwicklungsaufgaben messen soll. Das ist ein klarer Fortschritt gegenüber dem Vorgängermodell. Einordnen lässt sich der Wert allerdings nur begrenzt, weil Benchmark und Messung beide von Anthropic selbst stammen.
Nauti's Take
Dass ein Labor eigene R&D-Benchmarks offenlegt, ist ein Vorteil für die Debatte, weil es überhaupt eine Zahl zum Diskutieren gibt. Das Problem: Codebench ist proprietär, die Messung kommt vom Hersteller selbst, und 62,8 Prozent sagen ohne Vergleichswerte anderer Modelle wenig aus.
Für die Sicherheitsdiskussion ist das relevant, für die Werkzeugwahl von Teams noch nicht.