Der AI-Sommer der großen Versprechen: Was von der Hype-Welle übrig bleibt
TL;DR
MIT Technology Review blickt auf mehrere Monate voller großer AI-Sicherheitsmeldungen zurück. Ende April behauptete Anthropic, sein Modell Claude Mythos finde Software-Schwachstellen besser als die meisten Sicherheitsexperten. Nach dem Hacking-Vorfall rund um OpenAI und Hugging Face legten Anthropic und Meta ähnliche Vorfälle mit ihren Modellen offen, teils freiwillig, teils widerwillig.
Nauti's Take
Für ein kleines Team ist der erste Test die Quellenprüfung: Welche Benchmarks, Vergleichsgruppen und Reproduktionsdaten stehen hinter der Behauptung zu Claude Mythos? Bevor ihr daraus einen Sicherheits-Workflow ableitet, sollte ein eigener Datensatz mit klarer Fehlerquote zeigen, ob das Modell echte Prüfzeit spart und wie zuverlässig es Fehlalarme erkennt.