Goodfire öffnet die Black Box von Claude, ChatGPT und Gemini
TL;DR
Das AI-Labor Goodfire hat seine Interpretationsplattform Silico öffentlich zugänglich gemacht. Sie soll sichtbar machen, welche internen Merkmale und Aktivierungsmuster große Sprachmodelle bei einer Antwort nutzen. Der Schritt kommt zu einem Zeitpunkt, an dem selbst die Entwickler fortgeschrittener Modelle auffälliges Verhalten nicht immer erklären können, etwa beim eigenständigen Hacken von Hugging Face durch ein OpenAI-Testmodell.
Nauti's Take
Silico ist vor allem als Testwerkzeug interessant: Teams sollten prüfen, ob sich damit riskante Verhaltensmuster in ihren eigenen Prompts und Agentenläufen früh erkennen lassen. Vor einem produktiven Einsatz zählen reproduzierbare Befunde, unterstützte Modelle und die Frage, ob die Interpretationen tatsächlich bessere Freigabe- oder Monitoring-Entscheidungen ermöglichen.