Stuart Russell: Für AI-Sicherheit reicht es nicht, das Tempo zu drosseln
TL;DR
AI-Forscher Stuart Russell fordert, dass Sicherheitsanforderungen nicht verhandelbar sind und an konkrete, überprüfbare Ziele geknüpft werden, statt nur den Zeitplan zu strecken. Sein Gastbeitrag folgt auf eine turbulente Woche, ausgelöst durch den Rücktritt des Sicherheitsforschers Jacob Coxon bei Anthropic. Davor sorgten wochenlang beunruhigende Enthüllungen rund um den Vorfall bei OpenAI und Hugging Face für Aufsehen. Ein langsameres Tempo ohne messbare Kriterien löst für Russell das eigentliche Problem nicht.
Nauti's Take
Russells Forderung nach messbaren Sicherheitszielen ist ein Fortschritt, weil sie die diffuse Pausendebatte in Kriterien übersetzt, die Behörden und Firmen prüfen können. Die Herausforderung: Solche Tests für Systeme mit kaum verstandenen Fehlerbildern zu definieren, ist schwer, und Labs könnten jeden Benchmark als Pflichthäkchen behandeln.
Wenn du Agents einsetzt, kannst du die Logik sofort übernehmen und feste Freigabekriterien festlegen, statt dich auf Zeitpläne von Anbietern zu verlassen.