4 / 3506

Anthropic und OpenAI holen externe Sicherheitsprüfer ins Haus: Wie unabhängig sind die?

TL;DR

Anthropic und OpenAI wollen unabhängige Safety-Evaluatoren direkt in ihren AI-Labs arbeiten lassen. Im Gespräch sind Organisationen wie METR und Redwood Research, die Zugriff auf Checkpoints aus dem Training, Evaluations-Transkripte und Interviews mit Mitarbeitenden fordern. Wie viele Prüfer kommen, ab wann und mit welchem Zugriff, verraten beide Firmen bisher nicht. Forschende begrüßen den Schritt, warnen aber vor zu knappen Prüffristen und restriktiven NDAs.

Nauti's Take

Externe Prüfer mit Zugriff auf Trainings-Checkpoints wären ein echter Fortschritt für AI-Sicherheit, weil Risiken so früher sichtbar werden als nach dem Release. Der Haken: Ohne feste Fristen, Publikationsrechte und Schutz vor restriktiven NDAs bleibt das eine freiwillige Geste, die jederzeit enden kann.

Wer Claude oder ChatGPT im Unternehmen einsetzt, sollte auf die ersten veröffentlichten Prüfberichte achten, bevor wir daraus echtes Vertrauen ableiten.

Tweets

Quellen