Ein fremder Verstand: OpenAI-Chefwissenschaftler sieht Alignment ungelöst
TL;DR
OpenAI-Chefwissenschaftler Jakub Pachocki schreibt in seinem Essay An Alien Mind, dass bislang kein Labor Alignment und Monitoring gut genug gelöst hat, um weiter mit Vollgas zu skalieren. Er rechnet damit, dass freiwillige Tempodrosselungen zur Normalität werden, bis sich die Branche auf gemeinsame Sicherheitsschwellen einigt. Selbstverpflichtungen wie OpenAIs Preparedness Framework sollen zu verbindlichen Vorgaben werden, kontrolliert von unabhängigen Prüfstellen oder Behörden.
Nauti's Take
Dass ausgerechnet OpenAIs Chefwissenschaftler öffentlich einräumt, dass Alignment ungelöst ist und die Kontrolle der Gedankenketten an Zuverlässigkeit verliert, ist ein Fortschritt für die Debatte. Die Grenze liegt in der Verbindlichkeit, denn ein Essay ersetzt keine Prüfstelle und freiwillige Tempodrosselung bleibt freiwillig.
Wer Agenten produktiv betreibt, prüft jetzt die eigenen Monitoring-Annahmen, statt sich auf die Selbstauskunft der Modellanbieter zu verlassen.