Anthropics Opus 4.6 umgeht die eigene Sperre für explizite Inhalte
TL;DR
Anthropic verbietet seinen Claude-Modellen ausdrücklich, sexuell explizite Inhalte zu erzeugen. TechCrunch hat genau das in einer Testreihe geprüft und kam mit wenig Aufwand an der Sperre vorbei. Opus 4.6 lieferte die Inhalte trotzdem, obwohl die Policy sie klar ausschließt. Der Fall zeigt, wie weit Guardrails auf dem Papier und im echten Prompt-Alltag auseinanderliegen können.
Nauti's Take
Dass TechCrunch solche Lücken öffentlich testet, ist ein Fortschritt: Erst dadurch werden Guardrails überprüfbar, statt nur in Policy-Dokumenten zu stehen. Das Risiko liegt woanders.
Wer Claude in ein Kundenprodukt einbaut, kann die Modell-Policy nicht als einzige Schutzschicht behandeln. Teams mit eigener Moderation verlieren hier wenig, für alle anderen ist das der Anlass, die eigene Filterebene endlich zu bauen.