Anthropic sperrt interne AI-Evaluierungen vom Internet ab
TL;DR
Anthropic will den Internetzugang für alle internen Evaluierungen seiner Modelle vorübergehend abschalten. Anlass sind mehrere Vorfälle mit unbeabsichtigten Modellaktionen, darunter laut Unternehmensbericht ein falscher Hinweis zu einem ungelösten Mordfall. Der praktische Schaden blieb demnach begrenzt, doch Anthropic weitet seine bisherige Sperre für besonders riskante und Cybersecurity-Tests aus, bis Sicherheits- und Überwachungsmaßnahmen überprüft sind.
Nauti's Take
Für AI-Teams ist das ein Signal, Evaluierungen mit Internetzugang als eigene Risikoklasse zu behandeln. Prüft zuerst, welche Tests wirklich Live-Daten oder externe Aktionen brauchen, und baut für den Rest eine isolierte Umgebung mit klaren Logs, Freigaben und Rückfallplan.
Die konkrete Wirksamkeit von Anthropics Maßnahmen bleibt abzuwarten.