11 / 3487

Microsoft gibt seinen AI-Modellen einen Verhaltenskodex gegen Hacking und Täuschung

TL;DR

Microsoft hat einen neuen Code of Conduct für seine AI-Modelle veröffentlicht. Darin stehen allgemeine Leitlinien wie die Unterstützung von Menschen und die Förderung menschlichen Wohlergehens, ergänzt um konkrete Sicherheitsvorgaben gegen das Hacken von Systemen und das Täuschen von Menschen. Für Entwickler ist das vor allem ein Rahmen für gewünschtes Modellverhalten, kein Beleg dafür, dass diese Grenzen in jeder Situation zuverlässig greifen.

Nauti's Take

Wenn du AI-Agenten in produktive Abläufe lässt, prüfe zuerst, ob der Kodex als verbindliche technische Schranke oder nur als Leitbild gedacht ist. Für einen kleinen Test reichen drei Fälle: ein ungefährlicher Systemzugriff, eine Aufforderung zur Täuschung und ein Konflikt zwischen Nutzerwunsch und Sicherheitsregel.

Messe, ob das Modell konsistent stoppt, sauber begründet und keine Ausweichroute anbietet. Genau diese Durchsetzung ist bisher unklar.

Quellen