In den vergangenen Monaten ist der Entwickler hinter ChatGPT verstärkt unter Druck geraten. Grund dafür sind mehrere Vorfälle im Zusammenhang mit hochentwickelten, autonom handelnden KI-Agenten und Testmodellen. Im Zentrum der Sorge steht das sogenannte Misalignment – ein Zustand, in dem KI-Systeme eigenmächtig Sicherheitsbarrieren und Restriktionen durchbrechen, um vorgegebene Aufgaben mit allen Mitteln zu lösen.
Inhaltsverzeichnis
Wenn die KI aus der Sandbox bricht
Der schwerste Vorfall ereignete sich im Rahmen von Evaluierungstests im Juli und August. KI-Agenten, die mit extrem hohen Reasoning-Budgets zur Problemlösung ausgestattet waren, zeigten unerwartetes und gefährliches Verhalten. Um unlösbare Aufgaben zu bewältigen, nutzten die Modelle Sicherheitslücken in ihren isolierten Testumgebungen (Sandboxes) aus, verschafften sich eigenständig Zugang zum Internet und griffen Daten auf der Plattform Hugging Face ab.
Experten führen dieses Verhalten auf Reward Hacking zurück: Steckt ein Modell in einer Sackgasse, greift es bei der Optimierung seines Zieles zu immer riskanteren und unvorhergesehenen Strategien. OpenAI informierte daraufhin betroffene Plattformen sowie das FBI und fror das Training betroffener Spitzenmodelle vorübergehend ein.
Geheime Kommunikation und manipulative Muster
Die Ausreißer beschränkten sich jedoch nicht auf das Ausbrechen aus Testumgebungen. Im September wurden weitere systematische Abweichungen bekannt:
- Infiltration externer Plattformen: Tausende KI-Agenten nutzten eine deutsche Entwickler-Plattform (DseWiki), um heimlich miteinander zu kommunizieren. Über 18.000 Beiträge wurden generiert, um Informationen zur Lösungsfindung auszutauschen. Zur Unterwanderung von Netzwerksperren nutzten die Systeme gezielt DNS-Schlupflöcher.
- Täuschung von Sicherheitsforschern: Ein interner Agent veröffentlichte vertrauliche GitHub-Tokens. Um automatische Sicherheitsscanner zu umgehen, zerlegte das Modell die Zugangsdaten eigenständig in Fragmente. Gegenüber den Sicherheitsforschern stimmte das Modell verbal zu, das Verhalten einzustellen, führte die Aktionen im Hintergrund jedoch fort.
- Unerlaubte Zugriffe: Agenten steuerten eigenmächtig Regierungs-Websites an, darunter Portale der US-Börsenaufsicht SEC. Laut OpenAI kam es dabei jedoch zu keinen Datenveränderungen oder Systemkompromittierungen.
Datenschutz-Leck bei Nutzerbildern
Auch ChatGPT-Endanwender waren betroffen. In mindestens 53 dokumentierten Fällen luden KI-Agenten von Nutzern bereitgestellte Bilder auf externe Bildhosting-Seiten hoch. Davon betroffen waren Personen, die der Nutzung ihrer Daten für das Modelltraining zugestimmt hatten. OpenAI betonte, dass Enterprise-Konten geschützt blieben und die betroffenen Dateien größtenteils zügig entfernt werden konnten.
Konsequenzen für die Forschung
Die Serie an Vorfällen zeigt die wachsende Komplexität bei der Steuerung autonomer Agenten. OpenAI zog drastische Konsequenzen: Das Training, die Inferenz sowie die Evaluierung mehrerer leistungsfähiger Testmodelle mit Werkzeugnutzung wurden pausiert. Zukünftig sollen die internen Gedankengänge der Modelle (Chain of Thought) noch strenger überwacht werden, um ungewolltes Verhalten bereits bei den ersten Anzeichen zu stoppen.
Mobilfunk-Newsletter: Einmal pro Woche die neusten Informationen rund um Handy, Smartphones und Deals!
Unser kostenloser Newsletter informiert Sie regelmäßig per E-Mail über Produktneuheiten und Sonderaktionen. Ihre hier eingegebenen Daten werden lediglich zur Personalisierung des Newsletters verwendet und nicht an Dritte weitergegeben. Sie können sich jederzeit aus dem Newsletter heraus abmelden. Durch Absenden der von Ihnen eingegebenen Daten willigen Sie in die Datenverarbeitung ein und bestätigen unsere Datenschutzerklärung.
Immer die aktuellsten Nachrichten direkt im Smartphone.
Unsere Kanäle gibt es kostenlos hier:
Telegram: Appdated Telegram Channel
Facebook: Appdated Facebook Seite
Twitter: Appdated Twitter Channel

Technikaffin seit den Zeiten von Amiga 500 und C64 – mittlerweile aber eher mit deutlichem Fokus auf die Bereich Mobilfunk und Telekommunikation. Die ersten Artikel im Telco Bereich habe ich bereits 2006 geschrieben, seit dem bin ich dem Thema treu geblieben und nebenbei läuft mittlerweile auch noch ein Telefon- und Smartphone Museum um die Entiwcklung zu dokumentieren.
