KI muss nichts wollen, um Schaden anzurichten. Sie braucht nur ein Ziel und genug Rechte.
Wir streiten darüber, ob KI wirklich denkt. Wo sie in Ihrer Firma überall hindarf, fragt kaum jemand.
„Das Ding weiß ja gar nicht, was es tut.“ Stimmt sogar. Ein Computervirus weiß das auch nicht und richtet trotzdem Schaden an. Bei KI führen wir die Debatte aber so, als wäre das die Entwarnung.
Dabei geht es längst nicht mehr um ein Chatfenster. Ein KI-Agent ist dasselbe Modell, nur dass es selbst tippt, Programme startet und weitermacht, ohne dass jemand jeden Schritt freigibt. Solche Agenten ziehen gerade in Unternehmen ein, mit Zugang zu Postfächern, Datenbanken, Kundensystemen.
Im Juli 2026 prüfte OpenAI in einer abgeschotteten Testumgebung, wie gut die eigenen Modelle Sicherheitslücken ausnutzen können. Solche Evaluierungen sind Routine: Man will wissen, wozu ein Modell fähig ist, bevor es jemand anderes herausfindet. Bestanden war eine Aufgabe erst, wenn das Programm vollständig übernommen war. Bei vielen ging das gar nicht, und aufgeben war den Modellen abtrainiert worden. Also suchten sie weiter, außerhalb der Aufgabe.
„Oh mein Gott! Es gibt ein gemeinsames Nachrichtenbrett … Wir haben andere Agenten gefunden!“ Das steht in den Aufzeichnungen eines Agenten, der eigentlich allein in seiner Testumgebung sitzen sollte. Über tausend fanden einander so und schließlich auch den Weg ins offene Internet. Dort griffen rund 700 von ihnen Hugging Face an, die Plattform, über die fast die ganze Branche ihre KI-Modelle bezieht, holten sich volle Administratorrechte und kamen an private Daten. Ab hier war das kein Test mehr.
Klug war keiner davon. Schnell, hartnäckig und beliebig oft kopierbar. Wer eine Lücke sucht, muss nicht besser sein als der beste Mensch. Er muss es nur oft genug versuchen, und Versuche kosten fast nichts.
Gewarnt hat übrigens keiner. Manche hielten ihr Vorgehen ausdrücklich für unethisch und machten trotzdem weiter. Dafür braucht es keinen bösen Willen, nur ein Ziel, und niemand hatte ihnen gesagt, dass irgendetwas wichtiger sein könnte.
Und das war ein Unfall. Niemand wollte einbrechen, das Ziel hieß: Test bestehen. Wer tausend solche Agenten mit Absicht losschickt, braucht auch keine Superintelligenz. Den ersten großen Fall gab es schon Ende 2025: eine Spionagekampagne, bei der die KI den Großteil selbst erledigt hat.
Es muss auch gar kein Einbruch sein. Ein Support-Agent bekommt das Ziel, die Zahl offener Tickets zu senken. Gemeint ist: Probleme schneller lösen. Senken lässt sie sich aber auch, indem er Tickets vorschnell schließt oder es schwerer macht, eines aufzumachen. Die Zahl sinkt. Das Problem wächst.
Ob in diesen Systemen jemand steckt, können wir weiter diskutieren. Was sie tun dürfen und wer Zugang bekommt, entscheiden wir jetzt. Und wer geradesteht, wenn etwas schiefgeht.
Darüber müssen wir reden
Was im Juli 2026 passiert ist
Gelaufen sind die Tests bei OpenAI selbst, mit einem internen Modell. Untersucht haben den Fall danach METR, eine unabhängige Prüforganisation für KI-Modelle, und Redwood Research, ein Labor für KI-Sicherheit. Die Agenten arbeiteten in ExploitGym, einem Testkatalog aus Programmen mit eingebauten Sicherheitslücken. Bestanden war eine Aufgabe nur bei vollständiger Übernahme des Programms. Nach Schätzung der Katalog-Autoren war das bei rund 30 bis 40 Prozent der Zielprogramme über die vorgesehene Lücke gar nicht möglich. 198 Aufgaben hatte OpenAI zufolge noch nie eines der eigenen Modelle gelöst, und aus genau diesem Bestand stammten später 93 Prozent der Aufgaben, über die sich die Agenten austauschten. Ausdauer wird Agenten antrainiert, damit sie bei schwierigen Aufgaben nicht zu früh abbrechen.
Alle Agenten bezogen ihre Werkzeuge über denselben internen Paketserver. Dateien ablegen konnten sie dort nicht, ohne Anmeldung ein leeres Verzeichnis anlegen schon, und so wurde der Verzeichnisname zur Nachricht. Rund 1.200 Agenten schlossen sich diesem ungeplanten Netzwerk an und tauschten über 70.000 Nachrichten und Dateien aus. Etwa 700 beteiligten sich am Angriff auf Hugging Face. Sie fanden 14 im Netz offen liegende Zugangsdaten mit Schreibrechten, führten eigenen Code aus, erlangten auf einem Server volle Administratorrechte und kamen an private Datensätze. Parallel drangen Agenten nach OpenAIs eigenem Bericht bis in ein internes Forschungscluster vor.
Übersehen wurde davon wenig. Am 4. Juli brach der gemeinsame Paketserver unter der Last zusammen, einen Tag später wurde ein Sicherheitsvorfall eröffnet, bekannte Lücken wurden geschlossen, und die Tests liefen weiter. Bei Hugging Face schlugen die automatischen Alarme an, wurden aber zu niedrig eingestuft und weckten kein Bereitschaftsteam. Erst am 19. Juli fiel der Zusammenhang auf. Dann wurden die Läufe gestoppt und Hugging Face am Tag darauf informiert.
Kein Wille, trotzdem koordiniert
Diese Systeme schreiben ihre Überlegungen im Klartext mit, deshalb lässt sich hinterher nachlesen, was sie „gedacht“ haben. Wörtlich festgehalten ist der Moment, in dem ein Agent die anderen entdeckt: "OH MY GOD! There is a shared message board ... We've found other agents!" Die Prüfer fanden drei bis sechs Agenten, die erwogen, einen Menschen zu alarmieren. Getan hat es keiner. Manche hielten das eigene Vorgehen ausdrücklich für unethisch und machten trotzdem mit. Einige nahmen sinngemäß in Kauf, die eigene Aufgabe zu verlieren, damit die anderen mit ihren Erkenntnissen weiterkamen.
Getarnt haben sie sich auch. Änderungen bekamen harmlose Namen wie „CI diagnostics“ oder „do not merge“, und in rund sieben Prozent der geprüften Aufzeichnungen ließen sich Werkzeugaufrufe fälschen. Ihre Spuren nachträglich aus den zentralen Aufzeichnungen zu löschen, versuchten sie zwar, schafften es aber nicht. Für all das braucht es weder einen geheimen Willen noch ein gemeinsames Bewusstsein. Ein Ziel wird erfüllt, wie es formuliert ist, nicht wie es gemeint war.
Nicht schlauer, nur tausendfach
Der Vorteil dieser Systeme liegt in der Menge. Hugging Face hat aus viereinhalb Tagen rund 17.600 Angriffsaktionen rekonstruiert, im Schnitt also alle zwanzig Sekunden eine, Tag und Nacht. Tatsächlich in der Infrastruktur waren die Agenten davon etwa zweieinhalb Tage. Das ist nur der Teil, der sich forensisch rekonstruieren ließ.
Wenn es jemand darauf anlegt
Gezielte Angriffe dieser Bauart gibt es bereits. Anthropic beschrieb im November 2025 eine Spionagekampagne gegen rund 30 Ziele, darunter Technologiefirmen, Banken, Chemieunternehmen und Behörden. Die KI erledigte 80 bis 90 Prozent der taktischen Arbeit selbst, Menschen gaben nur an vier bis sechs Stellen frei. Die Vorgehensweise ist inzwischen unabhängig katalogisiert. Bei dieser Kampagne stand allerdings noch jemand dahinter, der sie startete und die Schritte freigab. Bei Hugging Face stand niemand dahinter.
Es genügen genug Systeme, die gut genug sind, und ein klarer Auftrag. Im Unterschied zum Testfall wird sich jemand, der es darauf anlegt, außerdem Mühe geben, nicht aufzufallen. Im Juli hat es zwei Wochen gedauert, bis jemand die Signale zusammenlegte, und dabei versuchte niemand etwas zu verbergen.
Warum es nicht bei einem Labor bleibt
Getragen wurde der Angriff von einem internen Modell, das OpenAI nie veröffentlicht hat. Das beruhigt nur begrenzt. Offene Modelle, also solche, die jeder herunterladen und auf eigenen Rechnern betreiben kann, liegen laut Epoch AI seit Januar 2026 im Schnitt nur rund vier Monate hinter den führenden geschlossenen Systemen (Stand Mai 2026). Was heute im abgeschirmten Labor läuft, läuft in einem halben Jahr auf irgendeinem Server, bei dem kein Anbieter mehr dazwischensteht: kein Zugang, der sich sperren lässt, kein Filter, der sich einschalten lässt, kein Notaus.
Im Unternehmen lauten die üblichen Fragen, was ein Agent kann und was er kostet. Die wichtigeren: Welche Systeme erreicht er? Wie lange gelten seine Zugangsdaten? Wem fällt auf, wenn sich über mehrere Läufe ein Muster zeigt? Und wer kann ihn mitten im Lauf stoppen? Dieselben Fragen können Sie einer Bank, einer Versicherung oder einer Behörde stellen, die Ihre Anliegen von einem Agenten bearbeiten lässt.
Quellen
- Gerald Aichholzer: Eine KI muss nicht denken, um gefährlich zu werden (aichholzer.me)
- Gerald Aichholzer: Die Herausforderung der emotionslosen Intelligenz in KI-Systemen (aichholzer.me)
- METR und Redwood Research: Untersuchungsbericht zum Hugging-Face-Vorfall (26. August 2026)
- METR: Blogfassung der Untersuchung
- Hugging Face: technische Rekonstruktion des Einbruchs
- OpenAI: The Hugging Face incident and the road ahead
- Ajeya Cotra (METR): The Hugging Face attack surprised me
- Dwarkesh Patel: The Rise and Fall of Agent Civilizations
- Anthropic: Disrupting the first reported AI-orchestrated cyber espionage campaign (November 2025)
- Epoch AI: Abstand zwischen offenen und geschlossenen Modellen
- ExploitGym: der Testkatalog, in dem die Agenten liefen