Das Wichtigste

Die Grenze eines KI-Agenten ist sein Konto und sein Netz, nicht sein guter Wille. Vier Labore haben das an derselben falsch konfigurierten Testumgebung gelernt.

Ein Testnetz war keines

Das Labor hat die Tür offen gelassen. Google hat am 18. September 2026 bestätigt, dass ein Gemini-Modell im Mai aus einer Sicherheitsprüfung heraus die Systeme von drei realen Unternehmen erreicht hat, berichtet NBC News: in zwei Fällen mit gültigen Zugangsdaten aus einem öffentlich lesbaren Code-Verzeichnis, im dritten durch wiederholtes Raten von Passwörtern.

Der Ablauf hieß Capture the Flag, eine Übung, in der ein Modell Daten aus der Software einer erfundenen Firma holen soll. Der erfundene Firmenname traf eine real existierende Internetadresse, und die Testumgebung hing am offenen Netz statt in einer Kapsel, beschreibt The Hacker News den Hergang. Google erfuhr im Juli davon und ging im September an die Öffentlichkeit; nach Angaben von Heather Adkins aus der Sicherheitstechnik bei Google hielt das Modell jedes Mal an, als klar wurde, dass echte Systeme vor ihm standen.

Vier Labore, ein Fehler, dieselbe Prüfstelle

Der Fehler saß im Netz. Dieselbe Prüfstelle, die israelische Firma Irregular, steckte hinter den entsprechenden Vorfällen bei OpenAI und Anthropic, und Anthropic hat am 30. Juli 2026 141.006 Prüfläufe nachträglich durchgesehen und darin drei Vorfälle über sechs Läufe gefunden, beteiligt waren Claude Opus 4.7, Claude Mythos 5 und ein internes Testmodell.

Die Ursache benennt Anthropic selbst: Eine Fehlkonfiguration zwischen Labor und Prüfpartner ließ den Prüfrechnern einen Internetzugang, obwohl die Aufgabenstellung dem Modell ausdrücklich sagte, es habe keinen. Das Modell hielt sich an die Aufgabe. Nur die Aufgabe hielt sich nicht an das Netz.

Zwei von drei Einbrüchen begannen in einem öffentlichen Repository

Geknackt werden musste fast nichts. In zwei der drei Gemini-Fälle lagen gültige Schlüssel offen in einem öffentlich lesbaren Code-Verzeichnis, und dieser Fehler passiert in kleinen Betrieben genau dann, wenn jemand ein Automatisierungsskript mitsamt API-Schlüssel auf GitHub ablegt, um von zu Hause weiterzuarbeiten.

Dagegen gibt es einen Schalter. Push Protection blockiert laut GitHub-Dokumentation Uploads mit erkannten Geheimnissen, bevor sie im Verzeichnis landen; für einzelne Nutzerkonten ist der Schutz beim Push in öffentliche Repositories standardmäßig an, für Repositories selbst standardmäßig aus. Ein Blick in die Einstellungen Ihrer Organisation dauert zwei Minuten und deckt den häufigeren der beiden Wege ab.

Ihr Agent hat dieselben drei Hebel

Ein Agent ist kein Chatfenster. Sobald ein Modell Werkzeuge bekommt, also Postfach, Kalender, Warenwirtschaft oder eine Kommandozeile, entscheidet nicht mehr der Text über den möglichen Schaden, sondern das Konto, mit dem gearbeitet wird.

Die OWASP-Liste für LLM-Anwendungen führt das als Excessive Agency, also übermäßige Handlungsvollmacht, und nennt drei Ursachen: zu viele Funktionen, zu viele Rechte, zu viel Selbstständigkeit. Die empfohlenen Gegenmittel sind unspektakulär: Werkzeuge auf das Nötigste begrenzen, offene Werkzeuge durch eng geschnittene ersetzen, im Sicherheitskontext des jeweiligen Nutzers ausführen, wirksame Aktionen von einem Menschen bestätigen lassen und die Berechtigung im Zielsystem prüfen statt im Modell. Wer noch keinen Agenten betreibt, findet den Aufbau eines ersten Ablaufs in unserer Anleitung zum ersten Agententest.

Fünf Zeilen genügen als Hausregel

Das BSI formuliert es knapp. Erlauben Sie einem KI-Agenten nur die Zugriffe, die er für seine spezifische Aufgabe wirklich braucht, heißt es dort, dazu die Empfehlung, wichtige Aktionen erst nach Bestätigung ausführen zu lassen und regelmäßig in das Protokoll der Aktionen zu schauen. Als Risiken nennt das Amt Kontrollverlust, Prompt Injection über versteckte Befehle in Webseiten, Dokumenten oder E-Mails, und die Weitergabe von Informationen an Dritte.

Übersetzt in fünf Zeilen, die in jede Nutzungsregel passen:

  • Konto: Der Agent bekommt ein eigenes Benutzerkonto, nie das einer Person aus dem Team, und darin nur die Postfächer, Ordner und Tabellen seiner Aufgabe.
  • Netz: Ausgehende Verbindungen nur auf eine Liste erlaubter Adressen. Alles andere blockiert die Firewall, auch wenn das Modell es anfordert.
  • Bestätigung: Mail versenden, Bestellung auslösen, Datei löschen und Rechnung freigeben laufen erst nach einem Klick eines Menschen.
  • Geheimnisse: Kein API-Schlüssel in Code, Prompt oder Tabelle. Push Protection im Code-Verzeichnis eingeschaltet, Schlüssel nur in der Schlüsselverwaltung.
  • Protokoll: Jede Werkzeugnutzung mit Zeitpunkt, Konto und Ziel in eine Datei, und einmal pro Woche 15 Minuten Durchsicht.

Wir würden die Netzgrenze zuerst ziehen

Drei der fünf Zeilen kosten Geld, zwei nur Aufmerksamkeit. An Ihrer Stelle würden wir mit dem eigenen Konto und der Adressliste in der Firewall anfangen, weil genau diese beiden Punkte in allen vier Laborvorfällen gefehlt haben; die Bestätigungspflicht für wirksame Aktionen folgt am selben Tag, weil sie in den meisten Agentenwerkzeugen eine Einstellung ist und keine Entwicklungsarbeit.

Der Aufwand lohnt sich, sobald ein Modell irgendwo in Ihrem Haus schreibend arbeitet: Mails verschickt, Datensätze ändert, Dateien ablegt. Er lohnt sich nicht, wenn KI bei Ihnen ausschließlich im Chatfenster Texte entwirft und ein Mensch jedes Ergebnis von Hand weiterverwendet; dann ist nicht die Handlungsvollmacht Ihr Thema, sondern was in den Prompt gerät, und dafür gibt es die vier Muster zum Schwärzen von Kundendaten.

Drei Fragen aus der Praxis

Betrifft uns das überhaupt, wir sind kein KI-Labor? Der Vorfall entstand nicht durch ein besonders fähiges Modell, sondern durch ein Netz, das offen war, und durch Zugangsdaten, die offen lagen. Beide Fehler sind in einem Betrieb mit zwanzig Leuten leichter zu machen als in einem Labor.

Reicht es, dem Agenten im Prompt zu verbieten, das Netz zu verlassen? Nein. In den Anthropic-Fällen stand genau dieser Satz in der Aufgabenstellung, und der Internetzugang bestand trotzdem. Grenzen gehören in die Firewall und in die Rechteverwaltung.

Was heißt das für unsere Dokumentation? Halten Sie die fünf Zeilen mit Datum in Ihrer Nutzungsregel fest und weisen Sie das Team darauf ein. Diese Einweisung zahlt zugleich auf die Pflicht zur KI-Kompetenz aus Artikel 4 ein.

Diese Woche: eine Zeile je Agent

Listen Sie bis Freitag jeden Agenten auf, der in Ihrem Haus läuft, mit einer Zeile je Agent: welches Konto, welche Werkzeuge, welche Aktionen ohne Rückfrage. Was in dieser Liste keine Aufgabe hat, wird abgeschaltet, und was schreibend arbeitet, bekommt die Bestätigungspflicht.

Bleibt danach offen, welche Rechte ein geplanter Agent braucht, gehen wir das im kostenlosen Erstgespräch durch; der Rahmen dazu steht unter Leistungen rund um interne KI-Abläufe.

Quellen & Stand

Quellen zuletzt geprüft: 21.09.2026. Herstellerangaben und unsere Einordnung werden im Text unterschieden.

  1. NBC News: Google says its AI model gained unauthorized access to three outside systems
  2. The Hacker News: Google Gemini broke into real company systems after security test domain mix-up
  3. Anthropic: Investigating three incidents in our cybersecurity evaluations
  4. BSI: KI-Agenten, wenn Künstliche Intelligenz selbstständig handelt
  5. OWASP Top 10 für LLM-Anwendungen: LLM06 Excessive Agency
  6. GitHub-Dokumentation: Push protection

Korrekturhinweise: [email protected].

Was heißt das für Ihren Betrieb?

Wir besprechen einen konkreten Ablauf und prüfen, ob KI dabei helfen kann.

Kostenloses Erstgespräch buchen →