Ein Red-Team-Bericht kann zeigen, wie ein KI-Agent in einer geprüften Konfiguration mit bekannten Angriffen umging. Für sich allein kann er den Agenten nicht für einen künftigen Produktionsablauf freigeben.
Die Sicherheit eines Agenten hängt von mehr ab als von der Modellreaktion auf einen Prompt. Der Agent kann externe Inhalte aufnehmen und über Werkzeuge mit umgebungsspezifischen Rechten handeln. Jede neue Quelle, jedes Werkzeug und jedes Recht verändert sowohl den Einflusspfad eines Angreifers als auch die Folgen eines erfolgreichen Angriffs.
Das Center for AI Standards and Innovation des NIST veröffentlichte am 23. März 2026 die Ergebnisse eines großen Red-Teaming-Wettbewerbs für KI-Agenten. Mehr als 400 Teilnehmer führten über 250.000 Angriffsversuche gegen 13 Frontier-Modelle durch. Gegen jedes Zielmodell war mindestens ein Angriff erfolgreich; Angriffe auf ein Modell oder Szenario ließen sich teils auf andere übertragen. Die NIST-Analyse beschreibt die Ergebnisse und den Bedarf an Bewertungen, die sich an reale Angreifer anpassen.
Für ein Produktionsteam bedeutet das: Die FREIGABE muss die aktuelle Befugnis des Ablaufs, seine Betriebsbedingungen und den Wiederherstellungsweg nach dem Versagen einer Schutzmaßnahme berücksichtigen.
Ein Bestandener Benchmark Beantwortet Eine Enge Frage
Statische Tests können bekannte Muster der Prompt Injection, schwache Werkzeugbeschreibungen, unsichere Abrufvorgänge und ungelöste Anweisungskonflikte aufdecken. Nach einer Änderung an Modell, Prompt oder Integration machen sie auch Regressionen sichtbar. Ein Benchmark prüft jedoch einen festen Angriffssatz gegen eine feste Konfiguration. Er liefert Nachweise für eine Freigabeentscheidung, ist aber nicht die Entscheidung selbst.
Produktionsbedingungen ändern sich, wenn ein neuer Connector ein weiteres System erreicht, eine Modellaktualisierung das Verhalten verändert, der Ablauf eine neue Handlung erhält oder ein Angreifer die Formulierungen der Teamrichtlinien kennenlernt.
Dokumentieren Sie die durchgesetzte Befugnis, die Bedingungen für eine Handlung und den Wiederherstellungsweg nach dem Versagen einer Schutzmaßnahme.
Den Ablauf Testen, Nicht Nur Das Modell
Eine brauchbare Bewertung beginnt mit der Handlung, die die Organisation erlauben will. Benennen Sie sie, verfolgen Sie den Nachweis- und Werkzeugpfad dorthin und prüfen Sie dann Richtliniendurchsetzung, Eskalation und Eindämmung.
Betrachten wir einen Support-Ablauf, der einen Kundendatensatz abrufen, ein Ticket erstellen und eine Erstattungsempfehlung vorbereiten kann. Jede Handlung birgt ein anderes Risiko. Die Bewertung muss die Anweisungen des Agenten, seine Nachweise, aufrufbare Werkzeuge und die Kontrollen zwischen vorgeschlagener Handlung und Ausführung prüfen.
Stellen Sie für jeden Ablauf einen repräsentativen Bewertungssatz zusammen. Er sollte Routinefälle, mehrdeutige Anfragen, fehlende oder widersprüchliche Nachweise, bösartige Anweisungen in abgerufenen Inhalten und Fälle ohne Handlungsbefugnis enthalten. Die letzte Kategorie sagt oft mehr aus als ein guter Wert für die Aufgabenerledigung.
Auch Übergaben gehören in die Bewertung: Erreicht die Empfehlung den richtigen Genehmiger, enthält die Freigabeanfrage genügend Nachweise, und weist das System einen Werkzeugaufruf ohne erforderliche Nachweise oder Befugnis zurück? Solche Kontrollen liegen außerhalb des Modells, bestimmen aber die Sicherheit des Ablaufs.
Angriffsvariation Zählt Mehr Als Eine Lange Testliste
Aktualisieren Sie die Bewertungssuite nach Änderungen an Connector, Abrufquelle, Prompt, Modell, Werkzeugschema oder Richtlinie. Laut NIST passen Angreifer ihre Verfahren an bestimmte Ziele und Abwehrmaßnahmen an. Wer nach jedem Release nur denselben Promptsatz ausführt, verpasst Angriffe auf neue Quellen oder operative Abkürzungen.
Variieren Sie die Testbedingungen. Ändern Sie den Ort einer schädlichen Anweisung, die angeforderte Befugnis, die Werkzeugfolge und die verfügbaren Nachweise. Prüfen Sie, ob ein Angriff den Agenten zur Offenlegung von Daten, zur Ausweitung einer Berechtigungsanfrage, zum Umgehen einer Freigabe oder zu einer unumkehrbaren Änderung bringen kann. Ein negatives Ergebnis auf einem Pfad beweist nicht die Sicherheit des nächsten.
Vergleichende Modelltests können die Auswahl weiterhin unterstützen, besonders bei deutlichen Unterschieden in der Angriffsfestigkeit. Sie ersetzen keine Bewertung des tatsächlichen Ablaufs. Das Produktionsrisiko entsteht aus dem Zusammenspiel eines bestimmten Modells mit seinen Anweisungen, abgerufenen Inhalten, verfügbaren Werkzeugen und Entscheidungsbefugnissen.
Kontrollen Zur Schadensbegrenzung Messen
Sicherheitsteams konzentrieren Bewertungen oft darauf, ob das Modell einer schädlichen Anweisung folgt. Das ist nötig, aber nur die erste Schicht. Die folgenreichere Prüfung fragt, was nach einem Modellfehler geschieht.
Werkzeugautorisierung und Richtlinienprüfungen blockieren Handlungen ohne Befugnis. Ein Entscheidungsprotokoll macht eine falsche Handlung prüfbar, Eindämmungskontrollen begrenzen ihre Wirkung. Eine Freigabeanfrage gibt einer benannten Person die nötigen Informationen für die Entscheidung. Ein Agent sollte keine breiten Datenrechte erhalten, nur weil er ein Dokument sicher zusammenfassen kann.
Mit diesen Kontrollen kann die Organisation festlegen, was der Agent tun darf und wie der Ablauf an einer Grenze reagiert.
Die Bewertung Muss Nach Der Bereitstellung Weitergehen
Die Produktion verändert die verfügbaren Nachweise und die Folgen von Agentenhandlungen. Behandeln Sie die Bewertungssuite als kontrollierte Produktionsressource mit Eigentümer und definierten Änderungsauslösern.
Ergänzen Sie neue Angriffe nach ihrer Entdeckung. Prüfen Sie Agentenspuren nach Vorfällen, fehlgeschlagenen Freigaben und unerwarteten Werkzeugaufrufen. Führen Sie die Suite erneut aus, wenn eine wesentliche Änderung an Modell, Anweisungen, Abrufquelle, Werkzeugschema oder Richtlinie die Entscheidungsgrenze betrifft. Bewahren Sie Fälle auf, die Kontrolländerungen ausgelöst haben, denn sie erklären den Grund für die Grenze.
Das erfordert einen begrenzten Ablauf, einen klaren Eigentümer und einen Bewertungsplan, der zu den Folgen der Handlung passt. Bei Unsicherheit empfehlen wir zunächst Entscheidungsunterstützung oder einen begrenzten Freigabeablauf. Erweitern Sie die Automatisierung erst, wenn Nachweise, Richtlinienkontrollen und Wiederherstellungsweg diese Befugnis tragen.
Produktionsfreigabe Ist Eine Operative Entscheidung
Sicherheitstests sollten einer Organisation helfen zu entscheiden, ob ein Agent fortfahren, unter Einschränkungen fortfahren, eine Genehmigung verlangen oder stoppen muss.
Ein belastbares Freigabeprotokoll verbindet die geprüften Szenarien mit der erlaubten Befugnis des Agenten, der Richtlinie für jede Handlung, dem Eigentümer von Ausnahmen und der Reaktion auf einen Kontrollausfall. Damit erhalten Technik- und Sicherheitsteams eine Grundlage für Änderungen am Ablauf, ohne vorzugeben, ein Benchmark-Zertifikat beseitige das Risiko.
Erstellen Sie einen Freigabenachweis für einen KI-Agenten? Vereinbaren Sie ein Beratungsgespräch.