Eine Mitarbeiterin bittet den KI-Assistenten, die wichtigsten Punkte aus einer Lieferanten-E-Mail und dem beigefügten Dokument zusammenzufassen. Was sie nicht sieht: In dem Dokument befinden sich zusätzliche Anweisungen, die gezielt für das KI-System formuliert wurden.
Liest der Assistent diese Inhalte, kann er sie fälschlicherweise als Teil seiner eigentlichen Aufgabe verstehen. Besitzt er darüber hinaus Zugriff auf Postfächer, Cloud-Speicher oder Unternehmensanwendungen, kann aus einer falschen Zusammenfassung ein handfestes Sicherheitsproblem werden.
Diese Angriffsmethode wird als Prompt Injection bezeichnet. Besonders gefährlich ist ihre indirekte Variante: Hier übermittelt der Angreifer seine Anweisungen nicht direkt an den Chatbot. Er versteckt sie in Inhalten, die das KI-System bei seiner normalen Arbeit verarbeitet.
Ein Prompt ist vereinfacht gesagt eine Anweisung an ein KI-Sprachmodell. Bei einer direkten Prompt Injection versucht ein Nutzer, das Verhalten des Systems durch eine gezielt formulierte Eingabe zu verändern. Er fordert die KI beispielsweise dazu auf, vorherige Vorgaben zu ignorieren oder eigentlich geschützte Informationen preiszugeben.
Bei einer indirekten Prompt Injection steckt die Manipulation dagegen in einer fremden Quelle. Das kann eine E-Mail, eine Webseite, ein PDF-Dokument, ein Kalendereintrag oder eine Datei in einem gemeinsam genutzten Cloud-Ordner sein.
Das grundlegende Problem: Ein Sprachmodell verarbeitet sowohl Anweisungen als auch Arbeitsmaterial als Text. Es kann nicht in jeder Situation zuverlässig erkennen, ob ein Satz eine legitime Aufgabe, eine gewöhnliche Information oder ein gezielter Manipulationsversuch ist.
Das Bundesamt für Sicherheit in der Informationstechnik bezeichnet indirekte Prompt Injections deshalb als intrinsische Schwachstelle anwendungsintegrierter KI-Sprachmodelle. Das Risiko steigt, sobald eine KI externe Quellen selbstständig auswertet oder ihre Ergebnisse von angeschlossenen Anwendungen weiterverarbeitet werden.
Ein einfacher Chatbot liefert zunächst nur eine Antwort. Moderne KI-Agenten können deutlich mehr: Sie durchsuchen E-Mails, öffnen Dateien, greifen auf Wissensdatenbanken zu, erstellen Termine oder bedienen andere Software über Schnittstellen.
Damit wächst der mögliche Schaden. Eine manipulierte Anweisung könnte versuchen, den Assistenten zu einer falschen Aktion zu bewegen, vertrauliche Informationen in seine Antwort einzubauen oder eine unerwünschte Funktion aufzurufen.
Wie relevant das Problem ist, zeigt eine 2026 veröffentlichte Untersuchung des US-amerikanischen National Institute of Standards and Technology. In einer groß angelegten Red-Teaming-Veranstaltung wurden 13 aktuelle Spitzenmodelle in verschiedenen Agentenszenarien angegriffen. Bei mehr als 250.000 Versuchen durch über 400 Teilnehmende wurde gegen jedes getestete Modell mindestens ein erfolgreicher Angriff gefunden.
Die Ergebnisse bedeuten nicht, dass jeder KI-Assistent jederzeit übernommen werden kann. Sie zeigen jedoch, dass Modellintelligenz allein keine verlässliche Sicherheitsgrenze darstellt.
Klassische Phishing-Angriffe richten sich direkt an Menschen. Eine manipulierte Nachricht fordert dazu auf, einen Link zu öffnen, ein Passwort einzugeben oder eine Datei auszuführen.
Bei einer indirekten Prompt Injection kann bereits das Auswerten des Inhalts durch einen KI-Assistenten ausreichen. Der Beschäftigte muss die versteckte Anweisung weder lesen noch verstehen. Der Angriff richtet sich an das Sprachmodell.
Denkbar sind beispielsweise:
Entscheidend ist nicht allein, ob der Manipulationsversuch erfolgreich ist. Entscheidend ist auch, welche Rechte das KI-System besitzt und welche Aktionen es anschließend ohne weitere Prüfung ausführen darf.
Eine erfolgreiche Prompt Injection kann die Qualität von KI-Ergebnissen manipulieren. Ein Assistent könnte wichtige Angaben auslassen, falsche Prioritäten setzen oder ein bestimmtes Angebot auffällig positiv darstellen.
Kritischer wird es, wenn die KI auf interne Informationen zugreifen oder selbst Aktionen auslösen darf. Dann können unter anderem folgende Risiken entstehen:
Prompt Injection ist deshalb nicht nur ein Problem der KI-Abteilung. Sie betrifft Identitätsmanagement, Datenschutz, Informationssicherheit und die Gestaltung betrieblicher Abläufe.
Eine häufige Schutzidee lautet, dem KI-Modell einfach zu befehlen, alle fremden Anweisungen zu ignorieren. Solche Vorgaben können helfen, bieten aber keine verlässliche technische Absicherung.
Auch zusätzliche Filter, feinere Formulierungen oder ein nachträglich angepasstes Modell können das Problem nach aktuellem Stand nicht vollständig beseitigen. Die OWASP Foundation führt Prompt Injection daher an erster Stelle ihrer wichtigsten Sicherheitsrisiken für Sprachmodelle und empfiehlt mehrere übereinanderliegende Schutzmaßnahmen.
Sicherheit muss außerhalb des Sprachmodells durchgesetzt werden: mit eingeschränkten Rechten, getrennten Systemen, überprüften Schnittstellen, menschlichen Freigaben und einer laufenden Überwachung.
Klassische Phishing-Schulungen bleiben wichtig, reichen allein aber nicht aus. Beschäftigte sollten wissen, dass auch ein seriös aussehendes Dokument problematisch sein kann, wenn es von einem weitreichend berechtigten KI-Assistenten verarbeitet wird.
Verdächtig sind unter anderem unerwartete Ergebnisse, ungewöhnliche Aktionsvorschläge oder Antworten, die nicht zur ursprünglichen Aufgabe passen. Dafür benötigen Mitarbeitende einen einfachen Meldeweg und eine klare Anweisung, wie sie die weitere Verarbeitung stoppen können.
Prompt Injection lässt sich derzeit nicht durch einen einzelnen Schalter zuverlässig verhindern. Unternehmen können die Auswirkungen erfolgreicher Manipulationsversuche jedoch deutlich begrenzen.
Der wichtigste Schritt besteht darin, KI-Assistenten nicht mehr Rechte einzuräumen, als sie für ihre konkrete Aufgabe benötigen. Fremde Inhalte müssen als nicht vertrauenswürdig gelten, kritische Aktionen brauchen eine Freigabe und sämtliche Zugriffe sollten nachvollziehbar bleiben.
Je selbstständiger eine KI handeln darf, desto stärker muss ihre technische und organisatorische Kontrolle sein. So können KMU die Vorteile intelligenter Assistenten nutzen, ohne einer E-Mail oder einem Dokument unbemerkt die Kontrolle über ihre Geschäftsprozesse zu überlassen.