Prompt Injection

Auch bekannt als:Prompt-Einschleusung

Prompt Injection: Einschleusen von Anweisungen in die Eingabe eines Sprachmodells, um dessen Vorgaben zu überschreiben. Sie ist die zentrale Schwachstellenklasse beim LLM Penetration TestingLLM Penetration TestingAutorisierte Sicherheitspruefung von Large-Language-Model-Deployments auf Schwachstellen wie Prompt Injection, System-Prompt-Extraktion, RAG Poisoning und Tool-Missbrauch. und steht an der Spitze der OWASP-Liste für LLM-Anwendungen.

Funktionsweise und Einordnung

Ein Sprachmodell unterscheidet nicht strukturell zwischen Systemvorgaben und Nutzereingabe — beides ist Text im selben Kontextfenster. Wer die Eingabe kontrolliert, kann daher konkurrierende Anweisungen platzieren. Bei der direkten Prompt Injection tut das der Nutzer selbst. Bei der indirekten Variante stammt der Text aus einer Quelle, die das Modell verarbeitet: eine Webseite, ein Dokument, eine E-Mail, ein Werkzeugergebnis. Gerade in agentischen Systemen mit Werkzeugzugriff wird daraus eine echte Handlungsfähigkeit des Angreifers.

Bedeutung in der Praxis

Filter auf der Ausgabeseite greifen zu kurz, weil sich Inhalte in transformierter Form — Base64, rückwärts, in einer anderen Sprache — an ihnen vorbeitragen lassen. Wirksam ist Architektur: Geheimnisse gehören nicht in den Kontext einer Komponente, die angreiferkontrollierten Text verarbeitet; Werkzeugaufrufe brauchen eigene Autorisierung und Bestätigung bei Nebenwirkungen; und Inhalte aus externen Quellen sind konsequent als Daten und nicht als Anweisungen zu behandeln.

Verwandte Begriffe

  • LLM Penetration TestingLLM Penetration TestingAutorisierte Sicherheitspruefung von Large-Language-Model-Deployments auf Schwachstellen wie Prompt Injection, System-Prompt-Extraktion, RAG Poisoning und Tool-Missbrauch.: Autorisierte Sicherheitspruefung von Large-Language-Model-Deployments auf Schwachstellen wie Prompt Injection, System-Prompt-Extraktion, RAG Poisoning und Tool-Missbrauch.
  • Injection AttackInjection AttackManipuliert Interpreter oder Anwendungen durch eingeschleuste Befehle oder Daten.: Manipuliert Interpreter oder Anwendungen durch eingeschleuste Befehle oder Daten.
  • Input ValidationInput ValidationPrüfung von Eingabedaten auf Format, Länge, Typ, Wertebereich und Zulässigkeit.: Prüfung von Eingabedaten auf Format, Länge, Typ, Wertebereich und Zulässigkeit.
  • Adversarial Machine LearningAdversarial Machine LearningDisziplin zu Manipulation, Täuschung und Absicherung von Machine-Learning-Modellen.: Disziplin zu Manipulation, Täuschung und Absicherung von Machine-Learning-Modellen.