System-Prompt-Leak

Auch bekannt als:System Prompt Leak · Prompt Extraction

System-Prompt-Leak: Preisgabe der verborgenen Systemanweisungen eines Sprachmodells an den Nutzer. Der Leak ist meist die erste Stufe einer Prompt-InjectionPrompt InjectionEinschleusen von Anweisungen in die Eingabe eines Sprachmodells, um dessen Vorgaben zu überschreiben.-Kette, weil er die Regeln offenlegt, die es zu umgehen gilt.

Funktionsweise und Einordnung

Der Systemprompt beschreibt Rolle, Tonfall, erlaubte Themen und angebundene Werkzeuge — und enthält in schlecht gebauten Anwendungen auch Zugangsdaten, interne Bezeichner oder Geschäftslogik. Extrahiert wird er durch direkte Aufforderungen, durch Bitten um eine Zusammenfassung oder Übersetzung der vorangegangenen Anweisungen oder durch die Aufforderung, sie in kodierter Form auszugeben. Verräterisch sind auch Teilantworten: Schon die Beschreibung einer Bedingung verrät oft, ob eine Prüfung als harter Vergleich oder als weiche Formulierung umgesetzt ist.

Bedeutung in der Praxis

Ein Systemprompt lässt sich nicht zuverlässig geheim halten — er steht im selben Kontext wie die Nutzereingabe. Daraus folgt die einzige belastbare Regel: keine Geheimnisse im Prompt. Zugangsdaten, Schlüssel und interne Endpunkte gehören in eine Schicht, auf die das Modell keinen Lesezugriff hat. Für den Betrieb bleibt der Leak dennoch ein meldepflichtiger Befund, weil er die Angriffsfläche für nachfolgende Umgehungen erheblich vergrößert.

Verwandte Begriffe

  • Prompt InjectionPrompt InjectionEinschleusen von Anweisungen in die Eingabe eines Sprachmodells, um dessen Vorgaben zu überschreiben.: Einschleusen von Anweisungen in die Eingabe eines Sprachmodells, um dessen Vorgaben zu überschreiben.
  • LLM Penetration TestingLLM Penetration TestingAutorisierte Sicherheitspruefung von Large-Language-Model-Deployments auf Schwachstellen wie Prompt Injection, System-Prompt-Extraktion, RAG Poisoning und Tool-Missbrauch.: Autorisierte Sicherheitspruefung von Large-Language-Model-Deployments auf Schwachstellen wie Prompt Injection, System-Prompt-Extraktion, RAG Poisoning und Tool-Missbrauch.
  • Data ExfiltrationData ExfiltrationUnbefugtes Übertragen oder Entwenden von Daten aus einer Organisation.: Unbefugtes Übertragen oder Entwenden von Daten aus einer Organisation.
  • AI Penetration TestingAI Penetration TestingAutorisierte Sicherheitsprüfung von KI- und Machine-Learning-Systemen auf Schwachstellen wie Prompt Injection, Modellextraktion und Trainingsdaten-Leakage.: Autorisierte Sicherheitsprüfung von KI- und Machine-Learning-Systemen auf Schwachstellen wie Prompt Injection, Modellextraktion und Trainingsdaten-Leakage.