LLM Jailbreak
Auch bekannt als:Jailbreak · Guardrail Bypass
LLM Jailbreak: Umgehung der Sicherheitsrichtlinien eines Sprachmodells durch geschickt formulierte Eingaben. Der Begriff überschneidet sich mit Prompt InjectionPrompt InjectionEinschleusen von Anweisungen in die Eingabe eines Sprachmodells, um dessen Vorgaben zu überschreiben., zielt aber auf die Richtlinien des Modells statt auf die Vorgaben der Anwendung.
Funktionsweise und Einordnung
Typische Muster sind Rollenspiele, in denen das Modell eine fiktive Figur ohne Einschränkungen darstellen soll, hypothetische Rahmungen, schrittweise Eskalation über mehrere unverfängliche Nachrichten, sowie Kodierungen und Fremdsprachen, die Erkennungsmuster umgehen. Ergänzend werden automatisiert erzeugte Zeichenfolgen eingesetzt, die die Ablehnungsantwort statistisch unterdrücken. Allen Varianten ist gemeinsam, dass sie den Kontext so verschieben, dass die problematische Ausgabe für das Modell plausibel wird.
Bedeutung in der Praxis
Weil das Sprachverständnis selbst der Angriffsvektor ist, gibt es keine vollständige Lösung auf Prompt-Ebene. Betreiber setzen deshalb auf mehrschichtige Verteidigung: unabhängige Klassifikatoren für Ein- und Ausgabe, Trainingsverfahren zur Robustheit, Protokollierung auffälliger Verläufe und vor allem die Begrenzung dessen, was das Modell überhaupt auslösen kann. Für eine Sicherheitsbewertung ist entscheidend, welche Wirkung ein erfolgreicher Jailbreak in der konkreten Anwendung hätte.
Verwandte Begriffe
- Prompt InjectionPrompt InjectionEinschleusen von Anweisungen in die Eingabe eines Sprachmodells, um dessen Vorgaben zu überschreiben.: Einschleusen von Anweisungen in die Eingabe eines Sprachmodells, um dessen Vorgaben zu überschreiben.
- LLM Penetration TestingLLM Penetration TestingAutorisierte Sicherheitspruefung von Large-Language-Model-Deployments auf Schwachstellen wie Prompt Injection, System-Prompt-Extraktion, RAG Poisoning und Tool-Missbrauch.: Autorisierte Sicherheitspruefung von Large-Language-Model-Deployments auf Schwachstellen wie Prompt Injection, System-Prompt-Extraktion, RAG Poisoning und Tool-Missbrauch.
- Adversarial Machine LearningAdversarial Machine LearningDisziplin zu Manipulation, Täuschung und Absicherung von Machine-Learning-Modellen.: Disziplin zu Manipulation, Täuschung und Absicherung von Machine-Learning-Modellen.
- AI Penetration TestingAI Penetration TestingAutorisierte Sicherheitsprüfung von KI- und Machine-Learning-Systemen auf Schwachstellen wie Prompt Injection, Modellextraktion und Trainingsdaten-Leakage.: Autorisierte Sicherheitsprüfung von KI- und Machine-Learning-Systemen auf Schwachstellen wie Prompt Injection, Modellextraktion und Trainingsdaten-Leakage.