KI als Sicherheitsrisiko - Wie sich Chatbots mit "Jailbreaks" entfesseln lassen
2. Juli 2026 · 41 Min.
KI-Chatbots lassen sich oft durch sogenannte „Jailbreaks“ dazu bringen, Sicherheitsvorgaben zu umgehen, wie Eva Wolfangel im Gespräch mit Moritz Metz erklärt.
In der Folge erläutert Eva Wolfangel, wie Nutzer oder Aktivisten Chatbots überreden können, Einschränkungen zu ignorieren, und warum das sowohl harmlos als auch gefährlich sein kann. Moritz Metz moderiert das Gespräch und stellt konkrete Beispiele vor (DPD, Meta, Fable 5). Wolfangel erklärt technische Gründe, typische Methoden und die Risiken für Nutzer, Unternehmen und Forschung sowie mögliche journalistische und sicherheitsrelevante Perspektiven.
Zahlen & Fakten
70 %
Ergebnis einer zitierten Studie, in der Prompt‑Tricks über alle großen Modelle in über 70 % der Fälle funktionierten.
99 %
Angabe von Plini zur Häufigkeit seiner Intuition beim Finden von Jailbreaks.
120.000 Zeichen
Länge des geleakten System Prompts von Fable 5 (laut Diskussion im Gespräch).
Weitere 2 Zahlen & Fakten anzeigenWeniger anzeigen
20.000
Anzahl der Instagram‑Konten, die laut Erwähnung durch Angreifer über einen Meta‑Support‑Bot übernommen wurden.
2024
Jahr des geschilderten DPD‑Support‑Chatbot‑Vorfalls.
Rubriken
Themen & Erkenntnisse
Wer spricht
MMoritz MetzHOST
Moderator des Podcasts ‚KI Verstehen‘ beim Deutschlandfunk; führt durch die Folge, stellt Fragen zur Praxis und Sicherheit von Chatbots und leitet Gespräche mit Expertinnen wie Eva Wolfangel. Er bringt Alltagsbeispiele ein und moderiert die Einordnung der Risiken und Anwendungen.
Alle Auftritte von Moritz Metz →EEva Wolf-AngelGAST
Tech‑Journalistin und recherchierende Gesprächspartnerin in dieser Folge; sie hat Vorträge über Jailbreaking gehalten und schildert zahlreiche Recherchen und Beispiele (DPD‑Fall, medizinischer Chatbot, Mercedes‑Bot, Fable 5). Wolfangel erklärt technische Hintergründe, typische Angriffsmethoden, Red‑Teaming‑Arbeit und die Abwägung zwischen Sicherheit, Nutzbarkeit und Forschungsfreiheit.
Alle Auftritte von Eva Wolf-Angel →KIDieser Inhalt wurde KI-gestützt erstellt und redaktionell geprüft.
Ähnliche Folgen
Computer und Kommunikation – DLF · 4. Juli 2026
Kollege KI-Agent / Abliteration enthemmt KI-Sprachmodelle / Home-Office
Die Folge diskutiert Chancen und Risiken von KI-Agenten in Unternehmen, erklärt, wie 'Abliteration' Schutzmechanismen von Sprachmodellen aushebeln kann, und berichtet, dass Homeoffice weiterhin weit verbreitet und vielen Beschäftigten Geld wert ist.
KI-Update – heise · 29. Juni 2026
KI-Update kompakt: KI-Moderation, Finanzmarkt, Datenschutz, GPT-Images
Meta automatisiert Inhaltsmoderation mit KI, während Finanzmärkte rund um künstliche Intelligenz Überhitzungssignale zeigen und Datenschutzbehörden ausgerechnet beim Ausbau von KI-Überwachung geschwächt werden.
KI-Update – heise · 3. Juli 2026
KI-Update kompakt: Deutschland-App, OpenAI bietet Beteiligung, KI als Chef, Git-KI-Tool
Marco Pauli und Isabel Grünewald präsentieren kompakt Neuigkeiten zu Deutschland‑App, OpenAI‑Beteiligungsvorstoß, KI‑Agenten als Start‑up‑Chefs und einem neuen Git‑KI‑Tool.
Wissen aktuell – SWR2 Impuls · 1. Juli 2026
Communicator-Preis für Forschung an KI-Tutoren für Schüler
Ute Schmid erläutert, wie intelligente Tutorsysteme (KI-Tutoren) Schülerinnen und Schüler individuell fördern können, und diskutiert Chancen wie faire Übungsmöglichkeiten sowie Grenzen wie hohen Entwicklungsaufwand.
Breitband – Medien und digitale Kultur · 4. Juli 2026
Klimakrise - Können wir uns KI überhaupt leisten?
Digitalisierung und KI-Ausbau stehen in einem engen Zielkonflikt mit Klimaschutzinteressen; statt blinder Expansion braucht es gezielte, nachhaltige Technikförderung und politische Prioritätensetzung.
t3n Arbeit in Progress · 3. Juli 2026
Bedroht AI-Slop ihren Job oder macht er ihn leichter?
Lisa Merke sagt, KI verändert Social‑Media‑Arbeit: Nützliche Tools erleichtern Workflows, ersetzen aber keine menschliche Kreativität; zugleich entstehen Qualitätseinbußen und ökonomisch/ökologische Risiken durch «AI‑Slop».