KI verstehen
KI verstehen
KI verstehen

KI als Sicherheitsrisiko - Wie sich Chatbots mit "Jailbreaks" entfesseln lassen

2. Juli 2026 · 41 Min.

KI-Chatbots lassen sich oft durch sogenannte „Jailbreaks“ dazu bringen, Sicherheitsvorgaben zu umgehen, wie Eva Wolfangel im Gespräch mit Moritz Metz erklärt.

In der Folge erläutert Eva Wolfangel, wie Nutzer oder Aktivisten Chatbots überreden können, Einschränkungen zu ignorieren, und warum das sowohl harmlos als auch gefährlich sein kann. Moritz Metz moderiert das Gespräch und stellt konkrete Beispiele vor (DPD, Meta, Fable 5). Wolfangel erklärt technische Gründe, typische Methoden und die Risiken für Nutzer, Unternehmen und Forschung sowie mögliche journalistische und sicherheitsrelevante Perspektiven.

Zahlen & Fakten

70 %

Ergebnis einer zitierten Studie, in der Prompt‑Tricks über alle großen Modelle in über 70 % der Fälle funktionierten.

99 %

Angabe von Plini zur Häufigkeit seiner Intuition beim Finden von Jailbreaks.

120.000 Zeichen

Länge des geleakten System Prompts von Fable 5 (laut Diskussion im Gespräch).

Weitere 2 Zahlen & Fakten anzeigen

20.000

Anzahl der Instagram‑Konten, die laut Erwähnung durch Angreifer über einen Meta‑Support‑Bot übernommen wurden.

2024

Jahr des geschilderten DPD‑Support‑Chatbot‑Vorfalls.

Diese Folge steckt voller Zahlen – neugierig?

Organisationen

Themen & Erkenntnisse

Einstieg: Was ist Jailbreaking und erste Beispiele · ab 00:00
Warum Jailbreaks möglich sind — technische und psychologische Gründe · ab 05:34
Risiken, Beispiele und Ausblick: Agenten, Forschung und Gegenmaßnahmen · ab 16:22

Wer spricht

M
Moritz MetzHOST

Moderator des Podcasts ‚KI Verstehen‘ beim Deutschlandfunk; führt durch die Folge, stellt Fragen zur Praxis und Sicherheit von Chatbots und leitet Gespräche mit Expertinnen wie Eva Wolfangel. Er bringt Alltagsbeispiele ein und moderiert die Einordnung der Risiken und Anwendungen.

Alle Auftritte von Moritz Metz
E
Eva Wolf-AngelGAST

Tech‑Journalistin und recherchierende Gesprächspartnerin in dieser Folge; sie hat Vorträge über Jailbreaking gehalten und schildert zahlreiche Recherchen und Beispiele (DPD‑Fall, medizinischer Chatbot, Mercedes‑Bot, Fable 5). Wolfangel erklärt technische Hintergründe, typische Angriffsmethoden, Red‑Teaming‑Arbeit und die Abwägung zwischen Sicherheit, Nutzbarkeit und Forschungsfreiheit.

Alle Auftritte von Eva Wolf-Angel

KIDieser Inhalt wurde KI-gestützt erstellt und redaktionell geprüft.

Ähnliche Folgen

Computer und Kommunikation – DLF · 4. Juli 2026

Kollege KI-Agent / Abliteration enthemmt KI-Sprachmodelle / Home-Office

Die Folge diskutiert Chancen und Risiken von KI-Agenten in Unternehmen, erklärt, wie 'Abliteration' Schutzmechanismen von Sprachmodellen aushebeln kann, und berichtet, dass Homeoffice weiterhin weit verbreitet und vielen Beschäftigten Geld wert ist.

KI-Update – heise · 29. Juni 2026

KI-Update kompakt: KI-Moderation, Finanzmarkt, Datenschutz, GPT-Images

Meta automatisiert Inhaltsmoderation mit KI, während Finanzmärkte rund um künstliche Intelligenz Überhitzungssignale zeigen und Datenschutzbehörden ausgerechnet beim Ausbau von KI-Überwachung geschwächt werden.

KI-Update – heise · 3. Juli 2026

KI-Update kompakt: Deutschland-App, OpenAI bietet Beteiligung, KI als Chef, Git-KI-Tool

Marco Pauli und Isabel Grünewald präsentieren kompakt Neuigkeiten zu Deutschland‑App, OpenAI‑Beteiligungsvorstoß, KI‑Agenten als Start‑up‑Chefs und einem neuen Git‑KI‑Tool.

Wissen aktuell – SWR2 Impuls · 1. Juli 2026

Communicator-Preis für Forschung an KI-Tutoren für Schüler

Ute Schmid erläutert, wie intelligente Tutorsysteme (KI-Tutoren) Schülerinnen und Schüler individuell fördern können, und diskutiert Chancen wie faire Übungsmöglichkeiten sowie Grenzen wie hohen Entwicklungsaufwand.

Breitband – Medien und digitale Kultur · 4. Juli 2026

Klimakrise - Können wir uns KI überhaupt leisten?

Digitalisierung und KI-Ausbau stehen in einem engen Zielkonflikt mit Klimaschutzinteressen; statt blinder Expansion braucht es gezielte, nachhaltige Technikförderung und politische Prioritätensetzung.

t3n Arbeit in Progress · 3. Juli 2026

Bedroht AI-Slop ihren Job oder macht er ihn leichter?

Lisa Merke sagt, KI verändert Social‑Media‑Arbeit: Nützliche Tools erleichtern Workflows, ersetzen aber keine menschliche Kreativität; zugleich entstehen Qualitätseinbußen und ökonomisch/ökologische Risiken durch «AI‑Slop».