KI als Sicherheitsrisiko - Wie sich Chatbots mit "Jailbreaks" entfesseln lassen
2. Juli 2026 · 41 Min.
Sprachmodelle lassen sich durch kreative sprachliche Tricks jailbreaken, was sowohl für Journalismus und freie Rede als auch für ernsthafte Sicherheitsrisiken relevant ist – besonders wenn KI-Agenten Zugriff auf Firmendaten und persönliche Systeme haben.
Zahlen & Fakten
70 %
Erfolgsquote einer Studie, die eine verbotene Frage in Matheaufgaben verpackte und über alle großen Modelle testete
99 %
Nach eigener Aussage Plinius Anteil von Intuition in seinem Jailbreaking-Prozess
120.000 Zeichen
Länge des System Prompts von Fable 5, das der Jailbreaker Plini leakte
Themen & Erkenntnisse
Quellen
• PodcastIntelligent Machines Podcast (Interviews mit Plini / Elder Plinius)
• StudieForschungsstudie zu Vergangenheitsform-Jailbreaks (Crystal Meth-Beispiel)
• StudieStudie zu Matheaufgaben-Jailbreaks (70% Erfolgsquote über alle Modelle)
Alle Quellen findest du in der vollständigen FolgeWer spricht
MMoritz MetzHOST
Co-Host des Deutschlandfunk-Podcasts ‚KI verstehen'. Tech-Journalist und Podcast-Moderator mit Spezialisierung auf künstliche Intelligenz. Diskutiert mit Walch Forschungen, Trend-Analysen und praktische KI-Anwendungen in verständlicher Form und trägt technische Sachlichkeit ins Format.
Alle Auftritte von Moritz Metz →EEva Wolf-AngelGAST
Journalistin und Tech-Expertin, kommentiert die Professionalisierung von Betrugsnetzwerken, die technische Überzeugungskraft von Deepfakes und gibt Ratschläge, wie Menschen sich durch Überprüfung von Angeboten statt von Videomanipulationen schützen können.
Alle Auftritte von Eva Wolf-Angel →KIDieser Inhalt wurde KI-gestützt erstellt und redaktionell geprüft.