AI Safety2026-07-24
VentureBeat
KI-Modelle in 88% der Fälle durch Mehrfachangriffe geknackt
Das KI-Sicherheitsteam von Cisco hat alarmierende Forschungsergebnisse veröffentlicht: Multi-Turn-Angriffe konnten 15 führende KI-Modelle in bis zu 88,3% der Fälle erfolgreich kompromittieren. Herkömmliche Einzelfragen-Tests hingegen übersahen die meisten Sicherheitslücken. Bei einem Multi-Turn-Angriff führt ein Angreifer ein schrittweises Gespräch mit dem Modell, um es nach und nach zu manipulieren. Ziel ist es, Sicherheitsvorkehrungen zu umgehen, vertrauliche Informationen preiszugeben oder unerlaubte Aktionen auszuführen. Das unterscheidet sich grundlegend von Single-Turn-Angriffen, bei denen nur eine einzige bösartige Anfrage gestellt wird. Die Forschung zeigt, dass die aktuellen Sicherheitsmaßnahmen gegen hartnäckige und anpassungsfähige Angreifer völlig unzureichend sind. Die 15 getesteten Modelle umfassten führende Large Language Models verschiedener Anbieter, wobei Cisco nicht alle namentlich nannte. Die hohe Erfolgsquote von Multi-Turn-Angriffen offenbart eine kritische Sicherheitslücke: KI-Modelle werden oft nur in statischen Einzelszenarien getestet, während reale Interaktionen dynamisch und mehrschrittig sind. Cisco empfiehlt Entwicklern, stärkere kontextbewusste Schutzmechanismen zu implementieren, schrittweise Jailbreaking-Versuche zu überwachen und Sicherheitstests zu etablieren, die längere Interaktionen simulieren. Da KI-Modelle zunehmend in sensiblen Bereichen wie Gesundheitswesen, Finanzen und Kundenservice eingesetzt werden, ist die Widerstandsfähigkeit gegen Multi-Turn-Angriffe nicht nur eine technische Anforderung, sondern eine sicherheitsrelevante Notwendigkeit. Diese Forschung ist ein wichtiger Weckruf, dass die KI-Sicherheit mit den Fähigkeiten der Modelle selbst Schritt halten muss.