AI Safety2026-07-24
VentureBeat
思科研究:多轮攻击88%成功率,AI安全防线形同虚设
思科AI安全研究团队公布了一项令人担忧的发现:在针对15款主流AI模型的多轮对话攻击测试中,攻击成功率最高达到88.3%,而传统的单次提示测试几乎无法检测到这些漏洞。所谓多轮攻击,就是攻击者与模型进行来回对话,逐步诱导它绕过安全护栏、泄露敏感信息或执行未授权操作。这和单次恶意提示的攻击方式完全不同。研究显示,当前的安全措施在面对持续、自适应的攻击者时,简直不堪一击。这15款被测试的模型涵盖了多家厂商的主流大语言模型,不过思科没有全部公开点名。多轮攻击的高成功率暴露了AI安全的一个关键盲区:模型往往只在静态、单次场景下接受评估,但现实中的交互是动态、多步骤的。思科建议开发者实施更强的上下文感知安全机制,监控渐进的越狱尝试,并采用模拟长时间交互的对抗性测试。随着AI模型被部署到医疗、金融、客服等敏感领域,能否抵御多轮攻击已经不仅是技术问题,更是安全底线。这项研究也再次提醒我们:AI安全必须跟上模型能力进化的步伐。