AI Safety2026-07-24VentureBeat

Cisco 研究:多輪攻擊破解 AI 模型成功率達 88%

Cisco 的 AI 安全研究團隊公布一項令人警醒的發現:多輪攻擊(multi-turn attack)成功破解 15 款旗艦 AI 模型的機率高達 88.3%,而傳統的單次測試方法幾乎無法偵測到這些漏洞。在多輪攻擊中,攻擊者與模型進行一來一往的對話,逐步誘導模型繞過安全護欄、洩漏敏感資訊,或執行未經授權的操作。這與單次攻擊(使用單一惡意提示)形成鮮明對比。 研究顯示,現有的安全措施在面對持續性、適應性強的攻擊者時嚴重不足。受測的 15 款模型涵蓋多家供應商的大型語言模型,但 Cisco 並未公開所有名稱。多輪攻擊的高成功率凸顯了 AI 安全的一大盲點:模型通常只在靜態、單次的場景下進行評估,但真實世界的互動是動態且多步驟的。Cisco 建議開發者導入更強的上下文感知防護機制,監控逐步越獄的嘗試,並採用模擬長時間互動的對抗性測試。 隨著 AI 模型被部署在醫療、金融與客服等敏感領域,能否抵禦多輪攻擊已不僅是技術需求,更是安全上的必要條件。這項研究提醒我們,AI 安全必須隨著模型能力一同進化。

相關資訊