AI Safety2026-07-31MIT Technology Review

LLM天生缺陷:研究證實安全防護根本無解

一篇在國際機器學習大會(ICML)上發表的突破性論文,在AI安全社群投下震撼彈。研究人員指出,大型語言模型(LLM)存在根本性的架構缺陷,使其無論加上多少安全防護,本質上都容易遭受攻擊。該論文系統性地證明了,正是那些讓LLM能夠產生連貫且符合上下文回應的機制——例如注意力層與token預測——反而可以被利用來繞過安全過濾器、擷取訓練資料,或執行惡意指令。 作者們得出結論:要讓LLM達到完全安全,在理論上是不可能的,因為任何防禦措施,只要攻擊者對模型內部有足夠的了解,都能夠被繞過。這項發現挑戰了目前業界在部署後才修補漏洞的主流做法,並暗示整個產業可能需要重新思考在高風險應用中依賴LLM的策略。這項研究成果對AI安全有直接的影響,特別是在自動化程式碼生成、財務顧問與醫療診斷等領域。雖然論文並未提出完整的解決方案,但它呼籲進行一場典範轉移:在設計模型時,就應將安全視為核心限制條件,而非事後才補強。對於開發者與政策制定者而言,這項研究凸顯了尋求替代架構與建立強健執行時期監控機制的迫切性。

相關資訊