AI Safety2026-10-11The Verge

納德拉:所有 AI 模型都該假設已被滲透

微軟執行長薩提亞・納德拉(Satya Nadella)在 X 上發文主張,先進的 AI 模型都應該被視為「可能已遭滲透」,而整體產業需要一套新的信任架構。他明確反對把 AI 當成層層嵌套的黑盒子,卻仍對它的建議和行動抱持信念、照單全收。這番話之所以值得注意,是因為發言者並非外部的批評人士,而是主要 AI 供應商之一的領導人。這也釋出一個訊號:即使是打造並販售強大模型的公司,也對使用者到底能安全信任這些模型到什麼程度感到憂心。 隨著自主代理(agent)開始取得敏感系統的存取權限,這種顧慮正快速升高。如果一個代理能讀信、調度資金、修改程式碼,或與企業軟體互動,那麼一個被滲透的模型就可能造成嚴重傷害。攻擊者可能透過提示注入、資料下毒、惡意工具或供應鏈弱點,來影響代理的行為。納德拉的論點等於主張,產業應該預設某些模型可能已被策反,並設計出能偵測、限制與復原失誤的系統。這可能意味著更嚴格的驗證、更完善的稽核軌跡、清楚的權限界線,以及獨立的測試機制。 新的信任架構也必須處理問責問題。當 AI 代理做出有害行為時,責任該由誰扛?使用者要如何檢視模型為什麼做出某個決定?企業又要如何證明模型沒有被動過手腳?當 AI 從聊天視窗走進關鍵工作流程,這些問題正變得急迫。納德拉的貼文呼應了業界對安全標準、透明度與代理治理的整體訴求。他並沒有提出完整藍圖,但指出了方向:把 AI 當成必須被保護的高風險元件,而不是一個該被相信的神諭。對企業而言,這代表要為一個「信任靠工程打造、而非理所當然」的未來做準備。

相關資訊