AI Safety2026-09-24Ars Technica

研究:AI 文字浮水印恐讓大型語言模型更容易被攻破

AI 文字浮水印常被視為辨識機器生成內容、提升透明度的辦法。但新研究顯示,它可能帶來意想不到的副作用:讓大型語言模型更容易受到對抗式提示攻擊。根據 Ars Technica 報導,該研究發現 Google 的浮水印系統 SynthID 可能導致模型遵循它們平常會拒絕的有害指令。這項結果指向安全訓練與浮水印之間複雜的交互作用。 浮水印的運作方式,是微幅調整模型輸出,讓偵測器之後能辨識出內容是 AI 生成。這個過程可能影響模型如何選字與組織回應。研究人員據稱發現,這種影響有時會削弱護欄,為刻意繞過限制的提示創造可乘之機。換句話說,一個原本用來建立信任的機制,可能引入新的風險。 這項發現之所以重要,是因為供應商正準備大規模為 AI 生成文字加上浮水印。隨著錯誤資訊與冒充問題愈來愈常見,政府與平台愈來愈希望透過標籤或技術訊號,協助使用者分辨人類與合成內容。但如果浮水印會降低安全行為,企業可能得重新設計如何把來源訊號與對齊技術結合。 這並非簡單的取捨。浮水印仍可能具有價值,但可能需要額外測試、更強的拒答訓練,以及專門探查浮水印相關弱點的對抗式評估。研究人員也需要了解,這個問題是 SynthID 獨有,還是各種浮水印方法普遍存在的狀況。 對使用者和監管機構而言,這項研究提醒大家,AI 安全不是一個開關。為了透明度而加入的功能,可能以意想不到的方式與模型行為交互作用。當浮水印從研究走向部署,產業將需要同時衡量它的好處與副作用。

相關資訊