
AI Safety2026-10-06
IEEE Spectrum AI
「人類在迴路中」把關機制恐怕會失靈
三位知名 AI 倫理研究者警告,把人類放在迴路中(human-in-the-loop)的把關機制,除非設計者與使用者改變現行做法,否則恐怕會失效。所謂「保留人類在迴路裡」,是目前監督自主 AI 代理最常見的方式之一。理論上,人類審查者可以抓出錯誤、覆寫危險動作,確保系統行為負責;但研究者指出,實務上監督往往淪為「蓋章走流程」。
問題不只是惡意或消極。它嵌在很多工作流程裡:自動化偏誤讓人們過度信任 AI 的建議,尤其當系統看起來準確又自信的時候;時間壓力鼓勵快速核准,而不是仔細檢查;資訊過載則讓人難以理解 AI 代理到底在做什麼、為什麼這樣做。當數百個決策同時塞進佇列,審查者可能連看都沒看就按下核准。
這就創造出危險的安全假象。組織可以宣稱有人在控制,但實際上人類幾乎沒在檢查系統的產出。一旦 AI 代理失控、做出帶偏見的決定,或採取不可逆的行動,這道所謂的防線可能根本攔不住。研究者強調,有意義的人類監督,遠不只是把一個人放在控制台旁邊。
他們呼籲雙方都要改變。設計者應該打造能清楚解釋決策、標示不確定性、在高風險動作前放慢速度,並讓「拒絕建議」變得容易的系統;同時避免用雞毛蒜皮的警示淹沒審查者,把人的注意力留給真正需要判斷的案例。使用端與組織則必須給審查者足夠的時間、訓練與職權去介入,責任歸屬要清楚,並透過稽核檢驗監督是否真的有效。
隨著 AI 代理承接愈來愈多任務,風險只會升高。人類在迴路中的監督仍有價值,但前提是它被當成主動承擔的責任,而不是打勾交差的欄位。研究者警告,若沒有這樣的轉變,這道防線只會提供虛假的安全感,而自主系統則悄悄擴大影響力。