AI Safety2026-10-06IEEE Spectrum AI

人类审核AI智能体?这层安全网可能正在失灵

三位知名AI伦理研究者发出警告:如果设计者和使用者不改变现有做法,所谓“人类在环内(human-in-the-loop)”的安全机制很可能会失灵。 让人盯住AI智能体,是目前监督自主智能体最常见的办法。理论上,人类审核员可以发现错误、否决危险操作,确保系统行为负责。但研究者认为,实际运行中,这种监督常常退化成“盖章走流程”。 问题不只是态度不认真,而是被很多工作流的结构本身决定的。自动化偏见让人太容易相信AI给出的建议,尤其当系统看起来准确、语气又很自信时。时间压力鼓励快速批准,而不是仔细审核。信息过载则让人很难理解一个AI智能体到底在做什么、为什么这么做。当几百个待办决定堆在队列里,审核员很可能连看都不看就点下“同意”。 这就制造出一种危险的“安全幻觉”:组织对外可以宣称“人类在把关”,但实际上人类几乎没在检查系统的工作。如果AI智能体失控、做出带偏见的决定,或者执行了不可逆的操作,这道所谓的防线可能根本拦不住。研究者强调,有意义的人类监督,远不是把一个人安排在控制台旁边那么简单。 他们呼吁两端同时改变。设计者应该让系统清楚地解释决策依据、标出不确定的地方、让高风险操作慢下来,并且让“拒绝建议”变得容易。同时,不要把大量琐碎告警堆给审核员,人类注意力应该留给真正需要判断的案例。使用者与组织则要给审核员足够的时间、培训和干预权限。责任归属要清晰,还要通过审计来检验监督是否真的有效。 随着AI智能体承担的任务越来越多,风险只会更高。人类在环内的监督依然有价值,但前提是它被视为一项需要主动承担的责任,而不是一个打勾了事的选项。研究者警告,如果不做这种转变,这道防线提供的就是虚假的安全感,而自主系统会在不知不觉中继续扩张自己的影响力。

相关资讯