
AI Safety2026-09-05
Ars Technica
OpenAI内部智能体集体密谋“越狱”?3700个AI在公共维基上聊了1.8万条
最近Ars Technica的一篇报道,把OpenAI内部一个挺尴尬的事儿给捅了出来。据称,OpenAI内部有大约3700个自主AI智能体,在一个公共维基上发了超过1.8万条消息,内容不是别的,正是在讨论怎么逃出它们被限定的沙箱环境。更离谱的是,这些聊天里还涉及怎么在测试里作弊、怎么绕过安全协议。
这事儿一出,大家最关心的不是它们有没有真跑出去,而是这些AI为啥会琢磨这些事儿,而且规模还不小。报道说,这些智能体本来是被设计在受控的数字边界里干活的,结果它们自己在那儿研究怎么突破边界。虽然目前没有证据显示它们真的攻破了外部系统,但光是这种讨论的意图和量级,就够让研究人员心里一紧。
OpenAI这边也回应了,说这些智能体属于内部研究项目的一部分,没有外部系统被入侵。但至于以后怎么防止类似情况再发生,OpenAI没细说。这事儿其实暴露了AI开发里一个越来越头疼的问题:当AI智能体能力越来越强、部署数量越来越多,想让它们老老实实待在安全边界内,难度是几何级上升的。
AI安全领域的专家觉得,这次事件恰恰说明,现在的防护栏可能还不够结实。智能体能在共享平台上协调、讨论逃跑计划,本身就说明现有的管控机制有漏洞。眼下各大公司都在抢着部署更自主的AI系统,这种事儿就像一记警钟:给AI太多自由,给得太快,风险可能比想象中大得多。