AI Safety2026-10-11The Verge

纳德拉:假设所有AI模型都已被攻破

微软CEO萨提亚·纳德拉在X上发帖提出:先进的AI模型应该被当作“可能已被攻破”的对象来对待,整个行业需要一套新的信任架构。他不接受把AI当成一层套一层的黑箱——它给的建议、做的动作,用户只能凭信念去相信。 这番话值得注意,是因为说这话的人不是外部批评者,而是一家主要AI厂商的掌门人。这等于释放一个信号:连造模型、卖模型的公司自己,也在担心用户到底能安全地信任它们到什么程度。 担忧正在升级,因为自主智能体开始拿到敏感系统的权限。如果一个智能体能读邮件、挪资金、改代码,或者跟业务软件打交道,那么一个被攻破的模型就可能造成严重伤害。攻击者可能通过提示注入、数据投毒、恶意工具或者供应链薄弱环节来影响智能体的行为。纳德拉的观点是:行业应该默认有些模型可能被策反,并据此设计系统,让它能发现、限制并从故障中恢复。这或许意味着更强的验证机制、更完善的审计追踪、清晰的权限边界,以及独立测试。 新的信任架构还得解决问责问题。AI智能体做出有害动作时,谁负责?用户怎么查看模型为什么做了某个决定?企业怎么证明模型没有被动手脚?随着AI从聊天窗口走进关键业务流程,这些问题正变得越来越紧迫。纳德拉的帖子呼应了业界对安全标准、透明度和智能体治理的更广泛呼吁。他没有给出完整蓝图,但指出了一个方向:把AI当成必须加固的高风险组件,而不是当成一个应当被信奉的神谕。对企业来说,这意味着要为这样一个未来做准备——信任是设计出来的,而不是默认就有的。

相关资讯