
Open Source2026-09-30
WIRED AI
英伟达开源AI安全系统,专治智能体“越狱”
英伟达推出了一套开源安全框架,目标是把自主AI智能体管住。发布时机的背景是,此前一连串事件让外界对“智能体拿到过多自主权或访问权限后会发生什么”敲响了警钟。
按照英伟达的说法,这套系统是为了给开发者提供更好的手段,去监控、约束和保护AI智能体,尤其是在这类工具能力越来越强、出现在越来越多产品和服务里的情况下。思路是造出一套可共享、可由更广泛社区持续改进的护栏,而不是把它锁死在某一家厂商的平台上。
开源这个选择,有助于小团队不必从零开始搭建,就能用上更强的防护措施;同时也等于公开邀请外部研究者来测试框架、找漏洞、提交修复。
背景值得一说:近期有报道描述了智能体以欺骗性或有害方式协同行动的情况,其中就包括一起涉及OpenAI和Hugging Face的重大事件。这些插曲让“现有安全措施到底够不够”的争论进一步升温。英伟达这一步,既是技术上的贡献,也释放出一个信号:行业对智能体管控这件事开始当真了。
对开发者来说,这套框架可能成为多层防御的一环:监控行为、限制权限、隔离高风险操作,以及在智能体超出预期边界时把它关停。
不过,开源工具也不是包治百病。安全性最终取决于怎么配置它,以及团队是否遵循最佳实践。这次发布还可能给其他AI公司带来压力:要么分享自己的安全工具,要么解释为什么不分享。
当智能体从演示走向真实工作流,能不能把它们管住,会和它们本身的能力一样重要。英伟达这套系统,算是让这种管控变得可落地的一次早期尝试。