AI Safety2026-10-09TechCrunch AI

Goodfire 推出低成本「由内而外」监控器,专抓失控 AI Agent

Goodfire 推出了一类新的「由内而外」(inside-out)监控器,用来抓失控的 AI Agent,成本只有现有监督方式的一小部分。思路是不再为一个自动化 Agent 的每一步操作都雇一个「AI 监工」去审——那个太贵了。Goodfire 的监控器是在 Agent 运行时直接看模型的内部状态,只有行为看起来可疑时才升级处理。 这正好戳中 Agent 安全的一个实际痛点。当企业把 AI 系统放出去浏览网页、写代码、管理文件、完成多步任务时,逐项监督每一个决策既贵又慢。人工审查根本扩不了规模,而拿另一个模型当全天候看门狗,又可能让推理成本翻两倍三倍。如果监控能盯住那些「有害行为发生前」的内部信号,就有可能做到更便宜、更快的预警。 Goodfire 把这种方法叫「由内而外」,因为它看的是模型的内部表征,而不只是输出结果。公司称,这能揭示 Agent 何时正在滑向欺骗性、不安全或非预期的行为。一旦监控发现苗头,就可以把问题上报给人类,或者转给更贵、更细的审查流程。 前景听起来很值钱:Agent 安全变得更可扩展,企业就更容易把自主系统用到复杂工作流里,也能减少对人工审查员的依赖——毕竟人跟不上机器的速度。但技术难度确实高。内部状态本身很复杂,监控器必须把真实风险和「看起来奇怪但无害」的推理区分开。误报多了会造成告警疲劳,漏报则可能等到出事才被发现。 Goodfire 这次发布,给正在升温的 AI 控制与监督研究又添了一笔。如果监控器真如宣传那样好用,它可能成为整套安全体系中的一层——和策略限制、访问控制、测试、人工监督配合使用。关键问题在于:它跨模型、跨任务的表现够不够稳,以及独立评测能否确认,便宜的监控没有以更弱的保护为代价。

相关资讯