AI Safety2026-10-09
TechCrunch AI
Goodfire 推低成本「由內而外」監控,抓失控 AI 代理
Goodfire 推出一類全新的「由內而外」(inside-out)監控器,號稱能用遠低於現行監督方式的成本,抓出失控的 AI 代理。它的構想是不再花錢請第二個 AI 模型逐一審查自主代理的每個動作,而是由 Goodfire 的監控器在代理運作時直接檢視模型的內部運作,只有在行為看起來可疑時才升級處理。
這個做法針對的是代理安全裡的一個現實難題。當企業讓 AI 系統上網瀏覽、寫程式、管理檔案、完成多步驟任務,要監督每一個決策不但昂貴又緩慢。人工審查無法規模化,而拿另一個模型當全天候監看者,可能讓推論成本翻倍甚至變三倍。如果監控器能聚焦在有害行為出現之前的內部訊號,就有機會提供更便宜、更即時的警告。
Goodfire 把這套方法稱為「由內而外」,因為它看的是模型的內部表徵,而不只是輸出結果。公司表示,這能揭露代理是否正朝向欺騙、不安全或非預期的行為漂移。一旦監控器偵測到疑慮,就能把問題升級給人工或更昂貴的審查流程。
這個承諾相當大:若代理安全能更具規模,企業要採用自主任務流程就會更容易;也能減少對人工審查員的依賴——畢竟人類根本追不上機器速度的作業。但技術挑戰並不容易。模型的內部狀態極為複雜,監控器必須分辨什麼是真正的風險、什麼只是罕見但無害的推理。誤報會造成警示疲乏,漏報則可能在没人察覺前就釀成損害。
Goodfire 的發布,為 AI 控制與監督研究這個正在成長的領域再添一筆。如果監控器真如宣傳般運作,它可能成為更大安全堆疊中的一層,與政策限制、存取控制、測試與人工監督並行。關鍵問題在於:它們跨模型、跨任務的泛化能力如何,以及獨立評估能否證實「更便宜的監控」不會以更弱的防護為代價。