AI Safety2026-08-25
OpenAI Blog
OpenAI 以安全為先,放緩模型開發步調
OpenAI 宣布其對前沿模型開發的策略出現重大轉變,將安全與對齊置於單純的能力加速之上。在近期聲明中,該公司詳細說明了新協定,這些協定將主動引導 AI 訓練的節奏,特別是在系統逐漸接近其所謂的「網路關鍵能力」之際。
這項新策略的核心是更具動態與回應性的訓練流程。OpenAI 不再線性地追求更強大的智慧,而是將導入檢查點機制,若內部防護措施尚不足以應對模型浮現的風險,便可暫停訓練。這標誌著轉向更謹慎、疊代式的開發週期,承認隨著模型能力增強,被濫用或產生非預期後果的可能性也隨之增加。
這些防護措施並非僅是事後監控,而是設計為主動出擊。該公司正在加強其對齊研究,以確保模型在獲得新能力的同時,仍能保持可預測性與可控性。這包括對網路攻擊能力的嚴格測試,例如模型可能找出漏洞或撰寫利用程式碼。若在訓練過程中偵測到此類能力,流程將暫停,讓安全團隊更新協定並在繼續前對系統進行紅隊測試。
這項宣布反映了更廣泛的產業趨勢:安全不再是事後補救,而是開發時程的主要驅動力。透過明確表示防護措施將主導開發步調,OpenAI 樹立了可能影響其他實驗室處理前沿工作的先例。挑戰在於如何平衡這些模型的巨大潛在效益,與防止災難性濫用的必要性——OpenAI 現在暗示,這種平衡需要一條深思熟慮、有時甚至更緩慢的前進道路。