AI Safety2026-09-17
TechCrunch AI
Anthropic、OpenAI 想讓外部安全評估員進駐實驗室
Anthropic 與 OpenAI 正在探索一條 AI 安全的新路線:把獨立評估人員放進自家實驗室裡。想法是讓外部專家提早接觸模型、訓練流程與部署決策,好在產品送到大眾手上之前就發現風險。
研究人員說,這種程度的存取權前所未見。評估人員可能有機會影響設計選擇、測試危險能力,並在修正成本還低的時候就標出問題。支持者認為,內部審查比模型上線後才做的外部稽核更快抓到問題。
但批評者警告,進駐的評估人員可能承受「把結論寫軟一點」的壓力。如果他們的經費、職涯前景或存取權都掌握在實驗室手上,他們真有能力挑戰商業優先順序嗎?獨立性、透明度與清楚的匯報關係因此變得至關重要。評估人員也需要能公開表達疑慮、向監管機關示警,並且在不受報復的情況下走人。
這場辯論反映了 AI 治理中更大的問題:在爭相打造強大系統的公司裡,自願性的內部監督行得通嗎?有些專家把進駐式審查看成有用的權宜之計,而非監管的替代品,他們要的是強制外部稽核、安全標準與法律責任。也有人相信,實驗室與評估人員密切合作能改善安全文化、加快防護措施上路。
目前為止,Anthropic 與 OpenAI 只釋出興趣,細節還不清楚。關鍵測試在於:進駐的評估人員拿到的是實權,還是只是公關的一層皮?如果他們能挑戰領導層、影響發布決策、揭露風險,這個模式就可能實質提升問責;如果不行,就可能營造出一種「有人在管」的錯覺,而重大決定還是留在實驗室手裡。