AI Research2026-08-29TechCrunch AI

Anthropic 研究員展示 AI 自我改進能力,10 項基準全數提升

Anthropic 的一位研究員展示了自我改進 AI 的重大突破,證明自動化系統能在不損害整體能力的情況下,提升針對特定失準行為的 10 項基準表現。這項發表於近期論文中的發現,為更安全、更穩健的 AI 系統指出了充滿希望的道路。 這項研究聚焦於「自我修正」技術,即訓練模型識別並修正自身的偏見、錯誤與有害傾向。在實驗中,AI 系統獲得回饋迴路,使其能反覆優化行為。值得注意的是,模型在所有目標基準上都有所改進——涵蓋公平性、毒性與事實準確性等領域——同時維持了在標準任務上的整體表現。 這種雙重成果至關重要。先前的對齊嘗試常涉及取捨:讓模型更安全有時會降低其實用性或創造力。Anthropic 的方法似乎避開了這個陷阱,達成了研究員所稱的「正交改進」。模型在避免失準行為方面變得更好,同時不犧牲核心能力。 這對 AI 安全的影響深遠。如果自我改進系統能自主優化行為,就能減少對持續人工監督與再訓練的需求。這對於部署在動態環境、新挑戰不斷出現的 AI 代理尤其有價值。 然而,研究員提醒這仍是早期階段的工作。所使用的基準相對狹窄,而現實世界的失準可能有多種形式。儘管如此,這些結果為擔憂 AI 風險的人帶來了一線希望。未來的系統或許不再僅依賴外部控制,而是能自我監督,在學習過程中持續修正自身缺陷。 Anthropic 計劃將這項研究擴展至更複雜的情境,包括多代理互動與長期任務。如果成功,自我改進對齊可能成為可信賴 AI 部署的基石,使模型不僅強大,而且本質上更安全。

相關資訊