Open Source2026-10-09
Microsoft Research Blog
微軟研究院推出 Agent Lightning v1.0,3,500 行框架
微軟研究院推出 Agent Lightning v1.0,這是一套用於以強化學習訓練 AI 代理的輕量框架。專案程式碼約 3,500 行,刻意維持精簡,但目標不小:用真實的 harness 把現有代理連上 RL 訓練,讓開發者不必重建整個技術堆疊就能改善行為。現代 AI 代理多半由複雜框架管理,負責處理提示、工具、記憶與多步驟執行。這種複雜度讓強化學習難以加入。Agent Lightning 以現有代理與 RL 訓練迴圈之間的橋樑角色,處理整合問題。開發者可以保留手上已有的代理,同時利用真實執行回饋來改善工具使用、上下文管理與決策。這種做法反映外界越來越關注如何讓代理更可靠。提示工程與靜態工作流程能帶團隊走的路有限。強化學習提供一種方法,可根據結果最佳化動作序列,例如用更少錯誤或更少不必要的工具呼叫完成任務。透過使用真實 harness,Agent Lightning 的目標是在接近正式環境的條件下訓練代理,而不是簡化的模擬環境。這可能有助於縮小基準測試表現與混亂真實世界行為之間的落差。輕量設計也可能降低實驗門檻。較小的程式碼庫更容易檢視、修改與擴充,這在研究變動快速的領域格外重要。不過,代理的 RL 仍然充滿挑戰。獎勵設計、安全限制、成本與可重現性都需要謹慎處理。Agent Lightning v1.0 不是完整解決方案,但它提供開發者一個實用方式,測試 RL 是否能改善自家代理。如果行得通,它可能成為團隊的有用積木,讓代理能從經驗中學習,而不只依賴手工打造的提示與規則。