Open Source2026-10-09
Microsoft Research Blog
微软开源 Agent Lightning v1.0:3500 行代码,给 AI Agent 做强化学习
微软研究院发布了 Agent Lightning v1.0,一个用来给 AI Agent 做强化学习训练的轻量级框架。它大约只有 3500 行代码,体量上是刻意做小的,但目标不小:把现有的 Agent 接进 RL 训练,而且用的是真实运行环境(real harness),让开发者不必重写整套技术栈就能改进 Agent 的表现。
现在的 AI Agent 大多由复杂框架管理,提示词、工具、记忆、多步执行都归它管。这种复杂度让强化学习很难塞进去。Agent Lightning 解决的是集成问题——它充当现有 Agent 和 RL 训练循环之间的一座桥。开发者可以保留手上的 Agent,同时用真实执行反馈去优化工具调用、上下文管理和决策。
这个思路也呼应了当下对 Agent 可靠性的关注。提示词工程和写死的静态工作流,能带团队走的路有限。强化学习提供了另一种办法:根据结果去优化一连串动作,比如用更少的错误、更少的无用工具调用完成任务。通过使用真实 harness,Agent Lightning 追求的是让 Agent 在接近生产环境的条件下训练,而不是在简化过的模拟里练。这可能有助于缩小榜单成绩和混乱真实表现之间的差距。
轻量设计还可能降低试错门槛。代码库小,就更容易看懂、改动和扩展,这在一个跑得飞快的研究领域里很重要。当然,面向 Agent 的 RL 依然不好做:奖励设计、安全约束、成本和可复现性,每一项都得仔细对待。Agent Lightning v1.0 不是一个完整答案,但它给了开发者一条实用的路子,去验证 RL 到底能不能让自己的 Agent 变得更好。如果行得通,它有望成为一块好用的积木,让那些想让 Agent 从经验中学习、而不是只靠手写提示词和规则的团队用起来。