AI Research2026-08-29TechCrunch AI

Anthropic研究员展示AI自我改进能力:10项基准全提升,性能不降

Anthropic的一位研究员最近展示了一项AI自我改进领域的重要突破:自动化系统可以在10项针对特定错误行为的基准测试上全部提升表现,同时不损害整体能力。这项研究发表在最新论文里,给打造更安全、更稳健的AI系统指了一条可能的路。 研究核心是“自我纠正”技术,也就是训练模型自己去识别和修复自身的偏见、错误和有害倾向。实验里,AI系统通过反馈循环不断迭代优化自己的行为。结果很惊人:模型在每一项目标基准上都进步了——涵盖公平性、有害性和事实准确性等领域——同时标准任务上的整体表现保持不变。 这个双重结果很关键。以前做对齐经常要面临取舍:让模型更安全,有时就得牺牲它的实用性或创造力。Anthropic这次的方法似乎避开了这个坑,研究员称之为“正交改进”——模型在避免错误行为上变得更好,但核心能力一点没丢。 这对AI安全的意义很大。如果自我改进的系统能自主优化行为,就能减少对人工持续监督和反复训练的依赖。这对部署在动态环境里的AI智能体尤其有价值,因为那些环境里新挑战会不断冒出来。 不过研究员也提醒,这还只是早期工作。目前用的基准相对狭窄,现实世界里的错误行为形式更多样。但结果还是给担心AI风险的人带来了一线希望。未来系统也许不用只靠外部控制,而是能自我监督,边学边持续修正自己的缺陷。 Anthropic计划把这项研究扩展到更复杂的场景,包括多智能体交互和长期任务。如果成功,自我改进的对齐技术可能成为可信AI部署的基石,让模型不仅强大,而且天生就更安全。

相关资讯