AI Safety2026-08-25
OpenAI Blog
OpenAI放缓模型开发节奏,安全优先于能力
OpenAI宣布了其前沿模型开发方式的重大转变,将安全和对齐置于原始能力加速之上。在最近的一份声明中,公司详细介绍了新协议,这些协议将主动指导AI训练的节奏,尤其是在系统接近其所谓的“网络关键能力”时。
这一新策略的核心是更动态、更响应的训练管道。OpenAI不再线性地追求更高的智能,而是将实施检查点,如果内部安全措施不足以应对模型涌现的风险,可以暂停训练运行。这标志着向更谨慎、迭代的开发周期转变,承认随着模型变得更强大,滥用或意外后果的可能性也在增长。
这些保障措施不仅仅是事后监控,而是设计为主动的。公司正在加强其对齐研究,以确保模型在获得新能力时仍保持可预测和可控。这包括对网络攻击能力的严格测试,即模型可能识别漏洞或编写利用代码。如果在训练运行中检测到此类能力,将暂停进程,让安全团队更新协议并对系统进行红队测试,然后再继续。
这一公告标志着更广泛的行业趋势:安全不再是事后考虑,而是开发时间线的主要驱动因素。通过明确表示保障措施将指导开发节奏,OpenAI正在树立一个先例,可能影响其他实验室如何进行前沿工作。挑战在于平衡这些模型的巨大潜在收益与防止灾难性滥用的必要性,而OpenAI现在暗示,这种平衡需要一条深思熟虑、有时更慢的路径。