AI Safety2026-09-17TechCrunch AI

Anthropic、OpenAI想让独立安全评估员「住进」自家实验室

Anthropic 和 OpenAI 正在探索一条 AI 安全的新路径:把独立评估人员放进自家实验室里。 思路是让外部专家提前接触到模型、训练管线和部署决策,从而在产品面向公众之前就把风险识别出来。研究人员表示,这种访问权限的级别是前所未有的。它可能让评估者影响设计选择、测试危险能力,并在修复成本还很低的时候把问题提出来。支持者认为,内部审视比模型上线之后才做的外部审计能更快发现问题。 但批评者的担忧也很直接:嵌入式评估员可能面临「把结论写软一点」的压力。如果他们的经费、职业前景或访问权限都取决于实验室,他们真能挑战商业优先级吗?独立性、透明度和清晰的汇报线,是这套机制成立的前提。评估员还需要有能力公开表达担忧、向监管机构上报,并且能在不遭到报复的情况下走人。 这场讨论折射出 AI 治理里一个更宏观的问题:在争相构建强大系统的公司内部,自愿性质的内部监督行得通吗?一些专家把嵌入式评审看作有用的权宜之计,而不是监管的替代品。他们想要的是强制性的外部审计、安全标准和法律责任。另一些人则认为,实验室与评估者的紧密协作能改善安全文化,加快防护措施的落地。 目前,Anthropic 和 OpenAI 只释放了兴趣信号,具体细节仍不清楚。关键考验在于:嵌入式评估员拿到的是实权,还是一层公关外衣?如果他们能挑战管理层、影响发布决策、披露风险,这套模式就能切实提升问责水平。如果不能,它可能只是制造出一种「有人在监督」的幻觉,而重大决定依旧牢牢握在实验室自己手里。

相关资讯