AI Safety2026-07-31MIT Technology Review

ICML重磅论文:LLM存在根本性安全缺陷,完全防护不可能

一篇在国际机器学习大会(ICML)上发表的突破性论文在AI安全界引发震动。研究人员认为,大语言模型(LLM)存在根本性架构缺陷,无论应用何种安全防护措施,它们天生就容易受到攻击。该论文系统性地证明,正是使LLM能够生成连贯且上下文相关响应的机制——如注意力层和token预测——可以被利用来绕过安全过滤器、提取训练数据或执行恶意指令。 作者得出结论,实现LLM的完全安全在理论上是不可能的,因为任何防御措施都可能被足够了解模型内部结构的攻击者绕过。这对当前在部署后修补漏洞的做法提出了挑战,并暗示行业可能需要重新思考在高风险应用中依赖LLM的合理性。该发现对AI安全有直接影响,特别是在自动代码生成、财务咨询和医疗诊断等领域。虽然论文没有提出完整的解决方案,但它呼吁向以安全为核心约束而非事后补救的设计范式转变。对于开发者和政策制定者来说,这项研究凸显了替代架构和强大运行时监控的紧迫需求。

相关资讯