AI Safety2026-07-31MIT Technology Review

LLMは「根本的に欠陥」、完全なセキュリティは不可能とICMLで発表

国際機械学習会議(ICML)で発表された画期的な論文が、AIセキュリティコミュニティに衝撃を与えています。研究者らは、大規模言語モデル(LLM)にはアーキテクチャ上の根本的な欠陥があり、適用する防御策の如何にかかわらず、攻撃に対して本質的に脆弱であると主張しています。 論文は、LLMが一貫性のある文脈を理解した応答を生成するためのメカニズム——アテンション層やトークン予測など——そのものが、セーフティフィルターの回避、学習データの抽出、悪意ある命令の実行に悪用される可能性を体系的に実証しています。 著者らは、LLMの完全なセキュリティ達成は理論上不可能であり、モデルの内部構造を十分に理解した攻撃者によって、いかなる防御策も回避され得ると結論づけています。これは、デプロイ後に脆弱性にパッチを当てるという現在のアプローチに挑戦するものであり、業界が高リスクなアプリケーションへのLLM依存を再考する必要があることを示唆しています。 この発見は、特に自動コード生成、金融アドバイス、医療診断などの分野におけるAI安全性に即座に影響を及ぼします。論文は完全な解決策を提案するものではありませんが、セキュリティを後付けではなく中核的な制約としてモデルを設計する方向へのパラダイムシフトを求めています。開発者や政策立案者にとって、この研究は代替アーキテクチャと堅牢なランタイム監視の緊急の必要性を強調するものとなっています。

関連ニュース