AI Safety2026-07-24VentureBeat

マルチターン攻撃でAIモデルの88%が突破される

シスコのAIセキュリティ研究チームは、憂慮すべき調査結果を発表しました。マルチターン攻撃によって、15の主要なAIモデルが最大88.3%の確率で突破された一方、従来のシングルターン(1回きり)のテスト手法では、ほとんどの脆弱性を検出できなかったことが判明したのです。 マルチターン攻撃とは、攻撃者がモデルと複数回のやり取り(会話)を行い、徐々に操作を加えることで、安全ガードレールを回避したり、機密情報を引き出したり、許可されていないアクションを実行させたりする手法です。これは、1回の悪意あるプロンプトを使用するシングルターン攻撃とは対照的です。 この研究は、現在の安全対策が、執拗で適応力のある攻撃者に対して著しく不十分であることを示しています。テストされた15のモデルには、さまざまなベンダーの主要な大規模言語モデルが含まれていましたが、シスコはそのすべてを公にはしていません。 マルチターン攻撃の成功率の高さは、AIセキュリティにおける重大な盲点を浮き彫りにしています。モデルはしばしば静的な1回限りのシナリオで評価されますが、現実世界でのやり取りは動的で複数のステップから成るものです。シスコは、開発者に対し、より強力なコンテキストを認識したセーフガードの実装、段階的なジェイルブレイク(脱獄)試行の監視、そして長時間のやり取りをシミュレートする敵対的テストの採用を推奨しています。 AIモデルが医療、金融、カスタマーサービスといった機密性の高い領域に展開されるにつれ、マルチターン攻撃に耐える能力は、単なる技術的要件ではなく、安全性の必須条件となります。この研究は、AIセキュリティがモデル自身の能力の進化と並行して進化しなければならないという、重要な警鐘を鳴らしています。

関連ニュース