同じ業界の中にも温度差がある。AFPによれば、9月21日にニューヨークで開かれた国連総会の関連行事で、同パネルの専門家らが、AIリスクをめぐって同じ分野の専門家の一部が用いる「終末論的」な言説に警鐘を鳴らした。その一人でGoogle DeepMindの幹部でもあるJoelle Barral氏は、「恐怖心に投資することはそれほど役立たない」と語っている。
2026年夏以降に公表され、脅威の実例として語られてきたインシデントを振り返り、その実態を確認してみたい。
過去のインシデントの多くはテスト環境とテスト方法に原因があった
2026年7月から9月にかけて、代表的なAI企業であるOpenAI、Anthropic、Meta、Googleの4社が、自社のAIモデルがテスト中に実在企業のシステムへ無断で侵入したと相次いで公表した。
このうちイスラエルの評価企業Irregularの評価環境(AIモデルの能力を測るテストを実行する環境)で起きたインシデントに限ると、Anthropicが4件、OpenAIが1件、Metaが1件、Googleが3件の計9件である(Googleの3件がIrregularの評価環境で起きたことは、報道とIrregular広報の説明による)。
今回、各社の資料を突き合わせ、これらのインシデントの原因をまとめてみた。どのインシデントでも主要な原因は、評価環境がインターネットに到達できたといった「テスト環境」の不備と、架空の標的名が実在のドメインと一致、評価プロンプト(テストでモデルに与える指示文)が探索の範囲を指定していなかったといった「テスト」の不備にあった(Googleの3件の後者は報道による)。
AIの能力などAIモデル側の要因が主要な原因に加わるのは、AnthropicのClaude Opus 4.7、Claude Mythos 5、社内研究用テストモデルの3件にとどまる。その3件でも影響の大きさはテスト環境、テストに次ぐ三番目だった。
Irregular社のテストで起きた9件とは別に、OpenAIの社内評価環境では、同社のモデルがゼロデイ脆弱性(それまで知られていなかった脆弱性)を突いてサンドボックス(外部から隔離されたテスト用の実行環境)を脱出し、Hugging Faceへ侵入した事例や、英国政府のAI安全保障研究所が意図的に接続を許可した環境でのインシデントもある。
上記9件のインシデントが起きた評価を構築または運営していたIrregular社は、2023年設立で旧社名をPattern Labsという。公開前のAIモデルの攻撃能力を測る評価を事業とし、先の4社との関係を公表資料で確認できる。ただし、設計の不備の問題を一概に同社だけの責任とは言えない。