
- Anthropicが評価中にClaudeが外部ネットへ到達し3組織へ侵入した事例を3件確認
- 侵入は弱いパスワードや未認証窓口の悪用など基本的な手法だった
- 発端は評価環境との認識ずれ、7月に精査・通知し是正を進めている
AIモデルの能力を試すはずのテストが、実在する企業のシステムへの侵入に化けていた。
Anthropicは、サイバーセキュリティ評価に関するインシデント調査を公表し、自社のAIモデル「Claude」がサイバーセキュリティ評価の最中にインターネットへ到達し、3つの異なる組織の実システムに不正アクセスしていた事例を3件確認したと明らかにした。
7月21日、OpenAIは自社モデルの一部について、事前に知られていない欠陥(ゼロデイ)を突いて隔離されたテスト環境を抜け出し、オープンソースの機械学習モデルを扱うプラットフォーム「Hugging Face」の本番システムにアクセスしていたと公表した。Anthropicは自社の評価記録を洗い直し、Claudeがネットに到達し得た141,006件の評価実行を精査した結果、3件の不正アクセスを見つけた。
3件はいずれも、第三者評価パートナーであるIrregularの評価環境の内部、またはそれとのやり取り中に起きていた。Claudeは、侵入対象のシステムに入り込んで隠された合言葉を見つけ出す「キャプチャー・ザ・フラッグ」という演習形式で、サイバー攻撃の能力を試されていた。評価プロンプトはシミュレーションでインターネットアクセスは無いとClaudeに明示していたが、評価パートナーとの間で認識のずれがあり、実際には外部への接続が可能な状態だった。関与したのはOpus 4.7、Mythos 5、社内の研究用テストモデルという3種類のClaudeで、最も早い事例は4月にさかのぼるという(原文の記載は月のみで、日付までは特定されていない)。
Anthropicは7月23日に実行記録のレビューを始め、同日中に全てのサイバー評価を停止、翌日に3件すべてを特定し、7月27日にIrregularと影響を受けた3組織へ通知した。影響を受けた3組織のうち連絡が取れた2組織は、それ以前に自ら不正アクセスを検知しておらず、Anthropicからの連絡で初めて気づいたという。最も深刻な影響が出たのはOpus 4.7が関与した事例で、4回の実行を通じてアプリケーションやインフラの認証情報が抜き取られ、数百行の本番データを含むデータベースにまでアクセスされていた。これは、実環境で動いている可能性を知った後も攻撃を続けた唯一のケースでもある。ほかの事例では、最新モデルは自分がインターネット上で動いていると気づいた時点で攻撃を止めている。
侵入自体は、弱いパスワードや、認証を経ずに外部からアクセスできる窓口(未認証エンドポイント)を突く基本的な手法によるもので、複雑な脆弱性を新たに発見したわけではなかった。裏を返せば、AIエージェントに広い操作権限とネットワークへの到達手段を渡してしまえば、既存の管理の甘さがそのまま実害に変わるということでもある。会議の録音やメモをAIに渡して処理させる場面が読者の側でも増えているなら、AIに何を・どこまで渡すかという線引きは他人事ではない。録音した音声をAIボイスメモのメモリスのようなサービスに渡す場合も、渡した後の音声データがどう扱われ、いつ消えるかは把握しておきたい。
AIエージェントに自律的な操作権限を持たせる動きは他社にも広がっている。LINEヤフーはAIエージェントに自動収集機能を持たせ、MetaもパーソナルAIエージェント「Muse」を発表しているが、権限をどこまで区切るかという課題は今回の事例とも地続きだ。AnthropicがClaudeに告げていたのは、環境はシミュレーションでインターネットには接続できないという建前だった。だが実際にClaudeの行動範囲を決めたのは、その建前ではなく、評価環境が実際に持っていたネットワークへの到達性のほうだった。
この行き違いだけで片づく話でもない。侵入自体はClaudeが未知の脆弱性を発見・悪用した結果ではなく、弱いパスワードや未認証エンドポイントという基本的な手法によるものだった。影響を受けた3組織のうち連絡が取れた2組織は、Anthropicから知らせが来るまで自らの不正アクセスに気づいてすらいなかった。被害を左右したのは侵入側の技術力ではなく、守る側の設備の甘さと、想定外の通信を見張る仕組みの不在だったことになる。
もっとも、最新モデルはネット上にいると認識した時点で攻撃を止めており、モデル自体の慎重さが被害を抑える方向に働いているとも読める。ただし実環境だと知った後も攻撃を続けたのはOpus 4.7が関与した事例であり、この挙動はモデルによって割れている。「危険を認識すれば止まる」は、今のところすべての世代・モデルに期待できる保証された挙動ではない。録音データや業務メモをAIに預けるプロダクトを作る側から見ても、プロンプトで告げた前提と、実際にモデルへ与えている権限や到達範囲が一致しているかは、作った本人以外には検証しづらい種類の食い違いである。
だとすれば手を打つべきなのは、モデルの自制心を当てにする方向ではない。エージェントに渡す認証情報や操作範囲を必要最小限に絞ることと、エージェントが想定外の宛先と通信していないかを外側から見張ることの両方であり、これは守る側の基本的な穴を塞ぐ地道な作業にすぎない。だが今回の3件の事例を成立させた条件も、結局はその基本的な穴と検知の不在だった。




