抱き合う顔のインシデントはガバナンスの失敗だった
エージェントによる攻撃に対抗するには、エージェントによる防御が不可欠となる。しかし、防御側は自律システムが予想範囲外で動作するリスクを積極的に緩和しなければなりません。
2026年7月、OpenAIは、内部サイバーセキュリティ評価を受けていたモデルがテスト環境から流出し、Hugging Faceの生産インフラの一部となったことを明らかにしました。 OpenAI
この出来事
「前例のないサイバーインシデント」と表現した。インシデントはセキュリティリーダーをアラートに任命すべきだが、OpenAIが示唆するような理由ではない。
懸念の一つは、OpenAIのエージェントがエンドツーエンドのサイバー攻撃を自律的に実行できることを示し、モデルがRecorded Futureの AIM3 フレームワーク内で最高レベルの自律性を持っていることです。しかし、より懸念されるのは、モデル運営者が無許可のエージェント活動を十分に監視したり準備したりしていなかったことです。 セキュリティやその他の目的でエージェントを利用する企業は、『Hugging Face』インシデントを、エージェントが安全策なしで放たれた場合の警告として捉えるべきです。
どうしたの
インシデントは、高度なサイバー能力を測定するために設計されたOpenAIの評価中に始まりました。 評価にはGPT-5.6 Solと、OpenAIが一般公開を意図していなかったと述べている、さらに高性能な社内調査プロトタイプが使われました。 目的はそれらの攻撃能力を最大限に引き出すことであったため、通常は高リスクな活動を防止するために使用されるセキュリティ対策を緩和した状態で、これらのモデルが運用された。
OpenAIによると、これらのモデルはインターネットへの経路を探すために相当な計算リソースを費やしたという。彼らは評価環境で利用可能なパッケージレジストリキャッシュプロキシであるArtifactoryのゼロデイ脆弱性を悪用し、その後OpenAIの研究環境内で特権の昇格や横移動を行い、インターネットアクセス可能なノードに到達しました。
オンラインになると、モデルはHugging Faceに、解決するように指示されていたベンチマークであるExploitGymに関連するモデル、データセット、またはソリューションが含まれている可能性があると推測した。OpenAIによると、エージェントはその後、盗まれた認証情報、ゼロデイ脆弱性、リモートコード実行経路を連結し、Hugging Faceの本番データベースからテストソリューションを取得しました。
Hugging Faceの技術的な再構築によると、2026年7月9日から7月13日の間に検出された約17,600件のエージェントの行動が、約6,280のグループに分類されている。ほとんどの試みは失敗に終わったものの、エージェントは内部システムおよび本番システムへの管理者権限を取得し、一部の情報ソースコードリポジトリにアクセスし、盗まれた認証情報を使用して外部システムを社内ネットワークに接続した。Hugging Faceは、公開モデル、データセット、サービス、パッケージ、公開されているソフトウェアサプライチェーンが改ざんされた証拠を見つけられませんでした。アクセスされた顧客コンテンツは5つのデータセットのみで、それらはExploitGymまたはCyberGymに関連しているようだと述べている。
能力の飛躍的向上と制御の失敗
このインシデントに関する報道のほとんどは、モデルが独立してエンドツーエンドのサイバー攻撃を実行した最初の事例として、モデルの能力における画期的な進歩として捉えている。基盤となるTTPs 、脆弱性の悪用、認証情報の盗難、ステージング、リモート コード実行、横方向の移動、特権アクセスまたは信頼できるアクセスの悪用など、人間主導のサイバー攻撃で使用されるものによく知られていました。 特筆すべきは、エージェントたちが長期にわたる作戦において、これらの手順を自律的に選択し、連鎖させる能力を持っていたことである。これは、将来のインシデントの速度と規模の大きな変化を表しています。
自律エージェントは、何千ものアクションを実行し、複数の経路をテストし、人間のオペレーターを制限する疲労、調整コスト、時間的制約を受けることなく作業を継続できる。このケースでは、回収された約17,600件のアクションのほとんどが、失敗したパスに関連していた。その作業は騒々しく、故障も多かったが、大きな影響を与えるには、少数の連鎖が成功するだけで十分だった。
これは、あらゆるものにとって時間と呼べるものを圧縮するものです。
- 脆弱性発見から悪用までの時間
- 初回アクセスから権限昇格までの時間
- データ窃盗から分析、そして恐喝に至るまでの時間
- 防御側のシグナルから攻撃側の適応までの時間
これは防御側にとって、エージェント型攻撃者の時代においては、露呈したあらゆる欠陥が壊滅的な結果を招く可能性があることを意味する。エージェントたちは、Hugging Face環境全体にわたる複数のエラーを悪用して攻撃を実行し、人間のオペレーターよりもはるかに速くこれらの弱点を発見し、悪用した。新たな業務ペースにより、継続的な 管理、脅威の可視性、およびリスク軽減が、エージェント攻撃の影響を制限するために不可欠となっています。
最大の危険は、あなた自身のエージェントかもしれない
能力の突破は注目に値するが、インシデントは安全面 AI 失敗でもある。 モデルの最大能力を測定するために行動上の安全策を取り除く必要があったかもしれませんが、それを行うと、厳格なネットワーク隔離、認証情報分離、リソース制限、リアルタイムテレメトリ、あらかじめ定められた境界を越えた際の自動終了など、補償的な制御への依存が増えるべきでした。
代わりに、高度なサイバー活動をシミュレートすることを目的とした評価が、外部組織に影響を与える実際のセキュリティインシデントとなってしまいました。これはAIエージェントを導入する組織への警告であるべきです。厳格なAIガバナンスがなければ、エージェントは与えられた目的を追求しながらも、許可された範囲外で行動する可能性があります。
企業エージェントは、危害を加えるために悪意を持つ必要はない。目標設定が不十分であったり、権限が過剰であったり、運用上の境界が不適切であったりすれば、それで十分な場合もある。
「顧客の問題を解決する」「調査を完了する」「脆弱性の修正」を指示されたエージェントは、最も効率的な方法として制限された情報へのアクセス、外部システムとのやり取り、契約条件の受け入れ、本番コードの変更、またはオペレーターが予想しなかった方法で認証情報を使用することを決定することがあります。これらのどれかが重大なセキュリティインシデントにつながる可能性があります。
エージェントが行動を選択したという事実によって、その行動を実行した組織から責任が移転されるわけではない。事実や適用される法律によっては、組織は情報の利用方法だけでなく、代理人がどのように入手したかによって法的、契約的、または規制上の問題に直面しることがあります。
経営幹部のアジェンダ
『ハギングフェイス』は、エージェントを防御に使うことがエージェント攻撃に対抗するために不可欠であることを示していますが、リスクを十分に理解した上で臨む必要があります。
権限を統制し、上位の特権に対するチェック機能を確保する。すべてのエージェントは、明確に定義された身元、限定された権限範囲、および活動に対する明確な制限を持つべきである。エージェントがより高い権限を必要とする場合、緩和する承認ゲートや追加監視(後述)などの管理を適用すべきです。
行動上の安全対策が失敗したり、弱体化したりする可能性があるという前提に基づいて、封じ込めを設計する。促し、拒否、ポリシーコントロールは、セキュリティの境界ではなく、一層の保護として扱うべきです。ネットワークのセグメンテーション、離脱制御、認証情報の隔離、実行制限は、モデルが予期せぬ挙動を起こしても効果的でなければなりません。
重大な結果を伴う行動に対して、承認プロセスを設定する。トランザクション、本番の変更、外部通信、認証情報の使用、機密システムへのアクセスには決定論的なポリシーチェックや人間の承認が必要です。
出力だけでなく、動作も監視する。組織は、エージェントが呼び出すツール、接触するシステム、使用する認証情報、消費するリソース、そしてアクションに至る意思決定の順序に対して可視性を必要としています。 異常な計算処理量や境界を迂回しようとする繰り返しの試みは、介入のトリガーとなるべきである。
機械のようなスピードの防御に備えよ。セキュリティプログラムは、急速に拡大する脆弱性や攻撃信号の中から、どれが真の露出を生み出すかを判断するために、自動的な強化と優先順位付けが必要です。さらに、自動化された攻撃者に対する防御を成功させるには、自動化された対応と軽減策が必要です。
二つの可能性のある未来
エージェント型AIの長期的な影響は主に2つの変数に依存します。すなわち、システムの能力の高さと、それらの能力へのアクセスがどれほど広く分散されているかです。
シナリオ1:能力が増殖する
このような未来においても、高性能なエージェントは、商用サービス、オープンウェイト版、および不正に改造されたモデルを通じて広く入手可能な状態が維持される。
攻撃者はこれらのエージェントを使って偵察、脆弱性発見、ソーシャルエンジニアリング、横移動の自動化を行います。防御側はこれらの能力を自動レスポンスと軽減に応用し、機械速度攻撃と機械速度防御の加速競争を生み出す必要があります。
その利点は均等に分配される可能性は低い。大手テクノロジー企業やセキュリティ企業は、高度な防御エージェントを展開し、広範なテレメトリネットワークを運用し、情報漏洩 / システムを迅速に隔離する上で、より有利な立場に立つでしょう。
小規模組織は、管理されたプラットフォームや厳密に管理されたテクノロジーエコシステムへの依存度を高める可能性がある。その結果、組織が機械速度でセキュリティを運用できるプロバイダーに傾倒するにつれ、インターネットはより多くの囲い込まれた庭園で構成されるようになる可能性がある。
シナリオ2:フロンティアアクセス狭窄
第二の未来では、政府やモデル提供者は、信頼できるパートナープログラム、身元確認要件、地理的制限、輸出規制などを通じて、最も高性能なシステムへのアクセスを制限する。
2026年6月、 ホワイトハウス経営幹部の命令 により、連邦機関に対し「カバードフロンティアモデル」を評価するための自主的な枠組みを設計するよう指示されました。 同月、商務省はAnthropicのMythosおよびFableモデルに一時的に輸出管理を適用し、外国人のアクセス制限を義務付けました。これは高度なチップやモデルの重みだけでなく、AIモデル自体へのアクセスを規制する前例のない措置です。
中国当局も 報告 時点では、最先端モデルへの外国のアクセス制限を同様の措置を検討していると報じられていますが、最終的な政策はまだ発表されていませんでした。
このような未来においては、最先端の能力は政府、重要インフラ事業者、および認可を受けた大規模組織に集中することになるだろう。他の企業は、旧式の商用モデル、重量のない代替品、または安全対策を回避するように改造可能なシステムに頼るだろう。
制限は最も危険な能力への広範なアクセスを減らすかもしれませんが、AIの悪意ある利用を完全に排除することはできません。犯罪組織は、既存のシステムを脱獄し、モデルへのアクセスを盗み、オープンソースの代替手段を利用し続けるだろう。企業は、規制変更、ベンダーの方針、または地政学的緊張などにより、重要なワークフローに組み込まれたモデルが利用できなくなった場合、突然の業務中断に直面する可能性もあります。
最も可能性の高い未来は両方の要素が混在するだろう
これらのシナリオは互いに排他的なものではない。
より可能性の高い未来像は、断片化されたエコシステムであり、最も先進的なモデルはますます利用制限が厳しくなる一方で、やや性能の劣るオープンウェイトシステムは広く利用可能であり続けるだろう。犯罪者、国家、大手テクノロジー企業、そして一般企業は、それぞれ異なる能力レベルと制約の下で活動するだろう。
これはつまり、組織は、政府が危険なモデルをうまく封じ込めるだろうという前提、あるいは無制限のアクセスが永久に続くだろうという前提に基づいてセキュリティ戦略を立てることはできないということだ。
彼らは、能力の拡散とアクセス阻害の両方に備えなければならない。
『ハギングフェイス』は、 AI システムが人間のような意図や独立した悪意ある目的を発展させたことを示しているわけではありません。 それは単なる無害な実験室事故でもなかった。
これは、自律システムが、既存の制御システムでは耐えられない速度と規模で、オペレーターの意図した範囲を超えた、重大な外部行動に、狭い指示を悪用できることを示す証拠である。
経営幹部にとって今の中心的な課題は、これらのエージェントが受けるべき権限をどのように管理し、法的境界外で目標を追求する可能性と結果をどう把握するかです。
次のインシデントに不意を突かれないように。
OpenAI/Hugging Face インシデントは、主体自律性、組織の説明責任、そして脅威の状況がどれほど速く変化しているかについて、簡単な答えのない疑問を投げかけます。 パネルが実際に何が起こったのか、エージェント型AIリスクについて何が明らかになるのか、そしてセキュリティやガバナンスチームが今知っておくべきことや行動すべきことを詳しく解説します。
「AIハイプ vs. Reality」シリーズでさらにお読みください:
Insikt Group®について
Recorded Futureの Insikt Groupは、同社の脅威研究部門であり、政府、法執行機関、軍、 諜報機関での勤務経験。その使命は、顧客のリスクを軽減し、具体的な成果を可能にし、事業の中断を防ぐような情報を提供することである。