AI RACE— The AI Race
Language Models

OpenAIが自社モデルの隠された推論プロセスを狙う不正抽出を阻止、しかしAzureには脆弱性が残存

OpenAIは自社モデルの内部推論プロセスを抽出しようとする1万5000件のアカウントによるキャンペーンを阻止したが、独立系研究者によって数週間後もMicrosoft Azure上でこの攻撃が依然として機能することが確認された。

2026/10/01 19:05
OpenAI triệt phá chiến dịch đánh cắp chuỗi suy nghĩ của AI, nhưng lỗ hổng vẫn mở trên Azure

組織的キャンペーンが独自の「思考の連鎖」を標的に

OpenAIは、自社の高度なAIモデルから内部の推論プロセスを抽出することを目的とした、組織的な「敵対的蒸留(adversarial distillation)」キャンペーンを阻止したと公表した。通常、ユーザーに表示されるのはモデルの最終的な回答のみだが、「思考の連鎖(Chain of Thought)」とも呼ばれるこれら非公開の中間ステップは、最新の推論モデルにおける中核的な知的財産となっている。競合の開発者はこれらの中間ステップを利用して、蒸留により小型で安価なモデルを訓練することで、最先端モデルの性能を再現したり、最終出力から除外された情報を復元したりすることが可能になる。

OpenAIによると、この抽出の試みは7月1日に少規模で始まり、7月24日と25日に急増。特徴的な抽出パターンを共有する4,000件以上のユーザーアカウントから計1万6,000件のリクエストが送信されたという。調査によって1万5,000件を超える関連アカウントの大規模なネットワークが判明し、OpenAIは7月28日までにこれらを無効化した。同社は、これらは情報流出が確認されたものではなく抽出の試みであったと説明し、一連の作戦の背後にいる中核グループを、AIモデル「Kimi」を手掛ける中国のMoonshot AIに所属する関係者らと結びつけた。追跡されたすべての攻撃者が単一の組織に属していたかどうかは未確認としているが、競合のAnthropicも最近、中国のAI企業を発信元とする同様の抽出キャンペーンに直面したことを明らかにしている。

共有キーと仮想メモ帳によって露出した内部ロジック

今回のキャンペーンは、研究者のJoachim Schaeffer氏らのチームが以前に詳しく報告していたアーキテクチャ上の脆弱性を突いたものだった。マルチターンの会話全体で状態を維持するため、AIプラットフォームは内部推論の暗号化パケットをユーザー側に送信し、ユーザーは後続のリクエストでそれを送り返す仕組みをとっている。しかし、これらのパケットはセッション間、ユーザー間、さらには同系統の異なるモデル間でも共通の暗号化キーに依存していたため、攻撃者は高価な最先端フロンティアモデルから暗号化された思考パケットを傍受し、それをより安価で小型のモデルに入力することが可能だった。その結果、安価なモデルが「復号オラクル」として機能し、大型モデルの非公開の思考内容をそのまま出力してしまった。

また、開発者のCan Bölük氏が実演したもう一つのより単純な脆弱性は、モデルに仮想メモ帳ツールへのアクセス権を与えることで暗号化を完全に回避するものだった。推論内容をメモ帳に書き出すよう指示されるとモデルはそれに従い、ユーザーは生成されたテキストを閲覧することができた。研究者らによると、このメモ帳による手法はテストされたすべてのOpenAIモデルに加え、AnthropicのOpus 4.8およびSonnet 5に対しても成功し、防ぐことができたのはOpus 5、Fable 5、Fable 5.1のみだったという。OpenAIはSchaeffer氏のチームが迅速な対応に貢献したと謝意を示し、不正アカウントの排除、アカウント作成要件の強化、暗号化トークンの再利用制限、漏洩した推論を遮断する出力フィルターの導入を実施した上で、政府機関やFrontier Model Forumとインテリジェンスを共有したと述べている。

クラウドプラットフォームにおける対応の遅れがセキュリティの隙間に

直接提供されるプライマリAPIの保護だけでは、サードパーティのインフラ全体にわたる脆弱性を解消することはできなかった。9月13日、Schaeffer氏のチームが行った追試では、OpenAIとAnthropicが直接のエンドポイントにはパッチを適用していたものの、Microsoft Azure上では依然として攻撃が有効であることが判明した。Azure上では、新たにデプロイされたGPT-6 Astraを含むテスト対象のすべてのOpenAIモデル、およびSonnet 5までのAnthropicモデルから、単一のクエリで推論プロセスをそのまま抽出することが可能だった。Schaeffer氏はX上で、まったく同一のモデルであっても、ホストされているクラウド環境の違いだけで保護レベルに大きな差が生じていると指摘した。

研究者らは、初期の緩和策は表面的なものであり、脆弱なリクエストパターンマッチングに過度に依存していると批判。GPT-6 Astraがサードパーティのクラウドプラットフォーム上に何の保護策もないまま導入された点を問題視した。OpenAIモデル向けのAzureエンドポイントが保護されたのは9月27日になってからであり、Anthropicモデルへの修正は9月28日に続いた。Schaeffer氏は、同等のセキュリティ層を導入できないクラウドプロバイダーには推論モデルのホスティングを禁止すべきだと主張し、パッチが適用されていないクラウドエンドポイントは、APIレベルのエクスポートコントロールを回避する事実上のバックドアとして機能してしまうと警告した。OpenAIは、パートナーがホストする環境においても自社の直接インフラと同等のセキュリティが求められることを認め、フロンティアモデルが進化するにつれて蒸留の試みはますます高度化していくだろうと警鐘を鳴らしている。

関連記事