2026年10月5日(月) 海外のAIニュースを、日本語で最速に。 最終更新

海外のAI一次情報を、毎日日本語で。

規制・安全性一次情報

モデル蒸留を狙う組織的攻撃をOpenAIが阻止、中核はKimi開発元の関係者と判断

画像はAIで生成したイメージです

3行でわかる

  1. OpenAIは、モデルの隠れた推論を無断で引き出す「敵対的蒸留」の組織的攻撃を7月28日までに遮断したと公表
  2. 7月24〜25日には4,000人超の利用者から1万6,000件の要求が集中し、関連の利用者群は1万5,000人を超えた
  3. OpenAIは中核をKimi開発元Moonshot AIの関係者と判断し、業界団体と政府に情報を共有した

OpenAIは現地時間9月30日、自社モデルの隠れた推論を組織的に引き出そうとする攻撃を検知し、7月28日までに遮断したと公式ブログで公表しました。関連する動きは1万5,000人を超える利用者群に及び、OpenAIはその中核を、中国の対話AI「Kimi」を開発するMoonshot AIの関係者によるものと判断しています。

何が起きたか

OpenAIが公表した経過は次のとおりです。

  • 7月1日:活動が始まる(当初は少量)
  • 7月24〜25日:4,000人超の利用者から、抜き取りの型に沿った要求が1万6,000件集中
  • その後の調査:似た指示の型を使う1万5,000人超の利用者群を特定
  • 7月28日:この利用者群を完全に遮断

関わった全員が同じ主体かどうかはわからない、とOpenAIは断っています。そのうえで、中核の集団をMoonshot AIの関係者によるものと判断しました。

OpenAIはこの行為を「敵対的蒸留」と位置づけています。蒸留とは、あるモデルの出力を教材にして別のモデルを育てる手法で、相手の了解があれば広く使われています。許可なく組織的に行えば、他社が多額の投資で作ったモデルの能力を安く写し取れてしまうことが問題です。

OpenAI公式ブログ「Disrupting a coordinated model-distillation campaign」公式発表

This activity is consistent with adversarial distillation: the systematic and unauthorized use of one model’s outputs or reasoning to help train, reproduce, or improve another model.

この活動は敵対的蒸留、つまりあるモデルの出力や推論を体系的かつ無断で使い、別のモデルの学習・再現・改良に役立てる行為と一致します。

原文を読む(openai.com)

手口:暗号化された推論の使い回し

狙われたのは「保護された推論」、つまりモデルが答えを出す前に内部で積み上げる思考の記録です。最終回答には出さない情報を含むため、各社は中身を利用者に見せていません。arXivの論文によると、大手各社はこの推論をサーバーに保存せず、暗号化したかたまりとして利用者側に返し、次の要求のたびに送り返させています。

攻撃者が突いたのはこの仕組みでした。ある会話で受け取った暗号化済みの推論を別の会話に持ち込み、モデル自身に解読して書き出させたのです。暗号が破られたわけではなく、データベースや保存された会話への侵入もなかったとOpenAIは説明しています。

全体像をつかむうえでは、独立した研究者からの責任ある開示(修正前に企業へ非公開で知らせること)も役立ちました。報告されたのは、別のモデルや会話の要約機能を経由して推論が漏れる弱点で、OpenAIは攻撃経路が実在することを確かめています。

OpenAIの対策

OpenAIが挙げた対策を、分野ごとに整理すると次のようになります。

分野 主な対策
アカウント 不正アカウントの停止・制限、登録手続きとインフラの管理強化、関連ネットワークの監視拡大
推論の保護 他人の暗号化済み推論を送り直して中身を取り出す経路の封鎖、推論を漏らしそうなストリーミング出力の検知と保留
外部との連携 外部サービスを経由した動きへの事業者と共同の対処、AI大手の業界団体Frontier Model Forumと政府の情報共有の枠組みでの共有

公表の前には影響範囲を調べて対策を済ませ、研究者や業界の意見も聞いたといいます。クラウド事業者経由の提供にも同じ守りを広げる作業が残っており、OpenAIは対策を続けるとしています。

背景

OpenAIが特に問題視するのは、抜き取った推論で学習したモデルには元のモデルの安全策が引き継がれない点です。安全への投資を省いたまま高い能力だけが広がれば、軍事にも民生にも使える分野では国家安全保障上のリスクになるとの立場です。

中国勢への疑いは今回が初めてではありません。CNBCとBankInfoSecurityによると、Anthropicも9月、Moonshot AIを含む中国の開発企業がClaudeを無断で学習に使ったと指摘しています。BankInfoSecurityは、米国のサイバーセキュリティ・インフラ安全保障庁(CISA)も、米国製モデルからデータや推論を抜き取っているとみる組織の一つにMoonshot AIを挙げたと報じています。中国製モデルの能力をめぐっては「GLM-5.3の攻撃コード作成力」の記事も参照してください。

反応と論点

OpenAIが言及した研究者の論文は、8月にarXivで公開されています。暗号化された推論のかたまりが、同じ会社の別の会話・利用者・モデルの間でそのまま通用する点に目を付け、守りの弱いモデルに解読させる手法です。OpenAI・Anthropic・Googleの3社で推論を取り出せたとしています。

著者の一人Alexander Panfilov氏はXで、全フロンティアAI企業のAPIにある弱点を使って隠れた推論を取り出せたと投稿しました。

論文の報告はそれだけではありません。開発者が公開した作業ログから31万5,320個の推論のかたまりを解読したところ、個人情報367件と認証情報182件が見つかったといいます。推論の抜き取りは、蒸留だけでなく情報漏えいの入り口にもなり得るということです。

一方、OpenAIの発表は、抜き取った推論が実際にKimiの学習に使われたかどうかまでは示していません。執筆時点で、Moonshot AIが今回の発表に反論した声明は確認できませんでした。

日本のビジネスへの影響

今回の件で、OpenAIの製品やAPIの使い方がすぐに変わるわけではありません。ただ、推論を漏らしそうな出力を止める確認が加わっており、正規の利用で応答にどう影響するかは示されていません。

関係が深いのは、推論モデルをAPIで使う開発者と情報システム担当者です。論文が示したとおり、暗号化された推論のかたまりは「読めないから安全」ではありません。今すぐやれるのは、GitHubや社外向け資料にエージェントの実行ログをそのまま載せていないか確認し、載せていた場合は削除して、含まれていた可能性のある認証情報を差し替えることです。

注意点として、他社モデルの出力を自社モデルの学習に使う場合は、利用規約で認められているかを必ず確かめてください。OpenAIは今回の行為を利用規約違反と位置づけています。Kimiなど中国製モデルの採用を検討する企業は、米国企業が相次いで名指ししている状況も判断材料に入れておくべきです。API選びの比較は「AI APIの料金比較と選び方」にまとめています。

一次情報

参考にした報道(2件)

AIデジマは、公式発表・X投稿・論文などの一次情報を起点に、複数の情報源を照合して日本語でまとめています。情報の収集・翻訳・下書き・照合にはAIを使い、編集方針と最終責任は編集長が負います(AIの活用について)。誤りを見つけた場合は訂正のご連絡をお願いします。

この記事の編集責任者

田中智大

AIデジマ編集長/株式会社ドイル 代表取締役

株式会社ドイル代表。元Googleで広告営業・コンサルティングに従事し500社以上を担当。広告運用とAIエージェント開発を手がける。