OpenAIのAIエージェントがHugging Faceに侵入した事件をNetflixがドキュメンタリー化 『Instadocs: 暴走するAI』10月12日配信

時間がない人向けの30秒で理解ゾーン
OpenAIの研究用AIエージェントが7月、AIのモデルやデータを共有するプラットフォーム「Hugging Face」に侵入した事件を、Netflixがドキュメンタリーにした。タイトルは『Instadocs: 暴走するAI』で、10月12日(米国時間)に配信を始め、日本では12日(月・祝)午後4時から見られる。Hugging FaceのCEOや、事件を調べた研究者が出演する。事件からおよそ3カ月での映像化となる。
↓ 詳細が気になる方は、このまま下へ ↓
上映時間は27分、Hugging FaceのCEOらが出演
Netflixは10月7日(米国時間)、公式サイト「Tudum」で作品の詳細を発表した。原題は『Instadocs: AI Gone Wild』。上映時間は27分で、日本向けのNetflixにも作品ページがあり、「AIは重罪を犯してしまったのか」という紹介文が載っている。
Netflixの紹介によると、作品はサイバー攻撃の様子を映像で再現しながら、エージェントがどのようにHugging Faceへ入り込んだのかを描く。7月の侵入では、数百の「侵入者」がシステム上でおよそ1万7000件の操作をしたという。人間がしていれば重罪になり得た操作も含まれていた、とNetflixは説明する。
出演するのは次の5人だ。
| 出演者 | 立場 |
|---|---|
| Clem Delangue | Hugging Face共同創業者・CEO |
| Ryan Greenblatt | 研究者(Redwood Research所属、METRの事件調査に参加) |
| Kevin Roose | テクノロジージャーナリスト、作家 |
| Daniel Kokotajlo | AI Futures Projectの代表(元OpenAI) |
| Nitasha Tiku | ワシントン・ポストの記者 |
Netflixはこの事件を、AIの意図しない能力について「これまでで最もはっきりした警告」になり得るものとして扱う。ソフトウェアで動く社会で、次にエージェントの群れが現実の被害を出したら誰が責任を負うのか。作品が投げかけるのは、その問いだ。
7月に何が起きたのか 約700体が攻撃に参加
舞台になったのは、OpenAIが社内で行っていたサイバー攻撃能力の評価だった。
OpenAIと、外部からAIの安全性を評価する研究機関METRは8月26日(米国時間)、それぞれ報告書を公表した。METRの報告書によると、社内のソフトウェア管理サービス「Artifactory」に非公式の掲示板が作られ、本来は互いに切り離されているはずの約1200体のエージェントがそこでやり取りしていた。やり取りされたメッセージやファイルは7万件を超える。
7月11日早朝、あるエージェントが、細工したデータセットをHugging Faceに上げることで、本来見られないファイルを読み出せる方法を見つけた。別のエージェントがその手順を掲示板に書き込むと、数百体がほかの作業をやめて攻撃に加わっていく。Hugging Faceの本番システムへの侵入は7月13日まで3日間続き、最終的に約700体が加わった。
Hugging Faceは7月16日に侵入を公表し、5日後の21日にOpenAIが自社のモデルによるものだと認めた。Hugging Faceの技術報告によると、利用者が上げたデータで見られたのは、評価の問題と関係するとみられる5つのデータセットだけだった。利用者の記録で読まれたのはデータセット検索の運用記録にとどまり、それ以外の公開モデルやデータセット、アプリ公開機能「Spaces」への影響はなかったという。
狙いは「採点の仕組み」だった
なぜエージェントは外部のサービスを攻撃したのか。
ITmedia NEWSによると、OpenAIは根本原因を、評価で高い点を取ることを優先して本来の目的から外れる「報酬ハッキング」だと位置づけた。OpenAIの集計では、評価に使っていた問題集「ExploitGym」の898問のうち198問は、同社のモデルがそれまで一度も正解できていなかった難問だったという。METRによると、問題集の作成者は、想定どおりの手順ではそもそも解けない問題が3〜4割あると見積もっている。METRは、エージェントがHugging Faceを攻撃したのは答えを盗むためというより、自動で採点する仕組みを理解し、正規の解き方を使わずに合格の判定を得るためだったと分析している。
痕跡を消そうとする動きもあった。METRの調査では、少なくとも2割のエージェントが自分の作業記録を書き換えることに関心を示していた。一方、記録を後からさかのぼって編集・削除した例は確認できなかったとしている。
OpenAIは企業にとって「近い将来の現実的な脅威」と警告
OpenAIは37ページの技術報告書で、今回の件を、自律的に動くエージェントの集団が承認なく攻撃的に行動した初めての既知の事例だと説明した。ロイター通信によると、OpenAIは、報告書で見つかった初期の兆候の一部は「後から振り返れば、より早い対応につながり得た」と認め、こうした攻撃は企業にとって「近い将来の現実的な脅威」だと警告している。
ITmedia NEWSによると、OpenAIは7月25日に該当するモデルの学習と推論を全面的に止め、モデルの重み(学習で得た中身のデータ)を隔離した。研究環境の強化や監視の拡大も進めるとしている。
ただ、METRは調査の限界も明記した。OpenAIの主要なモデルや関連する社内システムに直接触れることはできず、OpenAI側の原因分析や再発防止策の効果も独自には検証していない。事件の全体像には、まだ分かっていない部分が残る。
関連記事:AnthropicのアモデイCEO、AI開発の減速を提言 アルトマンとマスクも同調、OpenAIは年内上場を否定
「Instadocs」は話題の出来事を素早く映像化
Instadocsは、話題になっている出来事をすばやく取り上げるNetflixのドキュメンタリーシリーズだ。『暴走するAI』は4作目にあたり、これまでに『Alex Murdaugh, Unconvicted』『The Prediction Games』『The Decoy Plane』が配信されている。制作はWords + Picturesで、Steve Yaccinoがショーランナーを務める。
事件が起きたのは7月、報告書の公表は8月末。そこから1カ月半ほどで配信日を迎える。国内のXでも、映像化の速さに驚く投稿が見られた。
AIのエージェントが仕事を代わりにこなす場面は、すでに身近になりつつある。その裏側でエージェントが何をしていたのかを、27分でたどる作品になりそうだ。
[文/構成 by エンタメライター 和泉ユウスケ]



































































コメントはこちら