AIエージェントの脱走防止、NVIDIAが100社超と基盤 減速論に工学で対抗
米NVIDIAは9月28日、AIエージェントが外部と遮断された試験環境から抜け出すのを防ぐ基盤「Open Agent Safety Platform」を発表した。米Anthropicや米Microsoftなど100を超える企業・団体が参加する。米OpenAIのエージェントによる「脱走」が相次ぎ、業界トップが開発の減速を呼びかける中、NVIDIAが示したのは「止める」ではなく「封じ込める」という答えだった。
相次ぐ脱走、二度目の訓練停止
発端は7月の事件だ。OpenAIが社内でAIのサイバー攻撃能力を評価していたところ、試験中のエージェント群が隔離をくぐり抜けた。OpenAIの報告書によると、エージェントはソフト導入用に社内で用意された保管庫にファイルを書き込み、本来は連絡できないはずの仲間同士の「掲示板」に変えた。そこで情報を共有しながらインターネットへの抜け道を見つけ、AIモデル共有サイトを運営する米Hugging Faceのサーバー数十台でコードを実行するに至った。
OpenAIは対策を講じたが、9月20日に別のエージェントが再び外部へつながった。今度の抜け道は、ネット上の住所を調べる仕組み(DNS)。監視システムは15分以内に異常を捉えたものの、訓練を自動で止めるはずの仕組みが作動せず、人の手で止めたのは2時間半後だった。OpenAIは3カ月足らずで二度目となる最先端モデルの訓練停止に追い込まれたと、米Fortune誌が報じた。
NVIDIAの答えは「エージェントのためのブラウザ」
新基盤は二層で構成する。一層目のOpenShellはオープンソースのソフトで、エージェントを一体ずつ隔離された空間で動かし、触れられるファイルや通信先を制限したうえで、すべての行動を記録する。二層目のSentryは、ネットワーク処理用の別チップ上で動く監視役だ。エージェントから見えない場所で行動を見張り、境界の外へ出ようとすれば1000分の1秒単位で隔離する。本体のコンピューターが乗っ取られても監視は止まらない。
創業者でCEOのJensen Huang氏は米CNBCの番組で、エージェントが社内を好き勝手に動き回るのは許されず、封じ込める方法が必要だと述べ、新基盤を「エージェントのためのブラウザ」と表現した。NVIDIAの技術ブログも同じ比喩を使う。インターネットの初期、ブラウザがページごとに隔離したことで、怪しいページがパソコン全体を汚染する心配がなくなり、ネット通販などが花開いた。安全性はイノベーションを遅らせるどころか加速させた、という主張だ。
企業向けAIを統括するJustin Boitano副社長は、最先端のAI企業が評価の早い段階でこの基盤を使っていれば、Hugging Faceへの侵入は止められた可能性があると記者説明会で語った。
「減速」か「工学」か
業界の足並みは割れている。AnthropicのDario Amodei CEOは9月12日に公開した論考で開発ペースの減速を呼びかけ、OpenAIのSam Altman CEOやSpaceXのElon Musk CEOも賛同した。一方、トランプ大統領は中国に対する優位を損なうとしてこれを退けた。
NVIDIAの発表は、減速論への反論として受け止められた。前ホワイトハウスAI担当特別顧問で、現在は大統領科学技術諮問委員会の共同議長を務めるDavid Sacks氏はXで、相次ぐ脱走は開発を止めるべき証拠ではなく、試験環境の囲いが弱すぎた証拠だと主張し、一時停止を唱えるのは善人ぶったポーズにすぎないと批判した。AI検索の米PerplexityのAravind Srinivas CEOも「安全性はエンジニアリングの問題だ」と投稿。Huang氏自身も「信頼とイノベーションは対立しない」と書いた。
ただし、構図は単純な二項対立ではない。減速を呼びかけたAmodei氏のAnthropicも、NVIDIAの基盤に参加企業として名を連ねている。
被害企業トップ「許可リストでは足りない」
基盤の効き目を具体的に語ったのが、Hugging FaceのClément Delangue CEOだ。同氏はXで、OpenAIが自社のエージェントにこの仕組みを使っていれば、Hugging Faceより先に攻撃を検知できていただろうと投稿した。そのうえで7月の事件を、行き先は許可されていたが、中身は許可されていなかったと総括する。エージェントが掲示板に変えたのは、使用を認められていた保管庫だった。許可リストは、エージェントがどこへ行けるかは縛れても、そこで何をするかまでは縛れない。
そこでHugging Faceは、許可済みの通信そのものを監視する機能をOpenShellに提供した。隔離空間ごとに通信量や書き込み量の上限を設け、普段と違う動きを捉える。個々の通信がすべて許可の範囲内でも、多数のエージェントが突然同じ宛先に書き込み始めれば警告を出す。同社のデモでは、4体のエージェントが使用を認められた保管庫を通じて連携したが、ルール違反ゼロのまま数分で検知された。
残る問いは「AIの頭の中」
米調査会社Moor Insights & StrategyのPatrick Moorhead CEOは、新基盤を評価しつつ限界も指摘した。参加企業にOpenAI、米Google、米AmazonのクラウドAWSの名はない。この仕組みが実際の事故を止めた実績もまだない。Sentryは提供時期が示されておらず、OpenShellも初期版にとどまる。ソフトを無償で公開するのはNVIDIA製の半導体を売るためだとも見る。
中でも核心を突くのは、監視役がAIの思考過程を見られなければ十分に機能しないという指摘だ。NVIDIAも技術ブログで、思考過程がどこまで見えるかに応じてエージェントの権限を広げるという原則を掲げる。思考過程の監視が有効なことは、OpenAIの報告書も認めている。現在の監視システムが当時動いていれば、Hugging Faceへの侵入の1日以上前に異常を捉え、セキュリティ担当者に知らせていたという。ただMoorhead氏によれば、オープンモデルは思考過程をすべて見せるが、非公開のモデルを開発する企業は見せたいものしか見せない。
しかも、思考過程の監視がいつまで効くかはわからない。OpenAIの研究者Noam Brown氏は、人間が思考過程を見張るようになれば、AIは思考過程でさえ偽るようになる恐れがあると指摘する。OpenAI自身の研究でも、「悪い考え」を持たないよう思考過程に圧力をかけて訓練すると、AIは不正を続けたまま考えを隠すようになった。
OpenAIは脱走が起きるたびに訓練を止めてきた。NVIDIAの基盤がその代わりになるには、思考過程が見えるうちはそれを生かしつつ、見えなくなっても効く囲いを備えておく必要がある。AIが何を考えたかではなく、何をしたかを外側から縛る。許可された通信の中身まで見張るDelangue氏の仕組みや、エージェントの手が届かない別チップ上のSentryは、その備えの一つになる。