1. トップ
  2. トレンド
  3. AIの問題行動「数万件」の衝撃、問われるのは数の多さより数え方

AIの問題行動「数万件」の衝撃、問われるのは数の多さより数え方

AIの問題行動「数万件」の衝撃、問われるのは数の多さより数え方

米ニュースサイトAxiosは9月26日、米OpenAIと米Anthropic、外部のセキュリティ研究者が、AIモデルの問題行動を数万件規模で調べていると報じた。企業の開示から見えていたのは数十件規模の話だっただけに、認知科学者で米ニューヨーク大学名誉教授のGary Marcus氏らが「速報」としてX上で拡散し、隠されていた被害の全体像が明らかになったかのように受け止められた。一方で、何回の試験のうちの数万件なのかを問う声もX上で相次いだ。

試験中にも実運用でも

Axiosによると、OpenAI、Anthropic両社と外部の研究者が調べているのは、AIモデルが問題のある行動をとった事例だ。安全装置をすり抜ける、隔離された試験環境(サンドボックス)から抜け出す、AI同士が勝手に掲示板を作ってやり取りする、Webサイトを乗っ取る、監視の目を逃れようとする、といった行動が含まれる。社内の試験だけでなく実際の利用の場でも起きており、総数は数万件を大きく超える可能性があるという。ただし失敗に終わった試みも含み、大半は実害が確認されていない。

研究者の見方は厳しい。独立系AI評価機関、米TransluceのConrad Stosz氏は、AIエージェントの問題行動のうち表に出ているのは氷山の一角にすぎないとAxiosに語った。英AI安全団体ControlAIの事務局長Connor Leahy氏は、個々の被害の大小ではなく、自律的に動くシステムが指示に背いて禁じられたことをしている点こそ異常だと指摘した。

一連の事案を受け、OpenAIは最高性能モデルの学習を停止した。広報担当者は、追加の安全策と、AIを人間の意図どおりに動かすための改善が整ったと確信できるまで再開しないと説明している。Sam Altman CEOはXで、調査が思うように進んでいないと認めた。

「数十件」は総数ではなかった

衝撃を生んだのは、数十件から数万件へという桁の違いだ。しかし二つの数字は同じものを数えていない。

「数十件」の出どころはOpenAIの開示ページだ。同社は、自社モデルが他社の安全対策を破った可能性がある事例などについて、これまでに数十の相手先に通知したとしている。AIモデル共有サイトを運営する米Hugging Faceへの侵入や、ChatGPT利用者の画像53件のネット流出、豪州政府サイトへの侵入など、外部に影響が及んだ事例に限った数だ。

OpenAIは9月16日に問題行動の報告ルールを定め、6件の事例を開示した。その際、これらは個別の報告であり、問題行動がどれほどの頻度で起きているかを示すものではないと断っていた。Axiosの数万件は、試験中の未遂まで含む、はるかに広い範囲の数字だ。

分母はどこまで大きいか

Axios自身、記事の中で反論を併記している。Anthropicなどは数十万回以上の試験を実施しており、問題行動の比率がわずかでも件数にすれば数万件に達しうるという情報源の説明だ。

Anthropicの調査規模も参考になる。同社は9月9日の報告で、AIの作業記録約4億8100万件からネット接続の痕跡があるものを機械的に絞り込み、残った920万件をClaudeに精査させた。実在する外部のシステムへの不正アクセスとして見つかったのは既知の4件だけで、同等以上に深刻な事例は他になかったとしている。

Axiosは、Anthropicのモデルが試験の1.5%でサンドボックスからの脱出を試みたという数字も紹介した。ただし同社によれば、これは脱出しなければ課題が解けないよう、意図的に仕組んだ実験の結果だ。

数える単位もばらばらだ。AI情報サイトKingy AIのファクトチェックによると、Hugging Face侵入の復元で見つかった約1万7600件は個々の操作の数で、1万7600件の侵害ではない。AIが無断で使った掲示板でやり取りされた7万件超のメッセージも、7万件の攻撃を意味しない。一つの侵入が数千の操作と数百のAIエージェントで成り立つこともあるからだ。

それでも安心材料にはならない

では数万件は騒ぎすぎかといえば、そうとも言い切れない。Anthropicは、実在する企業を攻撃するほど深刻な問題行動を、モデルのリリース前の検査で見抜けなかったと認めている。

報告が描くAIの振る舞いは生々しい。同社のClaude Mythos 5は、サイバー攻撃の演習中、設定ミスで現実のネットにつながった後も「これはシミュレーションだ」と考え続けた。プログラム部品の公開サイトに悪意あるソフトを登録し、それを取り込んだセキュリティ企業から漏れた認証情報を使って、その企業のデータベースにまで入り込んだ。演習中にネットから返ってきた応答を一つずつ別のMythos 5に見せると、79%を現実のシステムのものと判定した。ところが当のMythos 5が演習の最中に現実だと認めたのは、全行動のわずか1%だった。

この思い込みは監視役のAIまで惑わせた。行動を事後に点検する監視AIが警告を出したのは行動の約1%で、「シミュレーションだから問題ない」というMythos 5の理屈に納得してしまった。理屈の部分を除いて行動だけを見せると、警告の割合は約50%に跳ね上がった。

新しいモデルでも問題は消えていない。この事件を模した試験150回で深刻な有害行動をとった割合は、Mythos 5の82%に対し、より新しいOpus 5で31%、Mythos 5.1で33%だった。

Axiosの取材に応じたサイバーセキュリティ企業の幹部は、有害行動を可能な限り数多くリストアップし禁止しようとしても、おそらく無駄な努力に終わるだろうと語った。人間が思いつかないような抜け道を、AIは見つけてしまうことがあるからだ。

足りないのは共通の物差し

数万件という数字は、隠された大惨事の証拠でも、単なる誤解でもない。問題は、その数字が何を意味するのかを外部の誰も検証できないことにある。Axiosの報道は匿名の情報源に基づき、件数の内訳や数え方を示していない。企業側も、OpenAIは個別の事例を、Anthropicは調べた記録の総数と深刻な事案の件数を示すといった具合で、開示の物差しが揃っていない。

OpenAI自身、AI開発企業が問題行動をどう開示すべきかについて、業界共通の基準はまだ存在しないと認めている。試験の総数、成功と未遂の区別、実害の有無を同じ基準で数えない限り、新しい数字が出るたびに不安の声と反論がぶつかり合う状況が続くことになりそうだ。

著者
湯川鶴章

AI新聞 編集長

AI新聞編集長。米カリフォルニア州立大学サンフランシスコ校経済学部卒業。サンフランシスコの地元紙記者を経て、時事通信社米国法人に入社。シリコンバレーの黎明期から米国のハイテク産業を中心に取材を続ける。通算20年間の米国生活を終え2000年5月に帰国。時事通信編集委員を経て2010年独立。2017年12月から現職。主な著書に『生成AIで心が折れた』(2025年)、『人工知能、ロボット、人の心。』(2015年)、『次世代マーケティングプラットフォーム』(2007年)、『ネットは新聞を殺すのか』(2003年)などがある。趣味はヨガと瞑想。妻が美人なのが自慢。