生成AIがフィジカルAIの領域へ GPT-6 Astraがロボットを動かし始めた
米OpenAIの最新モデルGPT-6 Astraが登場すると、Xにはさまざまなデモ動画があふれた。
その一つが、パソコンにカメラとロボットアームをつなぎ、AstraにGolden Gate Bridgeの絵を描かせる実験だった。Astraはカメラで状況を確認しながらロボットアームを動かし、試行を重ねながら描画を進めていった。
Astraの特徴の一つが、AIが画面を見てパソコンを操作するComputer Useと呼ばれる技術だが、そのComputer Useが、パソコンの画面から物理世界へ飛び出した瞬間だった。
そして今、その延長線上で、生成AIがフィジカルAIの領域に踏み込み始めている。ロボット専用モデルを一から作らなくても、Astraのような最新の汎用AIモデルを、さまざまなロボットを動かす「頭脳」として使えるのではないか。そんな実験が始まっている。
MIT教授Philip Isola氏は、AIがカメラ映像を見ながらロボットを操作する仕組みを「robot-use」と呼んでいる。米Waddle Labsや、physical AIの評価を手掛ける米RoboCurveは、この方向で実験を進めている。
Computer UseとRobot Use
Computer Useは、人間と同じ画面を見ながら状況を把握し、次にどこを操作すべきかを判断する。操作した結果を確認し、必要なら次の行動を変える。
単純化すれば、
画面を見る
→ 状況を理解する
→ 操作する
→ 結果を確認する
→ 次の行動を決める
という循環になる。
Robot Useでも基本構造はよく似ている。
カメラを見る
→ 周囲の状況を理解する
→ ロボットアームを動かす
→ 結果を確認する
→ 次の動作を決める
今回の動画では、Astraがカメラ映像を受け取り、ロボットアームの手先をどこに移動させるかを何度も判断しながら、ブロックを持ち上げてボウルに入れる様子が紹介されている。モデルは一度だけ命令を出すのではなく、カメラから得た新しい状況を見ながら動作を続けていく。
つまり、Computer Useで身につけた「環境を見て、道具を操作し、その結果を見て次の行動を決める」という能力を、ロボットという別の道具に接続しているわけだ。
なぜ、それが可能になったのか。
Waddle Labs側が注目しているのが、最近の汎用AIが学んでいるデータの広がりだ。
現在の高性能モデルは文章だけを学んでいるわけではない。プログラミングコード、画像、パソコン操作、CADや3Dソフトなど、多様なデータを扱うようになっている。
例えば3D制作ソフトのBlenderで三次元の物体をマウスで回転させるには、単にカーソルの位置を理解するだけでは足りない。物体の向きや上下左右、視点を変えたときの見え方など、空間の関係を扱う必要がある。
Waddle Labs共同創業者のHan Mei氏は、こうしたComputer Useのデータが、大規模な汎用モデルの中ではロボット制御にも役立つ可能性があると指摘する。
ここには面白い逆転がある。
人間はコンピューターを使いやすくするため、画面の中を現実世界に似せて作ってきた。
書類を「ファイル」と呼び、「フォルダ」に入れる。マウスで物をつかんで移動する。CADでは三次元の物体を回転させ、別の角度から眺める。
そのデジタル空間を大量に操作したAIが、今度はそこで得た能力を使って現実世界を操作し始めている。
コーディング能力がロボットの技能になる
Robot Useを支えているもう一つの能力が、コーディングだ。
ロボットには、「物をつかむ」「持ち上げる」「指定した位置まで動かす」といった基本操作がある。これらをAIから呼び出せるようにしておけば、コーディングエージェントは複数の操作を組み合わせ、新しい作業手順をプログラムとして作ることができる。一度うまくいった作業は、その手順をスキルとして保存し、次から再利用できるようにもなる。
例えば「テーブルの上にある物をボウルへ入れる」という仕事なら、対象物を確認し、ロボットアームを近づけ、つかみ、持ち上げ、ボウルまで移動させ、手を開くという一連の処理を組み立てスキルとして保存する。こうすることで、追加のロボットデータを大量に学習させなくても、複数の操作を組み合わせた仕事を一度の指示から実行できるという。
これは現在のコーディングエージェントが得意としている仕事とよく似ている。ソフトウェア開発では、AIは既存のライブラリやツールを組み合わせ、新しいプログラムを書く。ロボットでは、そのツールが「物をつかむ」「腕を動かす」といった物理的な機能に変わるというだけのことだ。ソフト開発同様に、一度うまくいった作業は、毎回AIモデルに考え直させる必要もない。こうして、Computer Useとコーディングで培った能力が、そのままロボット制御に流れ込み始めている。
ロボット専用モデルとの境界が薄くなる
ロボットAIでは、ロボットを実際に動かして集めたデータを使い、専用モデルを訓練する研究が進められてきた。
代表例の一つがGoogleのRT-2だ。RT-2は、汎用モデルをロボットの動作データで追加学習してロボット用に仕上げた。一方Astraでは、ロボット専用の追加学習をほとんど行わず、もともと持つ視覚認識やComputer Use、コーディング能力をそのままロボット制御に使っている。
しかし大事なのはモデルの構造そのものよりも、どんな学習データを与えるかだとWaddle LabsのHan Mei氏は言う。
ロボットモデルを賢くするために、コードのデータを与える。Computer Useのデータも与える。画像やさまざまなツールの利用方法も学ばせる。そうやって能力を足していくと、出来上がるものは次第に汎用LLMエージェントに近づいていくという「そうであるなら非常に優れた基盤LLMを作り、それを使ってロボットを制御すればいいのではないか」とMei氏は言う。
ここに、フィジカルAIをめぐる開発競争を変える可能性がある。
従来は、ロボットという専門分野のために専用の知能を作る発想が中心だった。しかし汎用LLMの能力が十分に高まれば、ロボット専用モデルが担ってきた領域の一部まで吸収できる可能性が出てくるわけだ。
フィジカルAIでも「汎用モデル」の時代が来るのか
もちろん、現時点で汎用LLMだけですべてのロボット制御ができるわけではない。
大きな課題の一つが速度だ。
今回のデモでも、Astraがカメラ映像を確認し、次の動きを考えてからロボットを動かすため、動作には時間がかかる。Waddle Labs側も、高性能モデルをすべての動作に介在させ続ける方法では、実用上遅すぎると指摘している。
そのため、一度覚えた作業はコードやskillに変え、高速な仕組みに任せる。汎用LLMは、未知の状況を理解し、新しい方法を考える部分を担当する。
それでも、Astraの登場時にXに投稿されたロボットアームの動画は、今振り返ると象徴的だった。
当時は「AIにロボットアームで絵を描かせてみた」という面白いデモにも見えた。
しかしその背後では、Computer Useで培った能力を、物理世界に持ち出す試みが始まっていた。
日本ではいま、フィジカルAIへの関心が急速に高まっている。だが、その中核を担うAIが必ずしもロボット専用モデルとは限らない。
コードを書き、画面を見て操作し、三次元空間を扱ってきた汎用LLMが、その能力をロボットへ広げ始めている。
フィジカルAIの競争は、ロボット専用AIをどこまで高度化できるかだけではなく、汎用LLMをどこまで現実世界に接続できるかを競う段階に入り始めている。