フィジカルAIの行方を決める現実空間データの争奪戦
生成AIをロボットへ広げる動きが加速する中で、新たなボトルネックが浮上している。現実世界で人やロボットがどのように作業するのかを記録した「実世界データ」だ。
米スタートアップ支援大手Y Combinator(YC)は2026年9月17日に公開した動画で、ロボットAIを開発するAI大手が、一人称視点の映像や実際の作業データを提供する企業と、1000万ドルから数億ドル規模の契約を結び始めていると明らかにした。Y Combinator「The State of Startups in 2026」
背景にあるのは、言語AIとロボットAIでは、学習に使えるデータの量がまったく違うという問題だ。
大規模言語モデルは、ウェブサイト、書籍、プログラムなど、人類が長年デジタル空間に蓄積してきた大量のデータを学習できた。一方、工場で部品を組み立てる、倉庫で荷物を梱包する、家庭で食器を洗うといった人間の動作は、ほとんど記録されていない。
米AIデータ基盤企業Encordのロボット学習責任者Vineeth Velmurugan氏はTechCrunchに、「データそのものが存在しない」と説明している。TechCrunch
ロボットAIの開発競争は、モデルを賢くするだけでなく、人間の膨大な「動き」をどうデータ化するかという競争に移り始めている。
人間の仕事を「ロボットの教科書」に
現在、急速に広がっているのが「一人称視点データ」の収集だ。
作業者が頭部などにカメラを装着し、本人の視点から仕事を記録する。ロボットはその映像から、物をどの順番でつかむのか、道具をどう扱うのか、作業中に何が起きたら動きを変えるのか、といった人間の行動を学ぶ。
米ロボット学習データ企業Human Archiveは、インドのサービス業や製造業で働く人々などから、こうしたデータを集めている。同社は2026年5月に820万ドルを調達した。TechCrunch
同社が8月に公開したデータセット「Ego500」には、家庭、工場、レストラン、倉庫、美容室、建設現場、自転車修理店など60種類以上の環境で撮影した約519時間の映像が含まれている。映像には31万件以上の細かな動作説明が付けられている。Human Archive「Ego500」
単に「人が食器を洗っている」という映像を集めるだけではない。
例えば、右手で何を持っているか、左手は何をしているか、どこからどこまでが一つの動作なのか、どの物体に触れているのか、といった情報まで付与する。映像を、ロボットが学習できるデータへ変換するためだ。
YCによるとHuman Archiveは、最大で1日8000時間のデータを収集できる体制を構築し、5万人以上に拡大できる協力者ネットワークを確保しているという。Y Combinator「Human Archive」
同じYCの2026年夏バッチに参加した米ロボット学習データ企業Praxis Roboticsは、さらに企業の現場そのものをデータ供給源にしようとしている。
同社は工場、倉庫、住宅などで働く人の作業を撮影し、AI大手やヒューマノイドロボット企業へ提供する。すでに5大陸、150種類以上の作業環境に入り、6万人の労働者にアクセスできるとしている。Y Combinator「Praxis Robotics」
同社も、集めるのは映像だけではない。立体視カメラ、手首カメラ、体の動きを測るセンサー、手袋から得る動きや触覚などを組み合わせる。
Praxisは自社の事業を「現実の仕事をロボットの学習データに変える」と表現している。
ここで価値を持つのは、カメラの台数だけではない。工場や倉庫など多様な現場に入り、そこで行われる作業を継続的に記録できること自体が、データ企業の競争力になっている。
人の映像より価値が高い「ロボット自身の経験」
ただし、人間を撮影した映像だけでは分からない情報もある。
人間の手とロボットアームでは、関節の構造も動かせる範囲も違う。映像から人の動きを理解できても、「そのロボットを実際にどう動かせば同じ作業ができるか」は別の問題になる。
そこで価値が高まっているのが、人間がロボットを遠隔操作して作業させ、その過程を記録する「テレオペレーション」のデータだ。
米ロボット学習データ企業XDOFは、人間がロボットアームを操作し、服を畳む、部品を挿し込む、工具を使う、物を組み立てるといった作業データを大量に収集している。
同社が2026年6月に公開した「ABC-130K」には、二本のロボットアームを使った13万回以上の作業記録が収録されている。対象となる作業は195種類に及ぶ。XDOF「ABC-130K」
このデータの特徴は、「人間が何をしたか」を映像から推測するのではなく、ロボットがどの関節をどう動かし、その結果どうなったのかを直接記録できる点にある。
そのため、実際のロボットに作業を覚えさせる際には、人間の映像とは異なる価値を持つ。
XDOFはすでに20社と取引し、その中には複数の大手AI研究機関が含まれるという。2026年9月時点で年間換算売上は5000万ドルに迫り、評価額約12億ドルで新たな資金調達を協議しているとTechCrunchが報じた。TechCrunch
こうした売上規模は、ロボットの操作データが研究材料の域を超え、すでに大きな商材になり始めていることを示している。
データは多ければいいわけではない
もっとも、ロボット学習では単純にデータ量を増やせば性能が上がるわけでもない。
XDOFはTシャツを畳むロボットの実験で、興味深い問題に直面した。
数千件の質の高い作業例で訓練したロボットは、乱れたTシャツを安定して畳めるようになった。そこでさらに多くの成功例を追加したところ、逆に性能が悪化した。
調べると、追加したデータには、作業者がTシャツを持ち直したり、ほとんど意味のない細かな動きを繰り返したりする時間が含まれていた。最終的にはすべてTシャツを畳むことに成功していても、その途中にはロボットに覚えさせたくない動きが混ざっていたのだ。XDOF「Lowering the Noise Floor on Robot Data」
ロボット用データでは、単に「成功した作業」を大量に集めるだけでは足りない。どの動作が成功につながり、どの動作が無駄だったのかを見分ける必要がある。
そのためデータ収集企業の競争では、収集時間の長さだけでなく、不要な動きを取り除き、学習に適したデータへ加工する能力も重要になる。
工場や店舗そのものが「データ生産拠点」に
さらに次の段階では、ロボットを実際の職場に配置し、稼働中に新しいデータを集め続ける仕組みも始まっている。
米ロボット学習データ企業Cortex AIは、工場などの実際の職場でロボットを動かし、人間が遠隔から介入して失敗を立て直した際のデータまで収集している。Cortex AI
ロボットが失敗する。
人間が介入して正しい動作に戻す。
その記録を次の学習に使う。
こうして、ロボットを導入した現場そのものが次のモデルを鍛えるデータ生産拠点になる。
Cortex AIは、企業が自社の職場をロボットデータの収集場所として提供し、報酬を得られる「Cortex Marketplace」も展開している。Y Combinator「Cortex AI」
Human ArchiveやPraxisは人間の仕事を記録し、XDOFはロボット自身の操作データを集め、Cortex AIは実際の稼働現場から継続的にデータを生み出そうとしている。収集方法は異なるが、いずれもこれまで記録されてこなかった現実世界の動きを、AIが学習できる形に変えようとしている。
日本でも実世界データの収集が本格化
日本でも同じ動きが始まっている。
AI Robot Association(AIRoA)は、経済産業省とNEDOの支援を受け、2025年度にロボットを人間が遠隔操作したデータを約8万時間収集した。このうち約5000時間、68種類の作業データを公開している。2026年9月からはToyota Woven Cityを含む35世帯にロボットを置き、家庭内で約7000時間の動作データを集める計画だ。
民間でも、J-HRTIが2026年8月に千葉県で「データファクトリー」を開設し、数十台のヒューマノイドロボットを人間が遠隔操作して学習データを生産する取り組みを始めた。
日本には製造、物流、介護、外食など、人間が手を使って複雑な作業を行う現場が数多くある。これまで、こうした現場の強みは製造技術や熟練技能そのものにあると考えられてきた。しかしフィジカルAIの時代には、そこで日々行われている作業を学習データとして蓄積できることも、新たな競争力になる可能性がある。
大規模言語モデルでは、ウェブ上に蓄積された文章やコードが性能向上を支えた。ロボットAIでは、その役割を担うのが現実世界での人間やロボットの経験だ。誰が多様な現場にアクセスし、そこで生まれる動きを大量に記録し、質の高い学習データへ変えられるか。ロボットAIの競争は、モデルや機体の性能だけでなく、「現実世界のデータ」を確保する競争へ広がり始めている。