1. トップ
  2. トレンド
  3. AIを鍛える会社が巨大市場に YC投資先で年商1000万ドル超が12社

AIを鍛える会社が巨大市場に YC投資先で年商1000万ドル超が12社

AIを鍛える会社が巨大市場に YC投資先で年商1000万ドル超が12社

AIモデルそのものを開発する企業の周辺で、「AIを鍛えるための環境」を提供するスタートアップが急成長している。

米スタートアップ支援大手Y Combinator(YC)は2026年9月17日に公開した動画で、過去2年間に支援した企業のうち、AI大手にデータや強化学習(RL)用の環境を提供し、年間売上1000万ドルを超えた企業が12社以上あると明らかにした。一部は年間数億ドル規模に達しているという。

これまでAIモデルを鍛える企業の主な仕事は、学習用の文章や画像、専門家による回答などを集め、AIが利用できる形に整えることだった。しかしAIが質問に答えるだけでなく、ソフトウェアを操作し、複数の手順を踏んで仕事を進めるようになると、正解例を与えるだけでは不十分。実際に作業させ、途中の判断や失敗、やり直しまで経験させる必要が出てくる。

そこで需要が急速に伸びているのが、AIに実際の仕事を経験させるRL環境だ。

「正解データ」から「仕事をする環境」へ

RL環境では、AIを実際の仕事に近い仮想環境に入れ、作業をさせる。AIが操作すると環境の状態が変化し、その結果が成功だったのか失敗だったのかを採点する。AIは試行錯誤を繰り返しながら、よりよい仕事の進め方を学習していく。

例えばコーディングAIなら、実際の開発環境を用意し、ファイルを調べ、コードを書き、エラーを修正してテストまで実行させる。作業が終わると、テストの通過率などをもとに結果を採点し、その評価を報酬としてモデルに返す。AIはこの一連の作業を何度も繰り返し、より高い評価を得られる手順を学んでいく。こうした『仕事を実行でき、結果を採点できる場』がRL環境だ。

こうした市場で急成長しているのが、米AI学習データ企業AfterQueryだ。

同社は2025年創業で、2026年4月には年間換算売上が1億ドルを超えたと発表した。主要AI大手に、金融、ソフトウェア開発、企業業務などの学習データとRL環境を提供しているという。

同社が公開したコーディングAIの訓練実験を見ると、RL環境が何をするものなのかが分かりやすい。

AIに与えられるのは、正解のコードではなく、実際に操作できるコンピューター環境と課題だ。課題ごとに新しいDocker環境を立ち上げ、AIはターミナルを使ってファイルを調べ、必要なソフトウェアを導入し、コードを書き、エラーを修正する。作業が終わるとテストを実行し、その結果を数値で採点する。

例えば10項目のテストのうち7項目を通過すれば、正答率に応じた報酬が与えられる。AIは同じ種類の課題に何度も挑戦し、成功した手順と失敗した手順の差から、より高い報酬を得られる行動を学習する。つまりRL環境には、「仕事をする場所」だけでなく、「結果を自動的に採点する仕組み」まで必要になる。

AfterQueryはこの環境を使い、米OpenAIのオープンウェイトモデル「gpt-oss-20b」を追加学習した。まず専門家による優れた作業例を学ばせる教師あり追加学習で、Terminal-Bench 2.0の成功率を3.1%から13.5%に高めた。そのうえで、AI自身に課題を繰り返し実行させる強化学習を行い、17.0%まで引き上げたという。

この結果で重要なのは、17%という数字そのものではない。専門家の作業例を覚えさせるだけで終わらず、その後にAI自身が実際の環境で試行錯誤することで、さらに性能を伸ばせた点だ。

ソフトウェア会社そのものを再現

RL環境は、さらに長い仕事を再現する方向へ進んでいる。

米AI学習環境開発Polymathは、AIエージェントに数日単位の仕事を学習・評価させるためのシミュレーション環境を開発している。YCによると、現在のRL環境の多くは数分程度で終わる限定的な作業を対象としているが、同社は人間なら数日かかる仕事まで再現することを目指している。

同社が公開した「Horizon-SWE」では、コンテナの中にソフトウェア会社の仕事場を丸ごと作った。

中には実際に動くWebアプリがあり、フロントエンド、バックエンド、データベース、キャッシュなどが接続されている。さらにチケット管理、社内メッセージ、ナレッジベース、ログ、監視、CI/CDなど、エンジニアが実務で使う73種類のツールも用意した。システムには疑似的な利用者からアクセスが入り、データや監視指標も時間とともに変化する。

AIに与えられる仕事も、単なるプログラミング問題ではない。

例えば、複数のサービスにまたがる新機能を実装し、正しい順序で本番環境へ投入する。障害が発生すればログや監視システムを調べ、原因を突き止めて修正する。作った機能が正常に動くだけでなく、配備に失敗して警報を発生させていないかまで確認される。

Horizon-SWEにはこうした仕事が50種類用意されている。2026年2月の評価では、最も高い成績だったClaude Opus 4.6でも、一連の仕事を完全に終えられた割合は25.5%だった。

コードを書く能力が高くても、必要な情報を探し、複数のツールを使い、順序を考えながら作業し、途中で状況が変われば対応する、などの能力がなければ使い物にならない。

Polymathは、こうした能力を鍛えるために、実際の仕事に近い環境で長時間の作業を経験させるRL環境を開発している。

「練習場」を作るための基盤も登場

企業や研究者がRL環境を作るための基盤も登場している。

米AI学習基盤企業HUD(Human Union Data)は、RL環境を構築し、AIに大量の課題を実行させ、その結果を記録して学習に利用するためのプラットフォームを提供している。

HUDによると、同社の基盤上では2500以上のRL環境が作られ、これまでに130万件以上のタスクが実行された。50社以上がHUDを使い、自社のRL環境を構築したり、AI大手に提供したり、自社モデルの訓練に利用したりしているという。同社は2026年6月に1600万ドルを調達した。(hud.ai)

HUD自身も、企業の実務を再現したRL環境を開発している。

2026年1月に公開した例では、ソフトウェアの本番障害を調査する仕事を再現した。AIはエラー監視サービスのSentryを確認し、データベースのSupabase、クラウドサービスのRailway、Kubernetesなどを調べる。必要に応じてGitHubのコードや社内文書も参照し、障害の原因を特定する。(hud.ai)

訓練には、HUDの実際のシステムで発生した24件の障害を使った。それぞれの課題には、「エラーの原因となったIDを特定する」といった判定可能な正解を設定する。AIが作業を終えると、正しい原因にたどり着いたかを自動で採点する。

AIはこうした課題に繰り返し挑戦する。どのツールを使い、何を調べ、最終的にどの回答に到達したかが記録され、その結果を使ってモデルを追加学習する。

HUDはこの方法で米OpenAIのo4-miniを訓練したところ、難しい障害調査での成功率が6.3%から13%に上昇したとしている。(hud.ai)

ここで重要になるのが、RL環境を作るための作業そのものだ。

企業ごとにAIに任せたい仕事は違う。ソフトウェア会社なら障害対応、金融会社なら企業分析や表計算といった具合に、実際の業務をAIが操作できる環境として再現し、課題を作り、結果を自動で採点できるようにしなければならない。

HUDは、この一連の作業を共通の基盤上で行えるようにしている。さらに、そこで作ったRL環境をAI研究機関などに提供する仕組みも用意している。

AfterQueryのようにRL環境そのものを作って提供する企業が成長する一方で、HUDのように、そのRL環境を作るための基盤を提供する企業も現れた。AIを鍛える市場の中で、役割の異なる事業が生まれ始めている。

出典

著者
湯川鶴章

AI新聞 編集長

AI新聞編集長。米カリフォルニア州立大学サンフランシスコ校経済学部卒業。サンフランシスコの地元紙記者を経て、時事通信社米国法人に入社。シリコンバレーの黎明期から米国のハイテク産業を中心に取材を続ける。通算20年間の米国生活を終え2000年5月に帰国。時事通信編集委員を経て2010年独立。2017年12月から現職。主な著書に『生成AIで心が折れた』(2025年)、『人工知能、ロボット、人の心。』(2015年)、『次世代マーケティングプラットフォーム』(2007年)、『ネットは新聞を殺すのか』(2003年)などがある。趣味はヨガと瞑想。妻が美人なのが自慢。