

最先端のフィジカルAIラボは使用可能な動画データが枯渇しつつあり、次世代の身体化AIモデルを訓練するためにマルチカメラリグ、高密度な人手アノテーション、実験的な脳波(EEG)計測へと目を向けている――この転換は、フィジカルAIのデータ要件が、今日のほとんどのクリエイターが利用する画像・テキストモデルとはいかに異なるかを如実に示している。
核心的な問題は、TechCrunchが報じているように、視点にある。単一カメラはタスクの一視点しか捉えられない――たとえば洗濯物をたたむ人間の動作――しかしそのタスクを学習するロボットは、三次元空間におけるすべての物体の正確な位置情報とともに、複数の角度から同時にその動作を理解する必要がある。標準的な民生用映像は、高解像度であっても奥行き情報を失ってしまう。ラボは今、単純な家事タスクを記録するためにマルチカメラ撮影リグと深度センサーを導入し、人手のアノテーターに各フレームの物体位置、手のポーズ、動作ラベルを付与させている。
そのアノテーションの負担は膨大だ。研究者たちは、フィジカルAIの訓練に使用できる1時間分のデータを生成するコストは、同等のテキストや画像データの何桁も上だと述べている。参考までに、Charmlooopの画像ジェネレーターのようなプラットフォームのツールを支える拡散モデルは、ウェブからスクレイピングした数十億の画像とテキストのペアで訓練された――法的に争われているとはいえ、少なくとも豊富に存在した供給源だ。フィジカルAIにはそれに相当する大量供給源がない。
より投機的な展開がEEGの統合だ。アイデアはこうだ:人間のデモンストレーターに脳波センサーを装着し、物理的な動作と並行して神経信号を記録する。仮説は、EEGデータが意図をエンコードしているというものだ――手が動く前に人が物体を拾い上げようと決断する瞬間――これによりモデルはモーションキャプチャ単独よりも豊かなシグナルを得られる。複数のラボが小規模なパイロットを実施しているが、EEGデータで大規模に訓練された最先端モデルはまだ存在しない。この技術は、プロダクションパイプラインというよりも研究上の興味に近い段階にある。
注目に値するのはアノテーションの観点だ。フィジカルAIトレーニングにおける根強い問題のひとつが曖昧さだ:人間がタスクの途中で一時停止したとき、それは物体が扱いにくかったからなのか、気が変わったからなのか、それとも気が散ったからなのか?カメラ映像ではその答えが出ない。脳波データは、理論上、それを解決できる。EEGアノテーションの信頼性が証明されれば、有能なフィジカルモデルを訓練するために必要な映像量を劇的に削減できる可能性がある――データの1秒1秒がより多くのシグナルを持つからだ。
今日、画像・動画生成に取り組むクリエイターにとって、直接的な実用的影響は間接的ではあるが確かに存在する。フィジカルAI向けに構築されているアノテーションパイプライン――視覚データに付与された高密度で構造化された意味論的に豊かなラベル――は、生成動画モデルが因果関係や物理法則の理解を深めるために必要な、まさに同種の構造化データだ。豊富にアノテーションされた現実世界の映像で訓練されたモデルは、より一貫した動き、より自然な物体のインタラクション、そしてAI動画を今も悩ませる手足が浮遊するようなアーティファクトの減少をもたらす傾向がある。
今日フィジカルAIラボで洗練されている技術は、数年以内に生成モデルのトレーニングへと移行してきた実績がある。リアルな動きと空間的一貫性のためのプロンプティングガイドを参照するクリエイターは、ロボットデータセットに直接触れることなく、そのアップストリームの成果から恩恵を受けることになるだろう。
データのボトルネックはまた、AIの能力における容易な向上――豊富なウェブデータに対してコンピュートをスケールすること――が無限ではないことを改めて示している。フィジカルAIがその壁に最初にぶつかっているが、生成画像・動画モデルもそう遠くない。今、新たなデータ収集に投資しているラボは、それがどこに着地しようとも、次の能力の飛躍に向けて布石を打っている。