Physical Intelligenceのπ0は30〜50億パラメータのTransformerを用いたVision-Language-Action(VLA)モデルです。任意のロボットのRGB-D映像と動作履歴をトークン化して入力し、約100ミリ秒という短い時間で次の50ステップ分の動作を予測し、安全制約を守りながらロボット固有の指令へ変換します。2025年2月にはπ0-FASTとともにオープンソース化されました。
ロボット基盤モデルの内部アーキテクチャや技術的な差別化要因を知りたい開発者・研究者向け。
推論速度(約100ミリ秒)と複数ロボット種別への汎化性能を両立させている点。