Vision-Language-Action(VLA)モデルとは、視覚認識・自然言語理解・ロボットの行動生成を単一の枠組みに統合したマルチモーダルAIシステムである。カメラなどからの視覚入力と自然言語による指示を受け取り、それを解釈したうえでロボットの低レベルなモーターコマンドを直接出力する。Physical Intelligenceのπ0やOpenVLAなどが代表的な実装例である。
ロボット向け基盤モデルの技術的な定義を知りたい開発者・研究者向け。
従来の個別プログラムによる動作指定と異なり、視覚と言語から動作を直接生成する統合的なアプローチである点。