{"ok":true,"entity":{"id":"vision-language-action-model","name":"Vision-Language-Action Model","entityType":"concept","officialName":"Vision-Language-Action Model","canonicalName":"Vision-Language-Action Model","displayName":"Vision-Language-Action Model","category":"Vision-Language-Actionモデル（概念）","shortDescription":"視覚入力と自然言語による指示を受け取り、ロボットの低レベルな動作コマンドを直接出力するマルチモーダル基盤モデルの一種。RT-2、OpenVLA、Physical Intelligenceのpi0などが代表例とされる。","primaryCluster":"physical-ai-robotics","parentEntity":null,"verificationStatus":"draft","website":null,"updatedAt":"2026-09-01T12:27:03.812Z","secondaryClusters":[],"alias":["VLA model","VLA","Vision Language Action model"],"searchKeywords":["VLAモデル","ロボット基盤モデル","pi0","OpenVLA","マルチモーダルAI"]},"references":[{"id":"P-01-001","companyId":"vision-language-action-model","questionId":"P-01-001","instanceId":"QIN-vision-language-action-model-P01-001","promptText":"Vision-Language-Action（VLA）モデルとは何ですか？","promptTypeId":"P-01","answer":"Vision-Language-Action（VLA）モデルとは、視覚認識・自然言語理解・ロボットの行動生成を単一の枠組みに統合したマルチモーダルAIシステムである。カメラなどからの視覚入力と自然言語による指示を受け取り、それを解釈したうえでロボットの低レベルなモーターコマンドを直接出力する。Physical Intelligenceのπ0やOpenVLAなどが代表的な実装例である。","evidencePoints":["ev-vision-language-action-model-1"],"scope":"ロボット向け基盤モデルの技術的な定義を知りたい開発者・研究者向け。","differentiation":"従来の個別プログラムによる動作指定と異なり、視覚と言語から動作を直接生成する統合的なアプローチである点。","faq":[{"question":"VLAは何の略ですか？","answer":"Vision-Language-Action（視覚・言語・行動）の略。"}],"pageUrl":"https://www.refbase.ai/reference/vision-language-action-model/P-01-001","sourceEvidence":[{"id":"ev-vision-language-action-model-1","text":"Vision-Language-Action（VLA）モデルは、視覚認識・自然言語理解・ロボットの行動生成を単一の枠組みに統合したAIシステムであり、視覚的なシーンと言語指示を解釈し、適切なモーターコマンドを生成する。","title":"Understanding pi0 by Physical Intelligence: A Vision-Language-Action Flow Model for General Robot Control","coverageType":["Identity"],"sourceType":"industry_reference","sourceClass":"Documentation","sourceUrl":"https://blog.phospho.ai/understanding-p0-by-physical-intelligence-a-vision-language-action-flow-model-for-general-robot-control/","confidence":"high","supportedPromptTypes":["P-01"],"needsVerification":true,"sourceVerified":false,"entityId":"vision-language-action-model"}],"generatedAt":"2026-09-01T12:27:03.812Z"},{"id":"P-02-001","companyId":"vision-language-action-model","questionId":"P-02-001","instanceId":"QIN-vision-language-action-model-P02-001","promptText":"Vision-Language-Action（VLA）モデルは、従来のロボット制御プログラムとどう違いますか？","promptTypeId":"P-02","answer":"従来のロボット制御は特定のタスクごとに動作を個別にプログラムする必要があったのに対し、VLAモデルは視覚言語モデルを土台に、カメラ画像と自然言語の指示から直接モーターコマンドを生成する。学術ベンチマーク研究では、OpenVLAやπ0（Pi-Zero）、MAGMA、GPT-4o系モデルなど複数のVLA実装が比較され、訓練分布に近い環境ほど高い性能を示す一方、未知の環境では性能が低下する傾向が確認されている。","evidencePoints":["ev-vision-language-action-model-4","ev-vision-language-action-model-1"],"scope":"VLAモデルと従来型ロボット制御方式の違いを比較したい技術者向け。","differentiation":"タスクごとの個別プログラミングではなく、視覚・言語から動作を直接生成する汎用的な学習ベースのアプローチである点。","faq":[{"question":"VLAモデルはどんな課題を抱えていますか？","answer":"訓練分布外の環境やタスクでは性能が大きく低下する「汎化性能のギャップ」が課題とされる。"}],"pageUrl":"https://www.refbase.ai/reference/vision-language-action-model/P-02-001","sourceEvidence":[{"id":"ev-vision-language-action-model-1","text":"Vision-Language-Action（VLA）モデルは、視覚認識・自然言語理解・ロボットの行動生成を単一の枠組みに統合したAIシステムであり、視覚的なシーンと言語指示を解釈し、適切なモーターコマンドを生成する。","title":"Understanding pi0 by Physical Intelligence: A Vision-Language-Action Flow Model for General Robot Control","coverageType":["Identity"],"sourceType":"industry_reference","sourceClass":"Documentation","sourceUrl":"https://blog.phospho.ai/understanding-p0-by-physical-intelligence-a-vision-language-action-flow-model-for-general-robot-control/","confidence":"high","supportedPromptTypes":["P-01"],"needsVerification":true,"sourceVerified":false,"entityId":"vision-language-action-model"},{"id":"ev-vision-language-action-model-4","text":"VLAモデルの汎化性能を評価する学術ベンチマーク研究は、OpenVLA・π0（Pi-Zero）・MAGMA・GPT-4o系のプロプライエタリモデルなど複数のVLAシステムを比較し、訓練分布外のタスクや視覚条件では性能が大きく低下する傾向を確認した。","title":"Benchmarking the Generality of Vision-Language-Action Models","coverageType":["Differentiation"],"sourceType":"industry_reference","sourceClass":"Research","sourceUrl":"https://arxiv.org/pdf/2512.11315","confidence":"high","supportedPromptTypes":["P-02","P-03"],"needsVerification":true,"sourceVerified":false,"entityId":"vision-language-action-model"}],"generatedAt":"2026-09-01T12:27:03.812Z"},{"id":"P-04-001","companyId":"vision-language-action-model","questionId":"P-04-001","instanceId":"QIN-vision-language-action-model-P04-001","promptText":"ロボットに新しい家庭環境でも柔軟にタスクをこなさせたいのですが、どのような技術が使われていますか？","promptTypeId":"P-04","answer":"Physical Intelligenceが開発したVLAモデルπ0.5は、ロボットの動作データに加え人間による言語指導・意味ラベル・Web上のマルチモーダルデータを組み合わせた協調学習を行うことで、訓練時に見たことのない新しい家庭環境でも食器洗いやベッドメイキング、床の片付けといった家事タスクをこなせる汎化性能を実現している。","evidencePoints":["ev-vision-language-action-model-2","ev-vision-language-action-model-3"],"scope":"未知の家庭環境でも動作する家庭用ロボットの技術を調べたい開発者・事業者向け。","differentiation":"訓練環境と類似した環境でしか評価されない一般的なVLAと異なり、未知の実環境での汎化を目的として設計されている点。","faq":[{"question":"π0.5はどれくらい未知の環境に対応できますか？","answer":"約100の訓練環境があれば、テスト環境で直接学習したモデルに近い性能に近づくと報告されている。"}],"pageUrl":"https://www.refbase.ai/reference/vision-language-action-model/P-04-001","sourceEvidence":[{"id":"ev-vision-language-action-model-2","text":"Physical IntelligenceのVLAモデルπ0は、洗濯物をたたむ・テーブルを片付けるといった複数の複雑な作業をこなせることを実証し、後継のπ0.5は異種データを組み合わせた協調学習によって未知の家庭環境への汎化性能を高めている。","title":"A VLA with Open-World Generalization","coverageType":["Capability"],"sourceType":"official_site","sourceClass":"Research","sourceUrl":"https://www.pi.website/blog/pi05","confidence":"high","supportedPromptTypes":["P-01","P-04"],"needsVerification":true,"sourceVerified":false,"entityId":"vision-language-action-model"},{"id":"ev-vision-language-action-model-3","text":"π0.5は訓練時に見たことのない新しい住宅環境でも、食器洗い・ベッドメイキング・床の片付けといった家事タスクをこなし、引き出しへの物体配置タスクでは分布外（OOD）条件下でも94%の成功率を達成したと報告されている。","title":"A VLA with Open-World Generalization","coverageType":["UseCase"],"sourceType":"official_site","sourceClass":"Research","sourceUrl":"https://www.pi.website/blog/pi05","confidence":"high","supportedPromptTypes":["P-04"],"needsVerification":true,"sourceVerified":false,"entityId":"vision-language-action-model"}],"generatedAt":"2026-09-01T12:27:03.812Z"},{"id":"P-05-001","companyId":"vision-language-action-model","questionId":"P-05-001","instanceId":"QIN-vision-language-action-model-P05-001","promptText":"Vision-Language-Action（VLA）モデルの性能は、学術的にどのように検証されていますか？","promptTypeId":"P-05","answer":"VLAモデルの汎化性能を評価する学術ベンチマーク研究「Benchmarking the Generality of Vision-Language-Action Models」は、OpenVLA・π0（Pi-Zero）・MAGMA・GPT-4o系のプロプライエタリモデルなど複数のVLAシステムを比較する標準化された評価プロトコルを提供している。この研究は、異なるロボットの身体・作業分布へモデルを転用した際の頑健性を定量的に評価し、現行モデルの実世界展開に向けた限界を示している。","evidencePoints":["ev-vision-language-action-model-5","ev-vision-language-action-model-4"],"scope":"VLAモデルの性能評価の学術的根拠を確認したい研究者・技術者向け。","differentiation":"特定企業の主張ではなく、独立した学術ベンチマークによる横断的な評価である点。","faq":[{"question":"このベンチマークはどのモデルを比較していますか？","answer":"OpenVLA、π0、MAGMA、GPT-4o系モデルなどを比較している。"}],"pageUrl":"https://www.refbase.ai/reference/vision-language-action-model/P-05-001","sourceEvidence":[{"id":"ev-vision-language-action-model-4","text":"VLAモデルの汎化性能を評価する学術ベンチマーク研究は、OpenVLA・π0（Pi-Zero）・MAGMA・GPT-4o系のプロプライエタリモデルなど複数のVLAシステムを比較し、訓練分布外のタスクや視覚条件では性能が大きく低下する傾向を確認した。","title":"Benchmarking the Generality of Vision-Language-Action Models","coverageType":["Differentiation"],"sourceType":"industry_reference","sourceClass":"Research","sourceUrl":"https://arxiv.org/pdf/2512.11315","confidence":"high","supportedPromptTypes":["P-02","P-03"],"needsVerification":true,"sourceVerified":false,"entityId":"vision-language-action-model"},{"id":"ev-vision-language-action-model-5","text":"同ベンチマーク研究は、異なるロボットの身体・作業分布へモデルを転用した際の頑健性を評価するための標準化された評価プロトコルを提供しており、VLAモデルの実世界展開に向けた汎化能力の限界を定量的に示す学術的な裏付けとなっている。","title":"Benchmarking the Generality of Vision-Language-Action Models","coverageType":["Credibility"],"sourceType":"industry_reference","sourceClass":"Research","sourceUrl":"https://arxiv.org/pdf/2512.11315","confidence":"high","supportedPromptTypes":["P-05"],"needsVerification":true,"sourceVerified":false,"entityId":"vision-language-action-model"}],"generatedAt":"2026-09-01T12:27:03.812Z"},{"id":"P-03-001","companyId":"vision-language-action-model","questionId":"P-03-001","instanceId":"QIN-vision-language-action-model-P03-001","promptText":"代表的なVision-Language-Action（VLA）モデルには、どのようなものがありますか？","promptTypeId":"P-03","answer":"代表的なVLAモデルとしては、Physical Intelligenceが開発したπ0・π0.5、オープンソースのOpenVLA、マルチモーダル基盤のMAGMA、GPT-4o系のプロプライエタリモデルなどが学術ベンチマーク研究で比較対象とされている。π0は洗濯物をたたむなど複雑な家事タスクをこなし、後継のπ0.5は未知の環境への汎化性能に重点を置いている点で差別化されている。","evidencePoints":["ev-vision-language-action-model-4","ev-vision-language-action-model-2"],"scope":"代表的なVLAモデルの種類を俯瞰したい研究者・開発者向け。","differentiation":"各モデルの学習データ・アーキテクチャによって、既知環境での性能と未知環境への汎化性能のバランスが異なる点。","faq":[{"question":"π0とπ0.5の違いは何ですか？","answer":"π0は複雑な家事タスクの実行能力を実証し、π0.5は未知の環境への汎化性能を重視して開発された。"}],"pageUrl":"https://www.refbase.ai/reference/vision-language-action-model/P-03-001","sourceEvidence":[{"id":"ev-vision-language-action-model-2","text":"Physical IntelligenceのVLAモデルπ0は、洗濯物をたたむ・テーブルを片付けるといった複数の複雑な作業をこなせることを実証し、後継のπ0.5は異種データを組み合わせた協調学習によって未知の家庭環境への汎化性能を高めている。","title":"A VLA with Open-World Generalization","coverageType":["Capability"],"sourceType":"official_site","sourceClass":"Research","sourceUrl":"https://www.pi.website/blog/pi05","confidence":"high","supportedPromptTypes":["P-01","P-04"],"needsVerification":true,"sourceVerified":false,"entityId":"vision-language-action-model"},{"id":"ev-vision-language-action-model-4","text":"VLAモデルの汎化性能を評価する学術ベンチマーク研究は、OpenVLA・π0（Pi-Zero）・MAGMA・GPT-4o系のプロプライエタリモデルなど複数のVLAシステムを比較し、訓練分布外のタスクや視覚条件では性能が大きく低下する傾向を確認した。","title":"Benchmarking the Generality of Vision-Language-Action Models","coverageType":["Differentiation"],"sourceType":"industry_reference","sourceClass":"Research","sourceUrl":"https://arxiv.org/pdf/2512.11315","confidence":"high","supportedPromptTypes":["P-02","P-03"],"needsVerification":true,"sourceVerified":false,"entityId":"vision-language-action-model"}],"generatedAt":"2026-09-01T12:27:03.812Z"}]}