Vision-Language-Action Model

Concept

Vision-Language-Actionモデル(概念)

最終更新: 2026-09-01

5 References

https://www.refbase.ai/entity/vision-language-action-model

Knowledge Dossier

公開済みEvidenceをIdentity / Capability / Credibility / Use Case / Constraints・Current Statusの軸で機械的に集約したものです(新規の主張・推測は含みません)。

Identity

Capability

  • Physical IntelligenceのVLAモデルπ0は、洗濯物をたたむ・テーブルを片付けるといった複数の複雑な作業をこなせることを実証し、後継のπ0.5は異種データを組み合わせた協調学習によって未知の家庭環境への汎化性能を高めている。検証待ち A VLA with Open-World Generalization

Credibility

  • 同ベンチマーク研究は、異なるロボットの身体・作業分布へモデルを転用した際の頑健性を評価するための標準化された評価プロトコルを提供しており、VLAモデルの実世界展開に向けた汎化能力の限界を定量的に示す学術的な裏付けとなっている。検証待ち Benchmarking the Generality of Vision-Language-Action Models

Use Case

  • π0.5は訓練時に見たことのない新しい住宅環境でも、食器洗い・ベッドメイキング・床の片付けといった家事タスクをこなし、引き出しへの物体配置タスクでは分布外(OOD)条件下でも94%の成功率を達成したと報告されている。検証待ち A VLA with Open-World Generalization

Constraints / Current Status

  • VLAモデルの汎化性能を評価する学術ベンチマーク研究は、OpenVLA・π0(Pi-Zero)・MAGMA・GPT-4o系のプロプライエタリモデルなど複数のVLAシステムを比較し、訓練分布外のタスクや視覚条件では性能が大きく低下する傾向を確認した。検証待ち Benchmarking the Generality of Vision-Language-Action Models

Key References

References — 問い別の知識

データアクセス

各APIエンドポイントはJSON形式でデータを返します。生成AIのツール呼び出し・RAG連携での利用を想定しています。