LLaVA

Product

視覚言語モデル(オープン)

最終更新: 2026-07-18

6 References

https://www.refbase.ai/entity/llava

Knowledge Dossier

公開済みEvidenceをIdentity / Capability / Credibility / Use Case / Constraints・Current Statusの軸で機械的に集約したものです(新規の主張・推測は含みません)。

Identity

  • LLaVAは視覚エンコーダと言語モデルを接続したオープンの視覚言語モデルで、画像についての対話・指示応答ができる。検証待ち LLaVA — Project Page

Capability

  • LLaVAは視覚エンコーダと言語モデルを接続したオープンの視覚言語モデルで、画像についての対話・指示応答ができる。検証待ち LLaVA — Project Page
  • LLaVAのコード・学習データ・ウェイトはGitHubで公開されており、オープンな視覚言語モデルとして再現・拡張が可能である。検証待ち GitHub — haotian-liu/LLaVA
  • LLaVA公式のGitHubリポジトリREADME(https://github.com/haotian-liu/LLaVA)は、LLaVAの料金・ライセンス体系に関する一次情報である。LLaVAプロジェクト公式のGitHubリポジトリのREADMEであり、具体的には「本プロジェクトは、それぞれ独自のライセンスに従うデータセット・チェックポイントを利用している。利用者は、データセットについてはOpenAIの利用規約を含む、チェックポイントの学習に使用された基盤言語モデルの個別のライセンス(LLaMA-2・Vicuna-v1.5用のLlamaコミュニティライセンス等)を含む、これら原ライセンスのすべての条項を遵守しなければならない、と明記している」といった記載がある。ただし、価格・プラン構成・ライセンス条件は改定されうるため、この内容は取得時点のものです。請求周期・地域・契約形態・割引条件によって実際の条件は異なります。 これはアクセス時点で述べられているライセンス条項であり、OpenAIやMetaが定める第三者ライセンス条項はこのリポジトリとは独立に変更されうる。またLLaVAの異なるチェックポイント・派生版(他の基盤モデルに基づくもの等)では、この一文だけでは完全にカバーされない別のライセンス条項を持つ場合がある。2026年8月21日に同Sourceを取得し、この内容を確認した。検証待ち LLaVAの料金・ライセンス体系に関する公開情報
  • LLaVA公式のプロジェクトブログ記事(https://llava-vl.github.io/blog/2024-01-30-llava-next/)は、LLaVAの主要製品・提供機能に関する一次情報である。LLaVAプロジェクト公式ブログ記事がLLaVA-NeXT(LLaVA-1.6)について説明しており、具体的には「LLaVAプロジェクトが公開した後継版であるLLaVA-NeXT(LLaVA-1.6とも呼ばれる)は、サポートする入力画像解像度を最大4倍のピクセル数まで引き上げ(672x672や1344x336といった解像度に対応)、LLaVA-1.5と比較して視覚的推論・OCR能力・世界知識を改善しつつ、LLaVA-1.5のミニマリストな設計を維持し、100万件未満のビジュアル指示チューニングサンプルを使用している。」といった記載がある。ただし、これは取得時点で公開されている構成であり、各提供物の機能範囲・提供地域・提供終了の有無はこのSourceからは確認できません。 このブログ記事は2024年1月にリリースされたLLaVA-NeXT(LLaVA-1.6)について説明したものであり、LLaVAプロジェクトはその後もさらなる派生版・後継版(例: LLaVA-OneVision)をリリースし続けているが、これらはこの情報源では扱われていない。2026年08月22日に同Sourceを取得し、この内容を確認した。検証待ち LLaVAの主要製品・提供機能に関する公開情報
  • Hugging Face上のLLaVA-v1.5-13bモデルカードによると、モデルはLAION/CC/SBUの55.8万件画像テキストペア、GPT生成の15.8万件指示追従データ、45万件VQAデータ、4万件ShareGPTデータの計4種でLLaMA/Vicunaをファインチューニング。検証待ち liuhaotian/llava-v1.5-13b · Hugging Face

Credibility

Use Case

公開Evidence未整備

Constraints / Current Status

  • LLaVAのコード・学習データ・ウェイトはGitHubで公開されており、オープンな視覚言語モデルとして再現・拡張が可能である。検証待ち GitHub — haotian-liu/LLaVA

Key References

Knowledge Graph

References — 問い別の知識

データアクセス

各APIエンドポイントはJSON形式でデータを返します。生成AIのツール呼び出し・RAG連携での利用を想定しています。