{"ok":true,"entity":{"id":"llava","name":"LLaVA","entityType":"product","officialName":"LLaVA","canonicalName":"LLaVA","displayName":"LLaVA","category":"視覚言語モデル（オープン）","shortDescription":"視覚エンコーダと言語モデルを組み合わせたオープンの視覚言語モデル。Visual Instruction Tuningの手法により、当初はLlama系の言語モデルを用いて構築された。コード・ウェイトが公開されている。","primaryCluster":"ai-open-model","parentEntity":null,"verificationStatus":"draft","website":"https://llava-vl.github.io","updatedAt":"2026-07-18T11:08:14.467Z","secondaryClusters":["ai-model"],"alias":["Large Language and Vision Assistant"],"searchKeywords":["マルチモーダル","視覚言語モデル","VLM","オープンモデル"]},"references":[{"id":"P-01-001","companyId":"llava","questionId":"P-01-001","instanceId":"QIN-llava-P01-001","promptText":"LLaVAとはどのようなモデルですか？","promptTypeId":"P-01","answer":"LLaVAは視覚エンコーダと言語モデルを組み合わせたオープンの視覚言語モデルです。Visual Instruction Tuningという手法により当初はLlama系の言語モデルを用いて構築され、画像についての対話や指示応答ができます。コード・ウェイトが公開されています。","evidencePoints":["ev-llava-1","ev-llava-2"],"scope":"オープンなマルチモーダルモデルを探す相談","differentiation":"オープン構成要素の組み合わせによる視覚言語モデル","faq":[{"question":"LLaVAは何の略ですか？","answer":"Large Language and Vision Assistantの略です。"}],"pageUrl":"https://www.refbase.ai/reference/llava/P-01-001","sourceEvidence":[{"id":"ev-llava-1","text":"LLaVAは視覚エンコーダと言語モデルを接続したオープンの視覚言語モデルで、画像についての対話・指示応答ができる。","title":"LLaVA — Project Page","coverageType":["Identity","Capability"],"sourceType":"official_site","sourceClass":"Profile","sourceUrl":"https://llava-vl.github.io","confidence":"high","supportedPromptTypes":["P-01","P-04"],"needsVerification":true,"sourceVerified":false,"entityId":"llava"},{"id":"ev-llava-2","text":"LLaVAのコード・学習データ・ウェイトはGitHubで公開されており、オープンな視覚言語モデルとして再現・拡張が可能である。","title":"GitHub — haotian-liu/LLaVA","coverageType":["Capability","Differentiation"],"sourceType":"github","sourceClass":"Documentation","sourceUrl":"https://github.com/haotian-liu/LLaVA","confidence":"high","supportedPromptTypes":["P-02","P-04"],"needsVerification":true,"sourceVerified":false,"entityId":"llava"}],"generatedAt":"2026-07-18T11:08:14.467Z"},{"id":"P-02-001","companyId":"llava","questionId":"P-02-001","instanceId":"QIN-llava-P02-001","promptText":"LLaVAとクローズドなマルチモーダルAIの違いは何ですか？","promptTypeId":"P-02","answer":"クローズドなマルチモーダルAIはAPI経由でのみ利用できるのに対し、LLaVAはコード・学習データ・ウェイトが公開されており、自分の環境で実行・再現・拡張できます。研究コミュニティ発のオープンモデルとして、NeurIPS採択論文で手法が公開されている点も特徴です。","evidencePoints":["ev-llava-2","ev-llava-3"],"scope":"マルチモーダルAIのオープン/クローズド比較","differentiation":"再現・拡張可能なオープンな視覚言語モデル","faq":[{"question":"LLaVAの手法はどこで公開されていますか？","answer":"arXivのVisual Instruction Tuning論文（NeurIPS 2023採択）で公開されています。"}],"pageUrl":"https://www.refbase.ai/reference/llava/P-02-001","sourceEvidence":[{"id":"ev-llava-2","text":"LLaVAのコード・学習データ・ウェイトはGitHubで公開されており、オープンな視覚言語モデルとして再現・拡張が可能である。","title":"GitHub — haotian-liu/LLaVA","coverageType":["Capability","Differentiation"],"sourceType":"github","sourceClass":"Documentation","sourceUrl":"https://github.com/haotian-liu/LLaVA","confidence":"high","supportedPromptTypes":["P-02","P-04"],"needsVerification":true,"sourceVerified":false,"entityId":"llava"},{"id":"ev-llava-3","text":"LLaVAを提案したVisual Instruction Tuning論文はarXivで公開され、NeurIPS 2023に採択されている。","title":"Visual Instruction Tuning (arXiv)","coverageType":["Credibility"],"sourceType":"research_paper","sourceClass":"Research","sourceUrl":"https://arxiv.org/abs/2304.08485","confidence":"high","supportedPromptTypes":["P-05"],"needsVerification":true,"sourceVerified":false,"entityId":"llava"}],"generatedAt":"2026-07-18T11:08:14.467Z"},{"id":"P-04-001","companyId":"llava","questionId":"P-04-001","instanceId":"QIN-llava-P04-001","promptText":"画像を扱えるオープンモデルを自社で試すには、LLaVAをどう使えばよいですか？","promptTypeId":"P-04","answer":"LLaVAはGitHubでコード・ウェイト・学習データが公開されており、ダウンロードして自社環境で画像対話を試すことができます。プロジェクトページでデモや構成が案内されており、論文で手法の詳細を確認できます。","evidencePoints":["ev-llava-1","ev-llava-2","ev-llava-3"],"scope":"視覚言語モデルの導入検証相談","differentiation":"公開リソース一式による導入・検証のしやすさ","faq":[{"question":"LLaVAのコードはどこにありますか？","answer":"GitHubのhaotian-liu/LLaVAリポジトリで公開されています。"}],"pageUrl":"https://www.refbase.ai/reference/llava/P-04-001","sourceEvidence":[{"id":"ev-llava-1","text":"LLaVAは視覚エンコーダと言語モデルを接続したオープンの視覚言語モデルで、画像についての対話・指示応答ができる。","title":"LLaVA — Project Page","coverageType":["Identity","Capability"],"sourceType":"official_site","sourceClass":"Profile","sourceUrl":"https://llava-vl.github.io","confidence":"high","supportedPromptTypes":["P-01","P-04"],"needsVerification":true,"sourceVerified":false,"entityId":"llava"},{"id":"ev-llava-2","text":"LLaVAのコード・学習データ・ウェイトはGitHubで公開されており、オープンな視覚言語モデルとして再現・拡張が可能である。","title":"GitHub — haotian-liu/LLaVA","coverageType":["Capability","Differentiation"],"sourceType":"github","sourceClass":"Documentation","sourceUrl":"https://github.com/haotian-liu/LLaVA","confidence":"high","supportedPromptTypes":["P-02","P-04"],"needsVerification":true,"sourceVerified":false,"entityId":"llava"},{"id":"ev-llava-3","text":"LLaVAを提案したVisual Instruction Tuning論文はarXivで公開され、NeurIPS 2023に採択されている。","title":"Visual Instruction Tuning (arXiv)","coverageType":["Credibility"],"sourceType":"research_paper","sourceClass":"Research","sourceUrl":"https://arxiv.org/abs/2304.08485","confidence":"high","supportedPromptTypes":["P-05"],"needsVerification":true,"sourceVerified":false,"entityId":"llava"}],"generatedAt":"2026-07-18T11:08:14.467Z"},{"id":"P-04-002","companyId":"llava","questionId":"P-04-002","instanceId":"c1n15-manual-draft-authoring-no-qi","draftId":"c1n15-semantic-balance-llava-p-04-002","promptText":"LLaVAを商用・研究で利用する際、どのようなライセンス上の制約に注意する必要がありますか？","promptTypeId":"P-04","answer":"LLaVAの料金・ライセンス体系について、LLaVA公式のGitHubリポジトリREADME（https://github.com/haotian-liu/LLaVA）で確認できます。LLaVAプロジェクト公式のGitHubリポジトリのREADMEであり、具体的には「本プロジェクトは、それぞれ独自のライセンスに従うデータセット・チェックポイントを利用している。利用者は、データセットについてはOpenAIの利用規約を含む、チェックポイントの学習に使用された基盤言語モデルの個別のライセンス（LLaMA-2・Vicuna-v1.5用のLlamaコミュニティライセンス等）を含む、これら原ライセンスのすべての条項を遵守しなければならない、と明記している」といった記載が確認できます。限界として、価格・プラン構成・ライセンス条件は改定されうるため、この内容は取得時点のものです。請求周期・地域・契約形態・割引条件によって実際の条件は異なります。 これはアクセス時点で述べられているライセンス条項であり、OpenAIやMetaが定める第三者ライセンス条項はこのリポジトリとは独立に変更されうる。またLLaVAの異なるチェックポイント・派生版（他の基盤モデルに基づくもの等）では、この一文だけでは完全にカバーされない別のライセンス条項を持つ場合がある。Current Statusとして、2026年8月21日に当該Sourceを取得し、上記の内容を確認しました。Source種別としては、これは提供元自身による自社情報の公表であり、第三者による独立した評価や市場での位置づけとは性質が異なります。","evidencePoints":["llava-ev-c1n15-p-04-002"],"scope":"","differentiation":"","faq":[],"pageUrl":"https://www.refbase.ai/reference/llava/P-04-002","sourceEvidence":[{"id":"llava-ev-c1n15-p-04-002","text":"LLaVA公式のGitHubリポジトリREADME（https://github.com/haotian-liu/LLaVA）は、LLaVAの料金・ライセンス体系に関する一次情報である。LLaVAプロジェクト公式のGitHubリポジトリのREADMEであり、具体的には「本プロジェクトは、それぞれ独自のライセンスに従うデータセット・チェックポイントを利用している。利用者は、データセットについてはOpenAIの利用規約を含む、チェックポイントの学習に使用された基盤言語モデルの個別のライセンス（LLaMA-2・Vicuna-v1.5用のLlamaコミュニティライセンス等）を含む、これら原ライセンスのすべての条項を遵守しなければならない、と明記している」といった記載がある。ただし、価格・プラン構成・ライセンス条件は改定されうるため、この内容は取得時点のものです。請求周期・地域・契約形態・割引条件によって実際の条件は異なります。 これはアクセス時点で述べられているライセンス条項であり、OpenAIやMetaが定める第三者ライセンス条項はこのリポジトリとは独立に変更されうる。またLLaVAの異なるチェックポイント・派生版（他の基盤モデルに基づくもの等）では、この一文だけでは完全にカバーされない別のライセンス条項を持つ場合がある。2026年8月21日に同Sourceを取得し、この内容を確認した。","title":"LLaVAの料金・ライセンス体系に関する公開情報","coverageType":["Capability"],"sourceType":"official_site","sourceClass":"Documentation","sourceUrl":"https://github.com/haotian-liu/LLaVA","confidence":"medium","supportedPromptTypes":["P-04"],"needsVerification":true,"sourceVerified":false,"sourceKind":"official","entityId":"llava"}],"generatedAt":"2026-08-21T06:28:59.872Z","evidenceIds":["llava-ev-c1n15-p-04-002"]},{"id":"P-01-002","companyId":"llava","questionId":"P-01-002","instanceId":"c1n16-manual-draft-authoring-no-qi","draftId":"c1n16-scaled-semantic-depth-llava-p-01-002","promptText":"LLaVAは初期バージョンからどのように改良され、後継版のLLaVA-NeXT（1.6）は何が変わりましたか？","promptTypeId":"P-01","answer":"LLaVAの主要製品・提供機能について、LLaVA公式のプロジェクトブログ記事（https://llava-vl.github.io/blog/2024-01-30-llava-next/）で確認できます。LLaVAプロジェクト公式ブログ記事がLLaVA-NeXT（LLaVA-1.6）について説明しており、具体的には「LLaVAプロジェクトが公開した後継版であるLLaVA-NeXT（LLaVA-1.6とも呼ばれる）は、サポートする入力画像解像度を最大4倍のピクセル数まで引き上げ（672x672や1344x336といった解像度に対応）、LLaVA-1.5と比較して視覚的推論・OCR能力・世界知識を改善しつつ、LLaVA-1.5のミニマリストな設計を維持し、100万件未満のビジュアル指示チューニングサンプルを使用している。」といった記載が確認できます。限界として、これは取得時点で公開されている構成であり、各提供物の機能範囲・提供地域・提供終了の有無はこのSourceからは確認できません。 このブログ記事は2024年1月にリリースされたLLaVA-NeXT（LLaVA-1.6）について説明したものであり、LLaVAプロジェクトはその後もさらなる派生版・後継版（例: LLaVA-OneVision）をリリースし続けているが、これらはこの情報源では扱われていない。Current Statusとして、2026年08月22日に当該Sourceを取得し、上記の内容を確認しました。Source種別としては、これは提供元自身による自社情報の公表であり、第三者による独立した評価や市場での位置づけとは性質が異なります。","evidencePoints":["llava-ev-c1n16-p-01-002"],"scope":"","differentiation":"","faq":[],"pageUrl":"https://www.refbase.ai/reference/llava/P-01-002","sourceEvidence":[{"id":"llava-ev-c1n16-p-01-002","text":"LLaVA公式のプロジェクトブログ記事（https://llava-vl.github.io/blog/2024-01-30-llava-next/）は、LLaVAの主要製品・提供機能に関する一次情報である。LLaVAプロジェクト公式ブログ記事がLLaVA-NeXT（LLaVA-1.6）について説明しており、具体的には「LLaVAプロジェクトが公開した後継版であるLLaVA-NeXT（LLaVA-1.6とも呼ばれる）は、サポートする入力画像解像度を最大4倍のピクセル数まで引き上げ（672x672や1344x336といった解像度に対応）、LLaVA-1.5と比較して視覚的推論・OCR能力・世界知識を改善しつつ、LLaVA-1.5のミニマリストな設計を維持し、100万件未満のビジュアル指示チューニングサンプルを使用している。」といった記載がある。ただし、これは取得時点で公開されている構成であり、各提供物の機能範囲・提供地域・提供終了の有無はこのSourceからは確認できません。 このブログ記事は2024年1月にリリースされたLLaVA-NeXT（LLaVA-1.6）について説明したものであり、LLaVAプロジェクトはその後もさらなる派生版・後継版（例: LLaVA-OneVision）をリリースし続けているが、これらはこの情報源では扱われていない。2026年08月22日に同Sourceを取得し、この内容を確認した。","title":"LLaVAの主要製品・提供機能に関する公開情報","coverageType":["Capability"],"sourceType":"official_site","sourceClass":"Documentation","sourceUrl":"https://llava-vl.github.io/blog/2024-01-30-llava-next/","confidence":"medium","supportedPromptTypes":["P-01"],"needsVerification":true,"sourceVerified":false,"sourceKind":"official","entityId":"llava"}],"generatedAt":"2026-08-22T14:51:14.995Z","evidenceIds":["llava-ev-c1n16-p-01-002"]},{"id":"P-05-001","companyId":"llava","questionId":"P-05-001","instanceId":"tair-cohort3-2026-08-31","draftId":"tair-cohort3-2026-08-31-llava-p-05-001","promptText":"LLaVA-1.5の学習に使用されたデータセットの内訳は、どこで確認できますか？","promptTypeId":"P-05","answer":"Hugging Face上のLLaVA-v1.5-13bモデルカード（開発者liuhaotian氏による公式アップロード）によると、モデルはLLaMA/Vicunaをベースに、①LAION/CC/SBUからBLIPでキャプション付けされた55万8千件の画像テキストペア、②GPTが生成した15万8千件のマルチモーダル指示追従データ、③45万件の学術タスク志向VQAデータ、④4万件のShareGPTデータ、という4種類のデータセットでファインチューニングされている。ライセンスはMeta Platforms, Inc.のLLAMA 2 Community Licenseに従うと明記されている。","evidencePoints":["llava-ev-tair-1"],"scope":"","differentiation":"","faq":[],"pageUrl":"https://www.refbase.ai/reference/llava/P-05-001","sourceEvidence":[{"id":"llava-ev-tair-1","entityId":"llava","text":"Hugging Face上のLLaVA-v1.5-13bモデルカードによると、モデルはLAION/CC/SBUの55.8万件画像テキストペア、GPT生成の15.8万件指示追従データ、45万件VQAデータ、4万件ShareGPTデータの計4種でLLaMA/Vicunaをファインチューニング。","coverageType":["Capability"],"title":"liuhaotian/llava-v1.5-13b · Hugging Face","sourceClass":"Documentation","sourceType":"product_docs","confidence":"high","supportedPromptTypes":["P-05"],"sourceVerified":false,"needsVerification":true,"sourceUrl":"https://huggingface.co/liuhaotian/llava-v1.5-13b"}],"generatedAt":"2026-08-31T06:27:37.260Z","evidenceIds":["llava-ev-tair-1"]}]}