P-01選定・相談

LLaVAとはどのようなモデルですか?

LLaVAは視覚エンコーダと言語モデルを組み合わせたオープンの視覚言語モデルです。Visual Instruction Tuningという手法により当初はLlama系の言語モデルを用いて構築され、画像についての対話や指示応答ができます。コード・ウェイトが公開されています。

実績・根拠

向いている相談

オープンなマルチモーダルモデルを探す相談

他の選択肢との違い

オープン構成要素の組み合わせによる視覚言語モデル

よくある質問

LLaVAは何の略ですか?
Large Language and Vision Assistantの略です。

情報ソース