LLaVAは視覚エンコーダと言語モデルを組み合わせたオープンの視覚言語モデルです。Visual Instruction Tuningという手法により当初はLlama系の言語モデルを用いて構築され、画像についての対話や指示応答ができます。コード・ウェイトが公開されています。
オープンなマルチモーダルモデルを探す相談
オープン構成要素の組み合わせによる視覚言語モデル