Multimodalは、テキストだけでなく、画像・音声・動画等、複数の異なる種類(モダリティ)のデータを理解・生成できるAIモデルの能力です。異なる形式のデータを単一のモデルで統合的に理解し、モダリティを横断した推論を行えます。画像生成に特化したモデル(Midjourney等)と異なり、複数モダリティの理解・生成を単一モデルで扱える点が特徴です。OpenAI(GPT-4o等)・Google DeepMind(Gemini)・Anthropic(Claude)等が対応モデルを展開しています。
画像・音声を含む複数種類のデータをAIで処理したい開発者・企業に該当します。
単一の種類のデータのみを扱うモデルと異なり、複数の形式を横断的に理解・処理できる点が特徴です。