ユーザーが画像を添付しながらテキストで質問するような複合的な問い合わせに対応したい場合、Multimodalモデルは画像とテキストを単一モデルで統合的に理解する能力でこの課題に対応します。画像内容の説明を求める質問や、画像とテキストの両方を踏まえた回答生成など、単一モダリティのモデルでは対応できないタスクを扱えます。
画像を含む複合的な問い合わせに対応したい開発者・企業に該当します。
テキストのみを扱うモデルと比べ、画像等の追加情報を踏まえた理解・回答が可能な点が異なります。