Black Forest Labsの公式ブログ(2026年7月付)によれば、同社は新たなマルチモーダル基盤モデル「FLUX 3」を発表しました。FLUX 3は画像・動画・音声を単一の統合アーキテクチャで同時に学習するモデルで、最大20秒の動画をネイティブ音声つきで生成できるほか、テキストからの動画生成・画像からの動画生成・動画から動画への変換・多言語対応の台詞生成に対応するとされています。また、スイスのMimic Roboticsと共同開発したFLUX-mimicにより、ロボットの動作予測(Action)機能も統合されており、物理世界での作業指示の実行に向けた展開が進められているとされています。ただし、この発表はFLUX 3の機能概要を示すものであり、公開時点でのブログ本文にはRobin Rombach個人の発言は含まれておらず、各機能の商用提供時期は今後数週間から数か月かけて段階的に展開されるとしています。2026-08-29時点でBlack Forest Labs公式サイトの当該ページが同内容で公開されていることを確認しました。Black Forest Labs自身が発表した公式情報であり、一次情報源として扱われます。