Multimodal2026-07-24VentureBeat

Black Forest Labs、マルチモーダルモデル「FLUX 3」公開

Black Forest Labsは、マルチモーダルフロンティアモデル「FLUX 3」をリリースしました。このモデルは、1つのテキストプロンプトから画像、動画、そして音声を生成することで、生成AIの可能性を押し広げます。 従来のモデルが1つのモダリティ(画像やテキストなど)に特化していたのとは異なり、FLUX 3は簡単なテキストによる説明から、音声が同期された一貫性のある20秒の動画クリップを生成できます。このモデルは、既存のアーキテクチャを拡張し、音声と動画のクリップを組み合わせて処理することで、より没入感があり自然なアウトプットを実現します。 例えば、「夕暮れの森の上の雷雨」というプロンプトから、雲が立ち込め、稲妻が走り、雨と雷の音がする動画を生成することが可能です。現在、FLUX 3は限定リリースとなっており、Black Forest Labsはアクセスを慎重に管理しながらフィードバックを収集している段階です。 今回の発表により、同社はOpenAIやGoogleといった他のマルチモーダルAIリーダーと競合する立場となりましたが、特にクリエイティブおよびエンターテインメント分野に焦点を当てています。テキストから同期した視聴覚コンテンツを生成できる能力は、広告、映画のプリプロダクション、ゲーム開発、バーチャルリアリティといった分野に革命をもたらす可能性があります。モデルが成熟し、より広く利用可能になるにつれて、クリエイターがコンテンツ生成に取り組む方法を再定義するかもしれません。

関連ニュース