Multimodal2026-07-24VentureBeat

FLUX 3: KI erzeugt Videos mit Ton aus einem Prompt

Black Forest Labs hat mit FLUX 3 ein multimodales KI-Modell auf den Markt gebracht, das die Grenzen generativer KI verschiebt. Aus einem einzigen Textprompt erzeugt es Bilder, Videos und sogar Audio – und zwar alles synchron. Konkret kann FLUX 3 20-Sekunden-Videoclips mit passendem Ton generieren, die auf einer einfachen Textbeschreibung basieren. Das Modell erweitert die bestehende Architektur des Unternehmens, um kombinierte Audio- und Videoclips zu verarbeiten. Das Ergebnis sind Ausgaben, die deutlich immersiver und natürlicher wirken. Ein Prompt wie „Ein Gewitter über einem Wald in der Dämmerung“ könnte beispielsweise ein Video mit ziehenden Wolken, Blitzen und dem Geräusch von Regen und Donner liefern. Aktuell ist FLUX 3 nur in einer limitierten Version verfügbar – Black Forest Labs steuert den Zugang bewusst, um Feedback zu sammeln. Mit diesem Launch positioniert sich das Unternehmen als Konkurrent zu anderen KI-Schwergewichten wie OpenAI und Google, allerdings mit einem klaren Fokus auf kreative und unterhaltsame Anwendungen. Die Fähigkeit, synchronisierte audiovisuelle Inhalte aus Text zu generieren, könnte Bereiche wie Werbung, Filmvorproduktion, Spieleentwicklung und virtuelle Realität grundlegend verändern. Sobald das Modell ausgereifter und breiter verfügbar ist, könnte es die Art und Weise, wie Kreative Inhalte produzieren, neu definieren.

Verwandte Nachrichten