Multimodal2026-07-24
VentureBeat
Black Forest Labs lanza FLUX 3: video, audio e imagen desde un texto
Black Forest Labs ha lanzado FLUX 3, un modelo multimodal de frontera que amplía los límites de la IA generativa al producir imágenes, videos y audio a partir de un solo prompt de texto. A diferencia de modelos anteriores que se especializaban en una sola modalidad, FLUX 3 puede generar clips de video coherentes de 20 segundos con audio sincronizado, todo derivado de una descripción textual simple. El modelo extiende la arquitectura existente de la compañía para manejar clips combinados de audio y video, permitiendo resultados que se sienten más inmersivos y naturales. Por ejemplo, un prompt como 'una tormenta sobre un bosque al atardecer' podría generar un video con nubes rodantes, relámpagos y el sonido de lluvia y truenos. Actualmente, FLUX 3 está disponible en una versión limitada, lo que sugiere que Black Forest Labs está gestionando cuidadosamente el acceso mientras recopila comentarios. Este lanzamiento posiciona a la empresa como competidora de otros líderes en IA multimodal como OpenAI y Google, pero con un enfoque en aplicaciones creativas y de entretenimiento. La capacidad de generar contenido audiovisual sincronizado a partir de texto podría revolucionar campos como la publicidad, la preproducción cinematográfica, el desarrollo de videojuegos y la realidad virtual. A medida que el modelo madure y esté más disponible, podría redefinir la forma en que los creadores abordan la generación de contenido.