Multimodal2026-07-24VentureBeat

Black Forest Labs lança FLUX 3: modelo multimodal de áudio e vídeo

A Black Forest Labs lançou o FLUX 3, um modelo multimodal de fronteira que expande os limites da IA generativa ao produzir imagens, vídeos e áudio a partir de um único prompt de texto. Diferente de modelos anteriores que se especializavam em uma única modalidade, o FLUX 3 consegue gerar clipes de vídeo coerentes de 20 segundos, completos com áudio sincronizado, tudo derivado de uma descrição textual simples. O modelo estende a arquitetura existente da empresa para lidar com clipes combinados de áudio e vídeo, permitindo resultados que parecem mais imersivos e naturais. Por exemplo, um prompt como 'uma tempestade sobre uma floresta ao anoitecer' poderia gerar um vídeo com nuvens se movendo, relâmpagos e o som de chuva e trovão. Atualmente, o FLUX 3 está disponível em uma versão limitada, sugerindo que a Black Forest Labs está gerenciando cuidadosamente o acesso enquanto coleta feedback. Esse lançamento posiciona a empresa como concorrente de outros líderes em IA multimodal, como OpenAI e Google, mas com foco em aplicações criativas e de entretenimento. A capacidade de gerar conteúdo audiovisual sincronizado a partir de texto pode revolucionar áreas como publicidade, pré-produção de filmes, desenvolvimento de jogos e realidade virtual. Conforme o modelo amadurece e se torna mais amplamente disponível, pode redefinir como criadores abordam a geração de conteúdo.

Notícias relacionadas