Multimodal2026-07-24VentureBeat

黑森林实验室发布FLUX 3:一句话生成20秒带音频视频

黑森林实验室(Black Forest Labs)正式发布了FLUX 3,一个多模态前沿模型,把生成式AI的边界又推了一步——只需一段文字描述,就能同时生成图像、视频和音频。和之前那些只擅长单一模态的模型不同,FLUX 3可以根据简单文本生成最长20秒、且音画同步的视频片段。比如,输入“黄昏时森林上空的雷暴”,你得到的不仅是翻滚的云层和闪电画面,还有雨声和雷声。该模型扩展了公司原有的架构,使其能处理音视频组合输出,让生成内容更具沉浸感和真实感。目前FLUX 3仅限小范围发布,说明黑森林实验室在谨慎控制访问权限,同时收集用户反馈。这次发布让黑森林实验室成为OpenAI、谷歌等多模态AI领跑者的有力竞争者,但它的侧重点更偏向创意和娱乐应用。从广告、电影前期制作,到游戏开发和虚拟现实,这种从文本直接生成同步音视频的能力,可能会彻底改变创作者的工作流程。随着模型逐步成熟并扩大开放,它有望重新定义内容生成的方式。

相关资讯