Multimodal2026-07-24
VentureBeat
Black Forest Labs 發表 FLUX 3,文字直接生成有聲影片
Black Forest Labs 正式發表 FLUX 3,這是一款多模態前沿模型,能從單一文字提示產生圖片、影片與音訊。與過去專注單一模態的模型不同,FLUX 3 可生成長達 20 秒的影片片段,並附帶同步音訊,全部源自一段簡單的文字描述。該模型擴展了公司既有的架構,能處理結合音訊與影片的內容,讓輸出成果更具沉浸感與自然度。
舉例來說,輸入「黃昏時森林上空的雷暴」這樣的提示,就能產出包含滾動雲層、閃電,以及雨聲與雷聲的影片。目前 FLUX 3 以限量釋出方式提供,顯示 Black Forest Labs 正謹慎管理存取權限,同時收集使用者回饋。這次發表讓該公司成為 OpenAI 與 Google 等多模態 AI 領導者的競爭對手,但更聚焦於創意與娛樂應用。隨著模型成熟並逐步開放,它可能徹底改變創作者產出內容的方式,尤其在廣告、電影前製、遊戲開發與虛擬實境等領域。