发生了什么
德国知名AI研究实验室Black Forest Labs(黑森林实验室)于7月23日以Early Access方式正式发布Flux 3多模态基础模型。该实验室由前Stability AI核心团队于2024年创立,此前以Flux系列图像生成模型闻名。
Flux 3的核心突破在于架构统一:基于Self-Flow学习框架,将图像、视频、音频的生成与理解整合到一个模型中。官方称其配备了专用的图像、视频、音频及动作编解码器,可实现对物理与数字环境的统一感知。在初步评测中,Flux 3的得分已超过Seedance 2.0、Gemini Omni和Grok Imagine。
关键进展
- 多模态统一:Flux 3不再只是图像模型,而是同时处理视频、音频和动作预测的真正多模态基础模型。
- 视频生成:支持单次生成最长20秒的多样化视频片段,并支持带音效输出。
- 物理AI拓展:与Mimic Robotics AG合作开发Flux-mimic动作模型,已在奥迪等制造场景进行测试。
- 开源承诺:Black Forest Labs表示Flux 3最终将开源,延续其开放模型传统。
为什么重要
Flux 3的发布标志着多模态AI的竞争从「专有模型各管一段」进入「统一架构同时覆盖视、听、动」的新阶段。从图像生成到视频、音频再到机器人动作控制,Black Forest Labs的演进路径揭示了一个重要趋势:生成式AI和物理AI正在同一技术栈上融合。
对制造业、自动驾驶和机器人行业的企业而言,Flux 3的Flux-mimic分支提供了直接的应用前景——一个能从视觉和音频输入中学习并预测动作的模型,有潜力降低机器人编程和训练的门槛。但Flux 3目前仍处于Early Access阶段,大规模部署的可靠性、成本和延迟等指标尚待验证。

