概览
Black Forest Labs 于 2026 年 7 月 23 日以早期访问形式发布的统一多模态基座模型,官方把图像、视频、音频视作「关于同一个底层现实的不同证据」放进同一套架构联合训练。首批开放的是视频能力,图像合成与动作预测分阶段跟进,API、私有权重与开放权重的 FLUX 3 [dev] 计划年内推出。官方称其强项是面部表情与声画动作的对应。BFL Playground 的视频按秒计费,Draft 档 HD 为 $0.17/秒。同一天还发布了与 mimic 合作的视频-动作模型 FLUX 3 x mimic。
- 模态
- 多模态
能力
- 单一架构联合建模图像、视频、音频与动作预测(Self-Flow)
- 单次生成最长 20 秒、720p 的视频,并原生同步音频
- 文生视频、图生视频与视频转视频
- 多语种对白、音效与环境声
- FLUX Upscale:把生成结果重新生成到原生 2K / 4K
- FLUX 3 Action:面向机器人的动作预测(限量早期访问)
版本历史
2026-08(Upscale)
- 推出 FLUX Upscale:把视频重新生成到最高原生 4K
2026-08(Video Part 1)
- 公开 FLUX 3 视频生成能力的技术细节
2026-07
- 首次发布并开放早期访问,统一图像 / 视频 / 音频 / 动作的多模态基座
- 视频最长 20 秒、720p,原生同步音频
- 同步发布视频-动作模型 FLUX 3 x mimic
