JOTO
联系我们
← AI 智库
多模态模型

Black Forest Labs发布多模态模型FLUX 3:支持20秒音视频生成与机器人动作预测

2026 年 7 月 23 日

Black Forest Labs推出多模态模型FLUX 3,支持单提示生成最长20秒带同步音频的视频,并拓展至机器人动作预测;采用联合训练的统一架构(Self-Flow),而非拼接独立模态模型;当前仅开放早期访问,未公布定价、SLA、基准测试细节及可下载权重;开源版FLUX 3 Dev计划晚些时候发布,将覆盖视频、音频、图像与动作预测。

Black Forest Labs发布多模态模型FLUX 3:支持20秒音视频生成与机器人动作预测

Black Forest Labs(BFL)正将FLUX系列扩展至图像生成之外,今日推出FLUX 3——一款多模态前沿模型,经训练可理解并生成图像,或根据单条提示生成最长20秒的音视频组合片段;同时,该模型亦可将同一底层架构拓展至机器人视觉与动作领域。

这家总部位于德国弗赖堡的AI实验室表示,FLUX 3在上述各模态上进行了联合训练,而非在统一接口后拼接独立的图像、视频和音频模型。

这一区别是该公司核心主张的关键:BFL希望企业将创意生成、仿真、计算机使用及机器人技术视为一种其称之为“视觉智能”(visual intelligence)的单一能力的关联应用——按该公司说法,这类模型“能够在物理与数字环境中感知、预测并执行行动”。此次发布标志着BFL首款面向公众的视频生成模型问世。

FLUX 3将通过四条产品线提供:FLUX 3 Video、FLUX 3 Image、FLUX 3 Action,以及即将推出的开源版FLUX 3 Dev。其中,支持可选原生音频生成的FLUX 3 Video与FLUX 3 Action现已启动受控的“早期访问”(Early Access)计划,任何人均可申请,但须经BFL审核批准。

目前尚无通过BFL的应用编程接口(API)或其合作伙伴API向公众开放的渠道,但公司表示FLUX 3 Image将在未来数周内上线,随后进入全面可用阶段。此次有限初期发布策略,呼应了近期美国其他前沿实验室(包括AnthropicOpenAI)新模型的发布方式,尽管后两者 ostensibly 出于安全考量并应政府要求而采取该策略。

该公司尚未公布定价、生产级服务等级承诺(SLA)、评估方法、样本量、评分员人数,或任何图像模型基准测试结果。因此,企业买家目前尚无法计算总体拥有成本(TCO),也无法独立复现视频对比结果。

另一项重大缺漏在于:FLUX 3 并未 在本次发布时提供可下载权重(downloadable weights),亦未采用开源许可证。BFL表示,更快版本及开源权重版本将于今年晚些时候推出;其技术博客将FLUX 3 Dev定义为“面向内容创作(视频、音频及图像)与动作预测的多模态骨干网络开源权重访问”——这一承诺范围远超此前所有仅覆盖图像的FLUX Dev版本。

但该版本将在序列中最后推出。习惯于在重大模型发布同期或稍后即获得本地可部署FLUX变体的开发者将不得不等待。这一延迟并不否定公司的承诺,但鉴于开源权重迄今在FLUX采用过程中所起的关键作用,此举令人失望。

FLUX 3评分高于竞品,但缺失定价与基准测试细节可能阻碍其在企业端的快速采用

BFL已发布多项基准对比结果,但均标注为初步结果——完整基准测试结果与方法论将在更广泛的全面可用阶段后续发布。

在针对10秒、720p带音频文本生成视频片段的早期一对一偏好测试中,该公司称FLUX 3在93%的对比中优于Luma Ray 3.2,在77%中优于Runway Gen-4.5,在69%中优于Grok Imagine Video,在60%中优于Kling v3 Pro,在59%中优于Happy Horse v1,在57%中优于Happy Horse 1.1,且在52%中优于Seedance 2.0与谷歌Gemini Omni Flash。

每一项数据均附有一项免责声明,且该声明源自BFL自身。载有上述结果的图表被标注为“早期FLUX 3候选模型的初步评估”——这意味着这些数字描述的是发布前某一检查点的表现,而非当前进入早期访问阶段的模型。这具有双重含义:正式发布的模型性能可能更优,但今日所发布内容均未衡量客户实际调用的产品表现。

FLUX 3在与Luma Ray 3.2(93%)及Runway Gen-4.5(77%)的对比中取得优势,这两者是榜单中对比强度最弱的——虽属成熟产品,却并非当前独立视频排名中领跑的模型。这些确属真实胜出,且最不可能改变企业采购短名单。

Seedance 2.0得分为52%,相当于与一款多数西方企业当前无法采购的模型进行统计学意义上的抛硬币式对决。字节跳动在Netflix、华纳兄弟、迪士尼、派拉蒙及索尼就涉嫌系统性版权侵权发出法律威胁后,无限期推迟了Seedance 2.0的国际发布;该暂停状态至今仍持续。将一款已被冻结的产品纳入对比,既非有力主张,亦非不利指控。

Gemini Omni Flash同样得分为52%,其意义则重大得多。Omni是与FLUX 3目标最接近的大型平台级对标产品——支持多模态输入、具备视频与音频感知能力的内容创作、对话式编辑——而据BFL自身测量,二者在10秒文本生成视频质量上难分伯仲。

谷歌在此项对比中的优势在于,Omni已通过谷歌Gemini API面向公众开放,生成每秒720p视频收费0.10美元,即生成一段10秒视频约需1.00美元。

一项区域性差异对其德国母公司的本土市场至关重要:在欧洲经济区、瑞士及英国,Omni Flash用户无法编辑 上传 的视频,尽管编辑模型自身生成的视频则被允许。一家希望将其现有影像素材交由生成式编辑流程处理的欧洲企业,目前尚无法在Omni Flash上实现此操作。

以下是为企业客户提供的粗略指南,供其评估应依赖哪些视频模型:

模型

单次生成最大时长

最高分辨率

关键限制

每段10秒视频(720p)价格

每段10秒视频(1080p)价格

每段10秒视频(4K)价格

FLUX 3 Video

20秒

未说明;评估运行于720p

早期访问;未公布服务等级协议(SLA)或定价

未公布

未公布

未公布

HappyHorse 1.1

15秒

1080p

不支持 4K;权重闭源

未公布(v1.0 版本经销商费率约为 1.82 美元)

未公布(v1.0 版本经销商费率约为 3.12 美元)

不适用

Veo 3.1

按秒计费

4K

支持片段延展;预览功能

4.00 美元

4.00 美元

6.00 美元

Veo 3.1 Fast

按秒计费

4K

预览功能

1.00 美元

1.20 美元

3.00 美元

Veo 3.1 Lite

按秒计费

1080p

不支持 4K,不支持片段延展;预览功能

0.50 美元

0.80 美元

不适用

Gemini Omni Flash

10 秒(最低 3 秒)

720p 分辨率,24 帧/秒

仅限预览功能,且不支持欧盟地区访问

1.00 美元

不适用

不适用

一种面向媒体生成与物理动作的统一架构

FLUX 3 基于 Self-Flow——BFL 于 2026 年 3 月公开的、用于在单一架构内对齐多模态理解与生成的方法。

该公司表示,其大幅扩展了计算资源与数据规模,以实现视频、图像与音频的同步训练;测试表明,视频生成与动作预测无需各自独立的基础模型——同一架构可拓展至动作预测任务,且不会牺牲其从视频中习得的能力。

BFL 联合创始人兼首席执行官罗宾·隆巴赫(Robin Rombach)在向 VentureBeat 提供的一份发布前声明中表示:“我们将视觉置于方法核心,因为它是物理世界中信号最丰富的媒介。图像传达结构,图像与视频教授空间关系,视频教授动态变化,而动作揭示因果关系。但仅靠视觉并不构成完整图景。真正的智能意味着感知世界:预测其将如何变化、采取行动,并从结果中学习。在单一统一架构内进行联合训练,正是通往这一目标的路径,因为每种训练模态都会强化其他模态。音频传达时间信息、韵律以及视觉难以捕捉的物理事件;语言则传达目标、抽象概念及像素难以直接表达的指令。”

他在公告其他部分更直白地指出:“你无法欺骗现实。仅学习图像的模型只能生成图像。但世界并非由静态帧构成——它在运动、发声、变化并作出响应。”

BFL 表示,FLUX 3 面向创意工具、媒体、设计、电子商务及物理人工智能(Physical AI)领域,支持带同步音频的视频生成、精准图像编辑、运动过程中产品与材质的一致性、多语言生成以及机器人动作预测。目前,Canva、Burda、Magnific(前身为 Freepik)、Krea 和 Picsart 已开始测试该模型。

对创意软件公司而言,其吸引力在于整合。单一基础模型或可同时支撑分镜脚本绘制、图像编辑、产品渲染、视频变体生成及本地化,而无需在彼此割裂的模型之间反复转换资产与指令。

对机器人研发团队而言,其潜在价值在于数据效率。已编码运动、物体行为及物理变化的模型,可能比从原始演示出发构建的系统所需的任务特化机器人训练数据更少。

FLUX 3 视频能力实际表现如何

视频层级是本次发布中规格最明确的部分,并解答了一个此前流传已久的传闻:FLUX 3 可在单次生成中输出最长 20 秒、含同步音频的视频片段。

所有视频输出均原生附带音频。作为对比,HappyHorse 1.0 最高支持 15 秒、1080p 分辨率且带同步音频的视频——尽管 BFL 尚未说明其 20 秒视频片段的分辨率,且其已公布的评测均在 720p 分辨率下进行。即便如此,单次提示生成 20 秒视频片段仍是迄今最长之一,与 OpenAI 已停用的 Sora 模型持平。

BFL 公布的能力清单涵盖:

  • 文本到视频生成。

  • 图像到视频生成,包括从起始帧进行动画化,或使用图像作为视觉参考。

  • 基于参考视频片段的视频到视频生成,将特定角色等元素迁移到新场景或新语境中。

  • 基于现有视频和音频输入的生成式视频-音频续写。

  • 关键帧到视频生成,用于在定义时刻之间实现受控过渡。

  • 多语言对话。

  • 涵盖从即兴摄像机拍摄画面到动画及电影级影像的广泛视觉风格与宽高比。

  • 字体排印生成与动态设计。

  • 将单个片段通过智能体(agentic)链式编排成长时长、多镜头序列。

最后一项是企业视频团队最应重点关注的能力。BFL声称,这些能力组合可生成持续数分钟的序列,且借助视觉参考确保角色在不同场景中保持一致。若该能力在实际生产条件下得以验证,它将解决长期阻碍生成式视频进入大多数商业管线的核心约束:问题不在于单个片段的质量,而在于镜头之间的连贯性。

这也是竞争最直接的领域。HappyHorse 1.1 的主打升级是 R2V(Reference-to-Video,参考到视频),该功能接受多张角色参考图像,以在生成画面中维持身份稳定性——这与通过智能体片段链式编排所解决的是同一问题,但前者在输入层着手,后者则在后处理层面实现。阿里巴巴亦宣称实现了零漂移唇形同步,并特别针对标记商业AI视频为合成内容的各类瑕疵进行了优化,包括面部油光感与过度锐化。角色一致性正是该细分领域争夺的焦点,两家公司对此心知肚明。

BFL表示,FLUX 3 Video 在人类面部表情生成、将声音与物理事件关联以及多语言输出方面已尤为出色。在图像侧,该公司称中期训练阶段开展的初步评估显示,其在复杂提示词处理与文本生成方面相较早期FLUX版本有显著提升,包括支持多种语言的高精度文本生成。但该公司未发布任何图像基准测试结果或胜率数据。

FLUX-mimic 测试视频模型能否转变为机器人模型

BFL正通过FLUX-mimic践行其统一架构理念;FLUX-mimic是一款基于FLUX 3构建的视频-动作模型,由BFL与瑞士公司Mimic Robotics联合开发,后者是首批获得早期访问权限的合作伙伴之一。

技术博客描述了两种不同的动作预测路径:一是将原生动作预测能力直接集成进FLUX 3,扩展初始Self-Flow工作;二是将预训练视频骨干网络用作具备动力学感知能力的基础框架,由此可在有限任务特定数据基础上对专用动作模型进行微调。FLUX-mimic采用第二条路径——即FLUX 3骨干网络结合Mimic的机器人学习能力及其在灵巧操作领域的生产部署专长。

FLUX-mimic专为通用机器人操控而设计:帮助机器人理解视觉场景、预测动作后果,并以远少于以往所需的特定任务数据量适应新任务。

BFL与Mimic Robotics表示,视任务难度而定,该模型仅需最多30分钟的机器人数据即可完成特定操控任务的微调,而此前方法通常需要30小时或更长时间。

Mimic Robotics首席技术官Elvis Nava在向VentureBeat提供的声明中表示:“机器人领域最难的部分是数据。每新增一项任务通常意味着机器人需重复自身操作数小时。由于FLUX-mimic构建于前沿视频模型之上,而这些模型已理解物理世界如何运行,因此它能在数分钟而非数天内掌握新任务。借此,我们得以跨越式超越当前机器人学习的最先进水平。”

BFL 主张,仅在图像上训练的模型无法理解一个‘运动、发声、变化并响应’的世界,而物理理解才是生成逼真画面的关键所在。谷歌对Gemini Omni也提出了几乎完全相同的主张。

其开发者文档援引了所谓“世界知识”,该知识融合了“对物理学的理解”与Gemini对历史、科学及文化语境的把握。其营销措辞更为直白:“大多数AI模型仅预测下一个像素以构建叙事或图像。Gemini Omni则不同。”该公司于6月发布声明称,该模型具备“对重力、动能及流体动力学等力的直观理解,从而实现更符合现实逻辑的逼真运动。”

对企业买家而言,实际后果在于,“世界模型”这一术语本身并非差异化卖点。目前三大领先视频系统中有两个已将物理理解作为其核心优势进行市场宣传,但二者均未发布任何衡量该能力的基准测试。

目前尚无标准测试用以判断生成的水是否表现得像真实水体、下落物体是否以合理速率坠落,或声音是否在撞击发生时同步抵达。人类偏好评分仅能间接捕捉其中部分维度,其余所有现有方案则完全无法捕捉。

开源权重助力FLUX成为行业标准

BFL 于2024年夏季正式成立。 并在随后两年间,凭借其致力于开源高质量AI图像模型的承诺,在AI行业中树立声誉;这些模型广受开发者、创意人士及企业青睐。

该公司创始人包括Rombach、Andreas Blattmann与Patrick Esser,他们此前曾参与创建VQGAN、潜在扩散(latent diffusion)及 Stable Diffusion——后者是开启大众级AI生成能力的开源技术,目前被众多AI图像生成器及公司所采用。

这一影响力已转化为商业分发成果。FLUX模型目前已为Adobe Photoshop、Picsart以及Nous Research的Hermes Agent等平台内的生成式功能提供支持,该公司亦列举电影导演马丁·斯科塞斯(Martin Scorsese)为其专业用户之一。

《连线》(Wired) 杂志将Black Forest Labs描述为一家规模相对较小的公司,却已成为硅谷最大AI实验室的领先竞争对手;FLUX模型在图像基准测试中排名靠前,并成为AI代码共享社区Hugging Face上下载量最高的文本到图像模型之一。该公司称,其目前在弗赖堡(Freiburg)与旧金山(San Francisco)两地共运营一支百人团队。

FLUX.1 Dev、FLUX.1 Kontext Dev、FLUX.1 Fill Dev及相关控制模型, 在公司成立后不久即发布, 为研究人员及创意工具开发者提供了可下载的检查点(checkpoints)、本地推理能力,以及与Hugging Face Diffusers和ComfyUI等框架的集成支持。例如,FLUX.1 Kontext Dev作为一款开源权重模型面向研究及非商业用途发布,其生成内容在适用许可条款下允许用于商业目的。

该公司延续了这一模式,推出了 FLUX.2 Dev 2025年末,一款参数量达320亿的开源权重模型,融合了生成与多参考编辑能力。Black Forest Labs称其为发布时可用的最强开源权重图像生成与编辑模型,并发布了模型权重、参考推理代码以及针对消费级Nvidia GPU优化的实现方案。

FLUX 3 Dev进一步提升了该评估标准。此前发布的Dev版本均为图像模型。而此次发布的版本被描述为一种覆盖视频、音频、图像及动作预测的多模态骨干模型——这意味着单一许可证将决定一家公司能否在本地部署同时涉及内容生产与物理机械控制的模型。Black Forest Labs(BFL)尚未公布其许可证条款、参数量、量化方式或硬件要求。

该公司将开源权重定位为企业级功能而非面向社区的姿态,主张开源权重可支持机器人控制系统等应用的安全、低延迟本地部署,并使团队能够基于自身数据、产品及工作流程对FLUX 3进行适配。

除技术主张外,支撑FLUX 3的财务背景同样值得关注。Black Forest Labs估值达32.5亿美元,已从包括a16z、AMP、Salesforce Ventures、Nvidia、General Catalyst、Adobe Ventures、Figma Ventures、Canva以及德国电信旗下T.Capital在内的投资者处募集超过4.5亿美元资金。

JOTO 企业落地观察

  • 企业若计划将FLUX 3用于视频生成类业务,需重点评估其早期访问阶段的服务稳定性与响应延迟——当前未公布SLA,意味着无法保障生产环境下的交付时效与容错能力。
  • FLUX 3强调的“统一多模态架构”对智能体工程提出新要求:企业需重构原有单模态Agent链路,转向跨模态状态传递与联合决策机制,而非简单叠加图像、视频、音频模块。
  • RAG知识工程团队应关注FLUX 3 Dev的开源节奏:若其多模态骨干权重最终以宽松许可证发布,将极大降低企业构建自有视频+动作知识库的技术门槛,但当前缺失参数量与硬件要求信息,导致本地部署可行性暂不可判定。
  • AI安全治理团队需警惕“物理世界理解”的模糊主张——当前缺乏可验证的物理常识基准测试,企业无法独立评估其生成内容在力学、声学、时序一致性等维度的风险暴露面。

立即咨询 JOTO

JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询

想把这些做法用到你的业务里?

留下你的场景和痛点,我们帮你判断从哪一步开始。

联系我们
联系我们

开启企业级 AI 落地

留下你的行业、部门和当前痛点,我们会在 1 个工作日内与你联系,帮你判断适合先做什么、需要准备哪些数据、适合什么平台。

微信咨询
扫码添加,一对一沟通
JOTO 微信咨询二维码
发送邮件
jotoai@jototech.cn

填写需求单

收到你的信息后,我们将在 1 个工作日内与你取得联系。