快速回答: FLUX 3 是 Black Forest Labs 推出的一款适用于图像、视频、音频及动作预测的多模态基础模型。截至 2026 年 8 月 11 日,BFL 将 FLUX 3 Video 列为’抢先体验”服务,支持最长 20 秒的片段、可选的原生音频,并采用公开的按秒计费模式。 GlobalGPT 也提供了一条经过验证的 FLUX 3 Video 路径。在我们进行的三轮测试中,所有任务均已完成并返回了一个包含音频流的 5.04 秒 MP4 文件,但精确时长控制、字体间距以及对象一致性方面尚不完美。.
该条款的措辞仍需仔细斟酌。该 正式发布帖 和 官方车型页面 将 FLUX 3 Video 描述为“抢先体验”版本,而 BFL 的定价页面现已公布视频服务费率。GlobalGPT 提供了一条由该模型驱动的独立平台访问路径。通过该路径进行访问,并不意味着所有 BFL API、私有权重选项、图像模型、动作模型或 FLUX 3 开发者版均已全面开放。.
此更新增加了一项简短的实测:8月11日,在测试环境中进行了三代测试,使用的是 flux-3-video 模型 ID,其中包括一次完全相同的提示重复。这足以记录实际行为和可见的失败点,但仅凭三个输出结果还不足以作为全面的基准测试。.
三项来自FLUX 3 Video的第一方测试——并非广泛的基准测试。.
| 运行次数 | 返回的持续时间 | 决议 | 音频 |
|---|---|---|---|
| 3/3 成功 | 5.04 秒 每段 | 1280 × 704 | 所有文件中的解码数据 |

什么是 FLUX 3?
FLUX 3 是 Black Forest Labs 推出的一款多模态基础模型。与仅经过训练可将文本转换为图像的系统不同,BFL 表示该模型在同一架构下同时从图像、视频和音频中进行联合学习。其目标是构建能够将空间结构、运动、声音、因果关系和动作联系起来的表征,而非将每种媒介视为孤立的特征。.

这个名字听起来似乎只是 FLUX.1 和 FLUX.2 的常规后续产品,但其应用范围要广泛得多。FLUX.2 仍然是当前的图像生成和编辑产品系列;该 FLUX 2 Pro 使用指南 涵盖了该代生成式AI的图像处理流程、定价背景以及提示词设计。FLUX 3被定位为内容创作和动作预测的共享基础架构。.
BFL 使用“世界模型”这一术语来描述这一方向。 这里所指的并非该公司已宣布实现通用智能,而是指该模型旨在学习可见物体、运动、音频和动作在时间维度上的相互关联。这一区别至关重要,因为FLUX 3最引人注目的主张并非仅仅是“更优质的图像”,而是一个基础模型能够同时支持多种类型的生成与控制。.
为什么 FLUX 3 不仅仅是一个图像生成器
大多数创意型人工智能产品目前仍被视为独立的工具:一个模型生成图像,另一个生成视频,还有第三个负责添加语音或音效。FLUX 3 的设计理念则截然不同。如果一个架构能够同时学习这些模态,那么提示词、参考图像、动作序列和音轨就有可能共享相同的内部理解。.
- 图片提供了空间: 物体、构图、质感、排版以及视觉关系。.
- 视频时长: 跨帧的运动、持续性、接触以及因果关系。.
- 音频还添加了一个同步信号: 语音、环境音以及与可见事件相关的声音。.
- 动作预测将感知与控制联系起来: 该模型的表示形式可以进行调整,以预测机器人接下来应该做什么。.
对于创作者而言,其实际吸引力在于各生成阶段之间的交接环节更少。原生音频尤为重要,因为它能缩小制作片段与单独制作对话、音效及同步处理之间的差距。如果音效是您的主要关注点,那么目前的 Veo 3.1 声音指南 展示了另一家领先的视频产品系列目前如何处理原生音频。.
FLUX 3 功能一览
| 能力 | BFL的公告内容 | 截至2026年8月11日的状况 |
|---|---|---|
| FLUX 3 视频 | 视频生成与编辑,可选配原生音频(包括语音、特效、风格、字体设计及多镜头工作流程) | BFL 抢先体验;官方定价公布;GlobalGPT 航线已确认 |
| FLUX 3 图片 | 通过 API 和私有权重访问进行图像生成和编辑 | 已宣布开启抢先体验;本文未对其进行测试 |
| FLUX 3 行动 | 原生动作预测结合基于视频骨干网络构建的专用模型 | 从选定的合作伙伴开始 |
| FLUX 3 开发版 | 面向视频、音频、图像和动作预测的计划中的开放权重多模态骨干网络 | 已公布;日期和许可证尚未公布 |
FLUX 3 Video 是近期最明确的产品。BFL 表示,该产品支持文本转视频和编辑、音频同步、多语言对话、多种宽高比、排版以及片段串联等功能。这些功能使其进入了一个日益拥挤的市场;该 最佳AI视频生成器对比 在FLUX 3的访问权限仍受限的情况下,该内容为创作者提供了关于当前可使用功能的实用背景信息。.
该发布帖还描述了初步评估中生成的10秒、720p、带音频的文本转视频片段。BFL明确表示,该模型和评估框架仍处于开发阶段。这使得这些数据作为公司早期报告的证据具有参考价值,但不能替代在公开访问范围扩大后进行的独立、可重复测试。.
当前的产品页面提供了更详细的信息:据称,FLUX 3 Video 单次运行最多可生成 20 秒的视频,音频为可选功能,且视频帧中会生成多语言语音、特效和环境音效。这些是官方公布的功能限制;下文的实测记录了通过连接平台实际根据我们的提示生成的内容。.
FLUX 3 现在已经上市了吗?
是的,但只能通过分阶段的抢先体验来实现。. BFL 目前开放了一条申请通道,而非全面开放自助注册。因此,在模型、API、私有权重选项及评估流程仍在调整期间,该公司可与选定的用户和合作伙伴开展合作。.

| 问题 | 已知 | 仍有限制或尚不清楚 |
|---|---|---|
| 大家可以申请BFL吗? | 是的,通过官方申请表 | 验收标准和响应时间 |
| 用户可以在 GlobalGPT 上试用 FLUX 3 Video 吗? | 是的;经过验证的产品路径链接如下 | 路由限制和配额取决于平台账户 |
| BFL的公开报价是多少? | 文本/图片转视频、续集、草稿、高清(HD)和全高清(FHD)画质等级 | 私有权重与企业术语 |
| 会有公开组吗? | FLUX 3 Dev 计划采用开放重量制 | 发布日期、许可协议和硬件要求 |

最稳妥的解读很简单:FLUX 3 确有其事,且正在积极推广中,但“抢先体验”不应被解读为“面向所有人开放”。如果您需要确定上线时间,请在围绕此计划设计工作流程之前,先等待书面访问确认及相关条款。.
我们测试了 FLUX 3 视频:三次运行,真实输出结果
测试设置: 我们于2026年8月11日通过连接到该平台的Broly任务测试环境,使用完全相同的模型ID进行了测试 flux-3-video. 每个请求仅包含模型 ID 和提示词。我们提交了三项任务:一个产品广告提示词、一个时间一致性提示词,以及与第一个提示词完全相同的提示词。 任务 API 报告的实际处理时间分别为 88、190 和 77 秒。由于这些运行是并行的,且该路径仍在不断优化中,因此不应将这些时间视为延迟基准。.
测试 1:排版、变换和原生音频
任务 ID: task_tl5xE4BIOv2ojEb0VOMFnVT56YtvzhZ8. 该创作提示要求制作一支8秒钟的双人镜头香水广告,其中需包含精确的标签文字、瓶身变身为城市的特效、玻璃瓶的“咔嗒”声、一阵“呼”的声音以及一句台词。.

发生了什么? 最终效果完整呈现了要求的视觉弧线,并在两个场景中都保持了蓝色香水概念的可读性。标签内容依然清晰可辨,但在视觉上压缩了要求的空间,看起来更接近“FLUX3”,而非精确的“FLUX 3”。 在变换过程中,瓶子的瓶盖和瓶身形状也发生了变化。MP4文件中包含解码后的音频数据,但我们的自动化检测未能转录语音内容,因此我们不会对对话进行逐字评分。最重要的是,返回的片段时长为5.04秒,而非要求的8秒。.
测试 2:单次动作与物体一致性
任务 ID: task_izFhE8RhTeA5Tb1EaESJqbb7sP6wCwoE. 该提示去除了场景转换,要求一个发条机器人按照固定顺序穿越三个标记点,同时保留其特征。.

发生了什么? 这是更干净的测试结果。机器人朝指定方向移动,并依次经过黄色、蓝色和绿色的标记。整个镜头中,其主要识别特征始终清晰可见,没有多余的动作或明显的镜头切换。动作看起来简单而非电影化,但正是这种简单性使得一致性更容易判断。 该输出时长再次为5.04秒,并包含解码后的音频数据。.
测试 3:与第一个提示完全相同
任务 ID: task_JsnPFkB0Yqf55EwaoPU8BShBRkGLJT44. 我们再次发送了第一个提示,一个字都没改。.

发生了什么? 这次重复呈现保留了概念而非确切的结果。画面再次呈现了一个蓝色瓶子、清晰可辨的“FLUX3”字样、一条光带以及夜色中的天际线,但瓶子的几何形状、瓶盖、构图和过渡效果却有所不同。 对于无种子生成而言,这是正常现象,但当品牌团队期望产品细节具有可重复性时,这一点就显得尤为重要。.
| 测试维度 | 观测结果 | 实用要点 |
|---|---|---|
| 任务完成 | 3项任务中有3项成功 | 在此次测试期间,该连接路线处于运行状态 |
| 时长控制 | 这三个提示都要求8秒;结果都返回了5.04秒 | 在投入生产前,请验证路线级别的时长控制设置 |
| 排版 | 标签内容清晰可辨,但“FLUX 3”的具体间距未被保留 | 针对品牌文案,制定重拍或后期制作计划 |
| 时间一致性 | 这个简单机器人保留了其特征和标记顺序 | 受限的单次提示表现依然不错 |
| 重复性 | 同样的故事,不同的产品几何形状和相机选择 | 提示词的精确重复并不等同于视觉上的精确重复 |
| 音频 | 每个MP4文件都包含已解码的音频数据;对话内容并未被自动转录 | 在批准前手动收听并审核同步情况 |
我们的结论: FLUX 3 视频在遵循高层次场景逻辑方面表现得比严格遵守具体制作约束更为出色。流畅的产品变换和机器人的有序运动令人鼓舞。 固定的 5.04 秒返回时间、不完美的文本间距以及瓶形偏移,都是您在正式部署前应先测试自身工作流的原因。这是一个有用的实践反馈,而非针对整个模型的评分。.
FLUX 3 与 FLUX.2:究竟有哪些变化?
| 地区 | FLUX.2 | FLUX 3 |
|---|---|---|
| 主要公众身份 | 图像生成与编辑系列 | 多模态基础模型 |
| 治疗方式 | 图像与图像编辑工作流程 | 图像、视频、音频及动作预测 |
| 当前访问权限 | 已发布的API模型和定价 | BFL 视频抢先体验、官方视频定价以及一条经过验证的 GlobalGPT 路由 |
| 打开模型方向 | 几种 FLUX.2 变体及已记录的终点 | FLUX 3 Dev 公开版重量参数公布,详情待定 |
| 对表现的公正评价 | 今天即可作为图像模型进行测试 | 视频内容可以进行测试;但要对此做出涵盖整个家族的全面结论,目前还为时过早 |
最大的变化在于应用范围,而非经过验证的百分比提升。FLUX 3 并非仅仅是在 FLUX.2 基础上新增了一个图像质量评分,而是旨在将创意生成与物理动作整合到同一个产品系列中。对于当前仅基于图像的决策,该 FLUX 2 与 Nano Banana Pro 对比 更具可操作性,因为如今这两者都可以被视为图像处理工具。.
要全面比较 FLUX 3 与 FLUX.2,仍需考虑匹配的图像提示、参考编辑、排版、提示遵循度、延迟和成本等因素。上文提到的三轮视频测试在一定程度上缩小了证据差距,且 BFL 现已公布 FLUX 3 视频模型的费率,但并未对图像模型或开放权重变体进行对比。.
官方演示和机器人竞赛结果揭示了什么
BFL的发布资料展示了生成的视频、同步音频、视觉风格、动画文字以及早期编辑功能。这些内容展示了产品的方向以及该公司所追求的输出效果。由于这些是经过筛选的官方示例,因此无法让我们了解普通用户能以何种频率生成同等质量的内容、生成过程需要多长时间,以及每项生成的结果将产生多少成本。.

机器人技术方面的工作则更为具体。在 FLUX 3 模拟报告, BFL 和 mimic robotics 介绍了如何将 FLUX 3 视频骨干网络适应于机器人动作预测。图中显示的软体运动图表显示,FLUX-mimic 的成功率中位数为 95%,每条虚线表示的中位数均基于 20 次自主试验。.
这是一项机器人学研究成果,而非图像或视频质量的基准测试。其意义在于概念层面:BFL认为,经过训练以建模运动、接触、重量和因果关系的骨干网络,能够揭示出对物理任务有用的表征。该方法是否能推广至各类机器人、工厂和任务,尚需更广泛的独立证据来验证。.
X和Reddit上早期的社区反响
FLUX 3 立即引起了广泛关注。在 7 月 27 日的验证快照中,该 BFL在X平台上的官方公告 显示有6,088个点赞、862次转发、365次引用和314条回复。这些数据反映的是发布时的关注度,而非车型的可靠性,而且这些数字还会继续变化。.

A Reddit论坛r/StableDiffusion版块的一篇帖子 标题为“Flux 3 效果太疯狂了。这只用了一个提示词”的帖子,在同一验证窗口中获得了370个赞和63条评论。该帖子的分屏示例虽然使用了难度较高的提示词,但这仍只是一个共享的示例,而非受控基准测试。.

正确的结论是,创作者们对提示词的复杂性、动作、原生音效以及视觉一致性都抱有浓厚兴趣。一旦应用范围扩大,提示词的可复现性就应成为一项核心测试指标。与此同时, Kling 3.0 提示公式 是关于如何在当前可用的视频工具中构建场景、设置摄像机行为、运动及约束条件的一份实用参考资料。.
FLUX 3 API、定价及开放权重
截至8月11日,BFL的 已发布的定价文件 包含 FLUX 3 Video。1 个学分等于 $0.01。 文本转视频和图片转视频在高清(HD)模式下的费用为每秒$0.17,在全高清(FHD)模式下为每秒$0.29,而高清(HD)草稿的费用为每秒$0.06。 视频续传在HD分辨率下每秒费用为$0.43,在FHD分辨率下每秒费用为$0.54,草稿模式下每秒费用为$0.12。.
| 项目 | 已发布或已核实 | 仍有限制或尚不清楚 |
|---|---|---|
| FLUX 3 视频定价 | T2V/I2V:$0.17/s 高清,$0.29/s 全高清;草稿:$0.06/s。 后续:$0.43/s 高清,$0.54/s 全高清;草案:$0.12/s | 私有权重与企业术语 |
| BFL 访问权限 | 视频抢先体验、机型概述和定价信息已公开 | API 的通用接受规则、配额及账户特定限制 |
| GlobalGPT 访问 | 已验证 FLUX 3 视频产品路线,并成功完成了三轮任务测试 | 账户配额和路由级控制措施可能与 BFL 的直接服务有所不同 |
| FLUX 3 开发版 | 规划为一个开放重量级的多模态骨干网络 | 发布日期、许可类型、参数大小及硬件要求 |
请勿将“开放权重”与“开源”混为一谈。权重、代码、训练数据和许可协议各自可能有不同的访问条件。要对“开放权重”做出有意义的判断,必须等到 BFL 发布实际的 FLUX 3 Dev 版本及其许可协议之后。.
如何申请 FLUX 3 抢先体验版
- 打开 FLUX 3 官方产品页面 并审查当前的能力标签。.
- 点击“请求”按钮,前往 FLUX 3 官方抢先体验申请表.
- 请描述您所需的功能——视频、图像、操作、私有权重或开发者访问权限——以及您希望构建的工作流。.
- 请提供一个切合实际的使用场景、预计使用量、组织详情,以及说明早期访问权限为何对该项目至关重要。.
- 在确认访问权限、价格、限额或交付日期之前,请务必等待书面确认。.
一份具体的申请比笼统的“我想试一试”更有说服力。例如,一家工作室可以说明,它需要为品牌短片制作多语言对话和同步特效;而一个机器人团队则可以描述其操作任务、机器人平台、数据以及部署环境。.
如果目标是进行对话,请规划完整的流程,而不仅仅是生成提示词。该 Veo 3.1 对话与口型同步工作流程 重点指出了在评估 FLUX 3 Video 时同样重要的实际问题——发言时间控制、语调一致性、镜头设计以及内容再生。.
哪些人适合观看《FLUX 3》?
- AI视频创作者 应关注原声、多语言对话、剪辑、多镜头衔接、连贯性、节奏以及最终定价。.
- 图像创作者 应等待涵盖提示遵循度、参考文献编辑、排版和成本等方面的可重复比较结果。在此之前,该 2026年测试过的最佳AI图像生成器 是更切合实际的候选名单。.
- 开发人员 应关注公共模型 ID、速率限制、SDK 支持情况、私有权重条款以及 FLUX 3 Dev 未来的许可协议。.
- 机器人技术与物理人工智能团队 应考察FLUX-mimic方法是否能在已发表的任务之外实现迁移,以及需要多少任务特定数据的适应。.
在确定生产工作流程之前,请使用四阶段的 FLUX 3 就绪性检查。启动演示虽可通过功能阶段的检查,但无法通过访问权限、经济可行性或证据阶段的检查。.
| 门 | 必须成立的条件 | 需要收集的证据 |
|---|---|---|
| 访问 | 贵团队已获得对所需能力的书面批准 | 账户邀请、条款、地区、配额及支持联系信息 |
| 能力 | 该模型能完成您实际的任务,而不仅仅是一个展示性的提示词 | 匹配的提示、参考输入、失败案例和重复运行 |
| 经济学 | 成本和周转时间符合生产计划 | 价格、生成时间、重试率、数量限制和基础设施 |
| 证据 | 在选定的初始案例之外,结果仍然具有可信度 | 独立测试、可重现的设置以及带版本信息的输出结果 |
想试用我们测试中使用的模型吗? 开放 FLUX 3 关于 GlobalGPT 的视频. 该产品路线已上线,相关任务环境已于2026年8月11日完成了全部三次运行。在启动生产批处理之前,请检查您自己账户中显示的控制项和配额。.
关于 FLUX 3 的常见问题
FLUX 3 是何时公布的?
Black Forest Labs 于 2026 年 7 月 23 日发布了 FLUX 3。发布公告中介绍了一款涵盖图像、视频、音频及动作预测的多模态基础模型,其功能将通过分阶段的“抢先体验”逐步推出,而非一次性面向公众发布。.
FLUX 3 是否已向公众开放?
BFL 通过“抢先体验”通道提供 FLUX 3 Video 服务,并已公布其视频定价。GlobalGPT 也拥有经过验证的 FLUX 3 Video 产品路径。但这并不意味着 FLUX 3 Image、Action、私有权重或 FLUX 3 Dev 已全面开放自助服务;每项功能仍遵循各自的发布计划和条款。.
FLUX 3 能否生成带有原生音频的视频?
是的。BFL表示,FLUX 3 Video 能够根据画面生成多语言语音、音效和环境音。我们在8月11日测试中获得的三个MP4文件均包含已解码的音频数据。由于我们并未对这些音轨进行自动转录,因此该测试仅确认了音频的存在,而非对话内容的逐字准确性。.
FLUX 3 也是一个图像模型吗?
是的。图像生成和编辑功能属于 FLUX 3 系列的一部分,但 BFL 表示,FLUX 3 Image 抢先体验版将在首次公告发布后的几周内开放。截至本更新发布时,公共端点名称、最终上线时间及定价尚未公布。.
FLUX 3 是开源的,还是“开放重量”的?
BFL 已宣布将通过 FLUX 3 Dev 提供未来的开放权重访问功能。目前尚未公布发布日期、许可协议、参数规模、代码范围或硬件要求。在这些细节公布之前,与其说“开源”,不如说“计划开放权重”更为准确。”
FLUX 3 与 FLUX.2 有什么不同?
FLUX.2 主要是一个图像生成与编辑模型系列,其端点和定价信息已对外公布。FLUX 3 则是一个更广泛的多模态基础模型,旨在连接图像、视频、音频以及动作预测。要进行公正的质量或成本比较,还需等待 FLUX 3 获得更广泛的访问权限。.
FLUX 3 的实际测试结果如何?
三项任务全部成功完成,其中 flux-3-video 模型 ID。输出结果符合要求的高层级场景,且机器人测试保留了其运动顺序和主要特征。尽管提示时长为 8 秒,但这三个片段时长均为 5.04 秒;标签间距的精确度以及产品几何形状的重复性均不够理想。.
我可以在 GlobalGPT 上使用 FLUX 3 吗?
是的。已验证的路线是 FLUX 3 关于 GlobalGPT 的视频. 我们还于2026年8月11日通过互联任务环境完成了三代迭代。平台访问与直接访问BFL API或私有权重是分开的。.
最终收获
FLUX 3 已不再只是发布页面的承诺。BFL 已公布视频功能及定价,GlobalGPT 拥有经过验证的流程,而且我们进行的三次运行均生成了带有音频流的可用 MP4 文件。该模型很好地处理了场景逻辑和受限动作,但未能达到要求的时长,且在精确文本和产品一致性方面有所欠缺。 在调整规模之前,请先测试您的实际提示词,并持续关注 FLUX 3 Image、Action、私有权重以及 FLUX 3 Dev 许可证,随着该系列产品的不断成熟,这些部分将持续优化。.



