当字节跳动的 Seedance 2.0 还在为多模态对齐焦头烂额时,Black Forest Labs 直接用一套“联合学习”架构,把图像、视频和音频塞进了同一个模型。跑分全面超越,最长 20 秒原生 1080p,这不仅是参数竞赛,更是 AI 视频生成范式的分水岭。
当字节跳动的 Seedance 2.0 还在为多模态对齐焦头烂额时,Black Forest Labs 直接用一套“联合学习”架构,把图像、视频和音频塞进了同一个模型。跑分全面超越,最长 20 秒原生 1080p,这不仅是参数竞赛,更是 AI 视频生成范式的分水岭。
打开一段由 FLUX 3 生成的视频:一个女孩在阳光下回头,发丝根根分明,背景虚化自然,光影过渡平滑得像专业摄影机拍出来的。更重要的是,这段视频自带环境音——风吹过树叶的沙沙声,女孩转身时衣料的摩擦声。没有后期配音,没有音效叠加,AI 在生成画面的同时,把声音也“想”好了。
这就是 Black Forest Labs 在 8 月 5 日交出的答卷。距离 FLUX 3 以 Early Access 方式上线仅仅过去两周,这家来自德国的 AI 实验室便正式向公众开放了完整版本。与市面上其他视频生成模型不同,FLUX 3 采用了一套令人瞩目的统一架构,同时学习图像、视频和音频三种模态。这意味着它不仅仅是“会动的图”,而是真正理解了视听世界的内在关联。
在技术圈,跑分榜永远是硝烟最浓的战场。FLUX 3 的发布公告中,Black Forest Labs 直接放出了与字节跳动 Seedance 2.0 和 MiniMax H3 的对比数据。在多个核心指标上,FLUX 3 均实现领先——尤其是在视频质量(VQ)、运动真实感(Motion)和音频同步(Audio Sync)三个维度上,优势明显。
这并非偶然。FLUX 3 的“统一架构”理念,与传统的“图像模型+视频模型拼接”路线有着本质区别。传统方案中,视频生成通常需要先调用一个图像生成器,再通过额外的运动模块和音频模块进行“缝合”,每层之间都会有信息损耗。而 FLUX 3 从一开始就联合学习三种模态,让模型内部建立跨模态的深层关联——画面中的动作和声音在生成阶段就相互约束,而非事后补救。
这项技术路线的优势在实际应用中表现得淋漓尽致。官方技术报告中提到,FLUX 3 在文生视频、图生视频、视频生视频等任务上均表现优秀,甚至支持“输入视频与音频续写”——你可以给它一段无声的素材,它会自动补齐画面延续和配套音频。这种能力,在目前的竞品中几乎找不到对手。
时长,是视频生成模型绕不过去的坎。此前主流的视频生成模型,如 Runway Gen-3 和 Kling,单次生成时长普遍在 5-10 秒之间,超过这个范围,画面就会出现明显的漂移、形变或语义断裂。FLUX 3 将这一上限拉到了 20 秒,且保持原生 1080p 分辨率。
20 秒意味着什么?对于短视频创作者来说,一条抖音或快手的完整内容已经可以全覆盖;对于广告行业,一个 15 秒的 TVC 可以直接由 AI 生成;对于影视预演(Pre-visualization),导演可以一次性看到完整的镜头运动轨迹。FLUX 3 正在把 AI 视频生成从“片段级工具”推向“成片级生产力”。
当然,20 秒只是一个开始。Black Forest Labs 的博文中暗示,这背后的架构设计是“可扩展的”,未来进一步拉长生成时长只是算力问题,而非架构瓶颈。
FLUX 3 的另一个杀手锏是多镜头串联能力。此前的视频生成模型大多只能输出单一镜头,生成多镜头视频需要手动拼接,而每个镜头之间的风格和内容一致性很难保证。
FLUX 3 可以在一次生成中输出多镜头组成的完整视频片段。每个镜头之间的过渡自然,主体保持一致,甚至镜头语言(如景别变化、运动方向)也有内在逻辑。这意味着 AI 视频生成不仅仅是“一个漂亮镜头”,而是开始具备“导演思维”。
这一能力的实现,得益于其统一架构中的时序建模模块。该模块能够学习跨镜头的语义一致性——当镜头切换时,模型会自动保持主体外观、场景光照和音频连续性,而不需要用户额外提供参考图或描述。
值得注意的是,FLUX 3 目前并未开源。Black Forest Labs 选择了 API 接入的方式向开发者开放,这与他们此前开源 FLUX.1 系列的做法形成了鲜明对比。社区对此褒贬不一:有人认为闭源是商业化的必然选择,也有人担心这会让视频生成技术重新走向寡头垄断。
不过,FLUX 3 的发布无疑给整个行业注入了强心剂。当字节跳动、MiniMax 和 Black Forest Labs 纷纷将视频生成推向“原生 1080p+20 秒”的新高度,我们有理由相信,AI 视频生成的“iPhone 时刻”已经不远了。
从生成一张静态图片,到生成一段 5 秒的动图,再到如今的 20 秒原生 1080p 带音频视频——AI 内容生成的边界,正在以肉眼可见的速度向外扩张。而 FLUX 3,已经在这条赛道上画下了新的起跑线。
IT之家 - FLUX 3 视频 AI 生成模型正式上线:最长 20 秒原生 1080p,跑分优于 Seedance 2.0 | Black Forest Labs 官方公告
标签:AI视频生成, FLUX3, BlackForestLabs, 多模态, AI当字节跳动的 Seedance 2.0 还在为多模态对齐焦头烂额时,Black Forest Labs 直接用一套“联合学习”架构,把图像、视频和音频塞进了同一个模型。跑分全面超越,最长 20 秒原生 1080p,这不仅是参数竞赛,更是 AI 视频生成范式的分水岭。
当字节跳动的 Seedance 2.0 还在为多模态对齐焦头烂额时,Black Forest Labs 直接用一套“联合学习”架构,把图像、视频和音频塞进了同一个模型。跑分全面超越,最长 20 秒原生 1080p,这不仅是参数竞赛,更是 AI 视频生成范式的分水岭。
打开一段由 FLUX 3 生成的视频:一个女孩在阳光下回头,发丝根根分明,背景虚化自然,光影过渡平滑得像专业摄影机拍出来的。更重要的是,这段视频自带环境音——风吹过树叶的沙沙声,女孩转身时衣料的摩擦声。没有后期配音,没有音效叠加,AI 在生成画面的同时,把声音也“想”好了。
这就是 Black Forest Labs 在 8 月 5 日交出的答卷。距离 FLUX 3 以 Early Access 方式上线仅仅过去两周,这家来自德国的 AI 实验室便正式向公众开放了完整版本。与市面上其他视频生成模型不同,FLUX 3 采用了一套令人瞩目的统一架构,同时学习图像、视频和音频三种模态。这意味着它不仅仅是“会动的图”,而是真正理解了视听世界的内在关联。
在技术圈,跑分榜永远是硝烟最浓的战场。FLUX 3 的发布公告中,Black Forest Labs 直接放出了与字节跳动 Seedance 2.0 和 MiniMax H3 的对比数据。在多个核心指标上,FLUX 3 均实现领先——尤其是在视频质量(VQ)、运动真实感(Motion)和音频同步(Audio Sync)三个维度上,优势明显。
这并非偶然。FLUX 3 的“统一架构”理念,与传统的“图像模型+视频模型拼接”路线有着本质区别。传统方案中,视频生成通常需要先调用一个图像生成器,再通过额外的运动模块和音频模块进行“缝合”,每层之间都会有信息损耗。而 FLUX 3 从一开始就联合学习三种模态,让模型内部建立跨模态的深层关联——画面中的动作和声音在生成阶段就相互约束,而非事后补救。
这项技术路线的优势在实际应用中表现得淋漓尽致。官方技术报告中提到,FLUX 3 在文生视频、图生视频、视频生视频等任务上均表现优秀,甚至支持“输入视频与音频续写”——你可以给它一段无声的素材,它会自动补齐画面延续和配套音频。这种能力,在目前的竞品中几乎找不到对手。
时长,是视频生成模型绕不过去的坎。此前主流的视频生成模型,如 Runway Gen-3 和 Kling,单次生成时长普遍在 5-10 秒之间,超过这个范围,画面就会出现明显的漂移、形变或语义断裂。FLUX 3 将这一上限拉到了 20 秒,且保持原生 1080p 分辨率。
20 秒意味着什么?对于短视频创作者来说,一条抖音或快手的完整内容已经可以全覆盖;对于广告行业,一个 15 秒的 TVC 可以直接由 AI 生成;对于影视预演(Pre-visualization),导演可以一次性看到完整的镜头运动轨迹。FLUX 3 正在把 AI 视频生成从“片段级工具”推向“成片级生产力”。
当然,20 秒只是一个开始。Black Forest Labs 的博文中暗示,这背后的架构设计是“可扩展的”,未来进一步拉长生成时长只是算力问题,而非架构瓶颈。
FLUX 3 的另一个杀手锏是多镜头串联能力。此前的视频生成模型大多只能输出单一镜头,生成多镜头视频需要手动拼接,而每个镜头之间的风格和内容一致性很难保证。
FLUX 3 可以在一次生成中输出多镜头组成的完整视频片段。每个镜头之间的过渡自然,主体保持一致,甚至镜头语言(如景别变化、运动方向)也有内在逻辑。这意味着 AI 视频生成不仅仅是“一个漂亮镜头”,而是开始具备“导演思维”。
这一能力的实现,得益于其统一架构中的时序建模模块。该模块能够学习跨镜头的语义一致性——当镜头切换时,模型会自动保持主体外观、场景光照和音频连续性,而不需要用户额外提供参考图或描述。
值得注意的是,FLUX 3 目前并未开源。Black Forest Labs 选择了 API 接入的方式向开发者开放,这与他们此前开源 FLUX.1 系列的做法形成了鲜明对比。社区对此褒贬不一:有人认为闭源是商业化的必然选择,也有人担心这会让视频生成技术重新走向寡头垄断。
不过,FLUX 3 的发布无疑给整个行业注入了强心剂。当字节跳动、MiniMax 和 Black Forest Labs 纷纷将视频生成推向“原生 1080p+20 秒”的新高度,我们有理由相信,AI 视频生成的“iPhone 时刻”已经不远了。
从生成一张静态图片,到生成一段 5 秒的动图,再到如今的 20 秒原生 1080p 带音频视频——AI 内容生成的边界,正在以肉眼可见的速度向外扩张。而 FLUX 3,已经在这条赛道上画下了新的起跑线。
这个事件/技术的核心价值在于它推动了一个重要方向的发展。作为从业者/关注者,我们既要看到短期的影响,也要理解其长期意义。
IT之家 - FLUX 3 视频 AI 生成模型正式上线:最长 20 秒原生 1080p,跑分优于 Seedance 2.0 | Black Forest Labs 官方公告
原文链接:https://www.ithome.com/0/986/470.htm【开场 Hook(0-5秒)】
当字节跳动的 Seedance 2.0 还在为多模态对齐焦头烂额时,Black Forest Labs 直接用一套“联合学习”架构,把图像、视频和音频塞进了同一个模型。跑分全面超越,最长 20 秒原生 1080p,这不仅是参数竞赛,更是 AI 视频生成范式的分水岭。
【核心内容(5-45秒)】
FLUX 3 正式上线:20 秒原生 1080p 视频,AI 视频生成迎来“统一架构”时代
(根据文章正文提炼 3-5 个关键点,口语化表达)【结尾引导(45-60秒)】
如果你觉得有用,点赞收藏,评论区告诉我你的看法!
FLUX 3 正式上线:20 秒原生 1080p 视频,AI 视频生成迎来“统一架构”时代 🔥
当字节跳动的 Seedance 2.0 还在为多模态对齐焦头烂额时,Black Forest Labs 直接用一套“联合学习”架构,把图像、视频和音频塞进了同一个模型。跑分全面超越,最长 20 秒原生 1080p,这不仅是参数竞赛,更是 AI 视频生成范式的分水岭。
💡 关键信息:
#AI视频生成 #FLUX3 #BlackForestLabs #多模态 #AI
#科技资讯 #前沿技术
点击「复制」获取平台专属文案,到各平台编辑器(App/网页)粘贴即可发布。
有密钥的 4 个平台(微信服务号 / 头条 / 百家号 / 微博)可自动发布,密钥填好后自动点亮。
| 平台 | 状态 | 操作 |
|---|---|---|
| 公众号 | 🔑 待配置密钥 | |
| 知乎 | 📋 手动复制 | |
| 抖音 | 📋 手动复制 | |
| 小红书 | 📋 手动复制 |