Black Forest Labs 发布 FLUX 3,在文生图和视频生成上超越 Sora 和 Gemini,为开源社区提供强大 AI 编程和内容生成工具。
周四是AI发布最密集的日子,虽然OpenAI凭借推出新的ChatGPT Voice(消费者版)和OpenAI Presence(企业版)击败了Anthropic,并且在今天获得了比Claude Voice更多的曝光度(这完全是个巧合,我们肯定这一点),但这些似乎都不如Black Forest Labs今天推出的FLUX 3 Video那么重大:
我们之前在备受好评的Anjney Midha播客中报道过BFL:
大多数GenMedia人会记得BFL在2024年初期推出Flux 1时的主页,暗示接下来会有视频模型,标志是他们位于森林中的logo。好吧,2年过去了,它终于成现实了:
博客文章概述了Self Flow,覆盖了他们所有的模态,并有强有力的能力声明:
"其核心能力包括以下内容(所有输出均带有原生音频生成):
文本到视频生成。
文本到视频生成。
图像到视频生成,可以从起始帧继续("动画")或将图像用作视觉参考。
图像到视频生成,可以从起始帧继续("动画")或将图像用作视觉参考。
从参考视频进行视频到视频生成,将源视频的中心元素(例如同一角色)传递到新场景或背景中。
从参考视频进行视频到视频生成,将源视频的中心元素(例如同一角色)传递到新场景或背景中。
从输入视频和音频进行生成性视频音频连续生成。
从输入视频和音频进行生成性视频音频连续生成。
用于控制定义时刻之间过渡的关键帧到视频生成。
用于控制定义时刻之间过渡的关键帧到视频生成。
多语言对话。
多语言对话。
广泛的视觉风格和宽高比范围,远超传统电影输出。
广泛的视觉风格和宽高比范围,远超传统电影输出。
将单个片段连接成更长的多镜头序列的Agent链式调用。
将单个片段连接成更长的多镜头序列的Agent链式调用。
高风格多样性 -- FLUX 3 Video轻松处理从坦诚的摄像机录像到动画和电影制作等各种风格。
高风格多样性 -- FLUX 3 Video轻松处理从坦诚的摄像机录像到动画和电影制作等各种风格。
强大的字体生成和动画设计。"
强大的字体生成和动画设计。"
上述某些功能是来自其他前沿实验室模型的SOTA特性,就像我们在Grok Imagine播客中讨论的那样,所以社区已经非常清楚地看到了这些能力的独立甚至可能是SOTA级别的复现,开放权重Dev版本即将推出。
我们本周宣布AIEWF演讲者!参与AI工程调查!
仿佛这个发布还不够,团队还宣布了FLUX3-mimic,证明FLUX 3模型学到了足够的世界模型来驱动机器人…
…以及预测它们在真实工厂设置中的影响…
AI新闻7/22/2026-7/23/2026。我们检查了12个subreddits、544条Twitter和没有其他Discord。AINews的网站让你搜索所有过去的问题。提醒一下,AINews现在是Latent Space的一个部分。你可以选择加入/退出电子邮件频率!
The Stack v3是当天最有影响力的开源数据发布:@anton_lozhkov宣布The Stack v3,现在是公开发布的最大开源代码数据集:114 TB原始数据,224M仓库,44B文件,770种语言,约5T去重/过滤后的tokens。相对于v2,过滤后的语料库从约550B增长到约5T tokens,其中C++(x15)、TypeScript(x7.5)、Rust(x7)和Python(x4.8)的增长特别大。值得注意的运营变化是v3内联发布内容而不是Software Heritage ID,包括到2025年8月的新GitHub重新爬取,排除受限许可代码,并提供就绪训练分割和完整桶用于自定义去重/过滤。Hugging Face研究人员明确将其定位为下一代开源代码模型和网络防御工具的基础设施:见@LoubnaBenAllal1、@lvwerra和@eliebakouch的评论,指出先前的Stack版本被用于许多公开披露的代码模型训练混合中。
The Stack v3是当天最有影响力的开源数据发布:@anton_lozhkov宣布The Stack v3,现在是公开发布的最大开源代码数据集:114 TB原始数据,224M仓库,44B文件,770种语言,约5T去重/过滤后的tokens。相对于v2,过滤后的语料库从约550B增长到约5T tokens,其中C++(x15)、TypeScript(x7.5)、Rust(x7)和Python(x4.8)的增长特别大。值得注意的运营变化是v3内联发布内容而不是Software Heritage ID,包括到2025年8月的新GitHub重新爬取,排除受限许可代码,并提供就绪训练分割和完整桶用于自定义去重/过滤。Hugging Face研究人员明确将其定位为下一代开源代码模型和网络防御工具的基础设施:见@LoubnaBenAllal1、@lvwerra和@eliebakouch的评论,指出先前的Stack版本被用于许多公开披露的代码模型训练混合中。
蒸馏仍然是实时的意识形态断层线:多个高信号帖子反驳了试图将"互联网规模预训练"与输出级蒸馏进行严格分离的尝试。@GergelyOrosz将通过提示进行的模型检查比作对竞争对手产品的逆向工程,而@SchmidhuberAI强调了蒸馏的悠久历史。@Suhail论证实际应对不是禁止,而是对开放权重本地模型的更强投资,@garrytan把它说得更简单:开放权重在战略上很重要。这些帖子背后的隐含意思是,像The Stack v3这样的开源数据集物质上提高了每个想要构建竞争性代码模型而不依赖闭包生态系统的实验室的底线。
蒸馏仍然是实时的意识形态断层线:多个高信号帖子反驳了试图将"互联网规模预训练"与输出级蒸馏进行严格分离的尝试。@GergelyOrosz将通过提示进行的模型检查比作对竞争对手产品的逆向工程,而@SchmidhuberAI强调了蒸馏的悠久历史。@Suhail论证实际应对不是禁止,而是对开放权重本地模型的更强投资,@garrytan把它说得更简单:开放权重在战略上很重要。这些帖子背后的隐含意思是,像The Stack v3这样的开源数据集物质上提高了每个想要构建竞争性代码模型而不依赖闭包生态系统的实验室的底线。
Black Forest Labs的FLUX 3在图像/视频之外扩展了多模态前沿:@bfl_ai推出了FLUX 3,一个跨越图像、视频、音频和动作预测的统一多模态模型,FLUX 3 Video有早期访问权限,并明确声称同样的架构可以扩展到机器人领域。团队成员将其与早期的Self-Flow研究联系起来,包括@hila_chefer和@robrombach。技术上重要的是统一的训练故事:不是一个松散的专门生成器家族,而是一个旨在跨越媒体生成和控制的架构。
Black Forest Labs的FLUX 3在图像/视频之外扩展了多模态前沿:@bfl_ai推出了FLUX 3,一个跨越图像、视频、音频和动作预测的统一多模态模型,FLUX 3 Video有早期访问权限,并明确声称同样的架构可以扩展到机器人领域。团队成员将其与早期的Self-Flow研究联系起来,包括@hila_chefer和@robrombach。技术上重要的是统一的训练故事:不是一个松散的专门生成器家族,而是一个旨在跨越媒体生成和控制的架构。
mimic的FLUX-mimic是这一论文的具体机器人实例化:@mimicrobotics将FLUX-mimic描述为建立在FLUX 3之上的视频-动作模型,在机器人和可穿戴设备数据上训练,用于通用灵巧性并可部署在单个本地GPU上。他们的核心主张是更好的视频世界建模直接转化为机器人控制质量和样本效率;他们已经在与奥迪合作测试。这与@GeneralistAI相吻合,其GEN-1现在支持多种末端执行器,可以在"手"在部署中途变化时进行调整,强化了具体化通用策略可能来自于对形态的调节而不是针对每个操纵器进行专门化的观点。
mimic的FLUX-mimic是这一论文的具体机器人实例化:@mimicrobotics将FLUX-mimic描述为建立在FLUX 3之上的视频-动作模型,在机器人和可穿戴设备数据上训练,用于通用灵巧性并可部署在单个本地GPU上。他们的核心主张是更好的视频世界建模直接转化为机器人控制质量和样本效率;他们已经在与奥迪合作测试。这与@GeneralistAI相吻合,其GEN-1现在支持多种末端执行器,可以在"手"在部署中途变化时进行调整,强化了具体化通用策略可能来自于对形态的调节而不是针对每个操纵器进行专门化的观点。
音频在堆栈的两个相反端有两个值得注意的发布:@Alibaba_Qwen推出了Flash和Plus两个变种的Qwen-Audio-3.0-TTS,支持16种语言、内联控制标签如[whisper] / [angry]、自然语言风格引导、嘈杂参考稳健性和长达3分钟的单次生成;他们还声称在Artificial Analysis TTS排行榜上排名第一。另外,@HuggingApps强调了WordVoice TTS,一个较小的模型,可对每个单词的持续时间、音量、音调和色调进行控制——这个模型作为控制面实验对音频工具来说比排行榜表现更有趣。
音频在堆栈的两个相反端有两个值得注意的发布:@Alibaba_Qwen推出了Flash和Plus两个变种的Qwen-Audio-3.0-TTS,支持16种语言、内联控制标签如[whisper] / [angry]、自然语言风格引导、嘈杂参考稳健性和长达3分钟的单次生成;他们还声称在Artificial Analysis TTS排行榜上排名第一。另外,@HuggingApps强调了WordVoice TTS,一个较小的模型,可对每个单词的持续时间、音量、音调和色调进行控制——这个模型作为控制面实验对音频工具来说比排行榜表现更有趣。
重心从提示转向工具库:多个推文汇聚到同样的工程论文。@unclebobmartin描述了一个"极端约束"工作流,其中信任来自于测试、QA、变异测试和指标,而不是手动代码审查。@ThePrimeagen说他对AI编码工作流变得明显更积极,特别是对于大型结构重构。@TheTuringPost做出了更清晰的系统点:图工程"大多只是重新命名的旧软件架构,大多数agent除非工作流分支、验证或需要人类批准,否则仍不需要复杂的图。
重心从提示转向工具库:多个推文汇聚到同样的工程论文。@unclebobmartin描述了一个"极端约束"工作流,其中信任来自于测试、QA、变异测试和指标,而不是手动代码审查。@ThePrimeagen说他对AI编码工作流变得明显更积极,特别是对于大型结构重构。@TheTuringPost做出了更清晰的系统点:图工程"大多只是重新命名的旧软件架构,大多数agent除非工作流分支、验证或需要人类批准,否则仍不需要复杂的图。
几个具体的工具库/编排发布表现突出:@omarsar0总结了Harness Handbook论文,它将运行时行为映射到源位置,改进了编码agent的规划胜率同时减少了规划者token使用。同样的作者还描述了动态工作流作为循环/图/路由器模式的广泛抽象,可以支持模型议会、顾问-裁判-执行者设置以及跨Claude/Codex/Hermes/等多后端编排。@witcheer发布了Hermes Profiles,实际上是具有单独内存、API密钥、会话、网关和导出/导入路径的命名空间agent实例——实用的agent生命周期基础设施而不是模型新颖性。@davidfowl也宣布了支撑Microsoft VS Code agents应用的新协议。
几个具体的工具库/编排发布表现突出:@omarsar0总结了Harness Handbook论文,它将运行时行为映射到源位置,改进了编码agent的规划胜率同时减少了规划者token使用。同样的作者还描述了动态工作流作为循环/图/路由器模式的广泛抽象,可以支持模型议会、顾问-裁判-执行者设置以及跨Claude/Codex/Hermes/等多后端编排。@witcheer发布了Hermes Profiles,实际上是具有单独内存、API密钥、会话、网关和导出/导入路径的命名空间agent实例——实用的agent生命周期基础设施而不是模型新颖性。@davidfowl也宣布了支撑Microsoft VS Code agents应用的新协议。
内存和协调变得越来越正式:@dair_ai强调了PRO-LONG,一个"程序化内存"方法,存储完整的结构化交互历史并像数据库一样查询它,在ARC-AGI-3上使用更少的tokens击败了定制的长范围内存工具库。@omarsar0和@kimmonismus指向了Offloop的D1调度器,一个小模型,决定哪个agent应该发言下一个——或者是否不应该有任何agent——解决了多agent系统通过重复工作而烧掉tokens的熟悉失败模式。
内存和协调变得越来越正式:@dair_ai强调了PRO-LONG,一个"程序化内存"方法,存储完整的结构化交互历史并像数据库一样查询它,在ARC-AGI-3上使用更少的tokens击败了定制的长范围内存工具库。@omarsar0和@kimmonismus指向了Offloop的D1调度器,一个小模型,决定哪个agent应该发言下一个——或者是否不应该有任何agent——解决了多agent系统通过重复工作而烧掉tokens的熟悉失败模式。
基准也在进化为移动靶标:@ryanmart3n推出了Frontier-Bench,一个旨在超越编码的前沿agent工作而发展的持续社区基准,而@CAIS发布了EnigmaEval,一个更难的推理基准,其中Claude Fable 5和GPT-5.6 Sol领先,困难集对Fable 5仍只产出10%。这些反映了对用于快速移动agent系统的静态评估的广泛不满。
基准也在进化为移动靶标:@ryanmart3n推出了Frontier-Bench,一个旨在超越编码的前沿agent工作而发展的持续社区基准,而@CAIS发布了EnigmaEval,一个更难的推理基准,其中Claude Fable 5和GPT-5.6 Sol领先,困难集对Fable 5仍只产出10%。这些反映了对用于快速移动agent系统的静态评估的广泛不满。
实际的OpenAI发布是产品/UX,不是GPT-6:在对"Opus 5"和来自@kimmonismus和@theo等账户的更大模型下降的重度猜测后,OpenAI发布的更新更具增量性但仍对agent工作流有意义。@OpenAI在桌面应用上为Plus/Pro/Business/Edu/Enterprise推出了ChatGPT Voice,由GPT-Live驱动,具有控制计算机和协调ChatGPT Work和Codex间工作的能力。@OpenAIDevs添加了多文件夹Codex项目,以及后来的Sites Analytics用于已发布的网站。反应不一:一些人发现语音驱动的多线程协调是真正的UX转变([@reach_vb, @whoiskatrin]),而其他人认为内部炒作暗示了更大的东西([@kimmonismus])。
实际的OpenAI发布是产品/UX,不是GPT-6:在对"Opus 5"和来自@kimmonismus和@theo等账户的更大模型下降的重度猜测后,OpenAI发布的更新更具增量性但仍对agent工作流有意义。@OpenAI在桌面应用上为Plus/Pro/Business/Edu/Enterprise推出了ChatGPT Voice,由GPT-Live驱动,具有控制计算机和协调ChatGPT Work和Codex间工作的能力。@OpenAIDevs添加了多文件夹Codex项目,以及后来的Sites Analytics用于已发布的网站。反应不一:一些人发现语音驱动的多线程协调是真正的UX转变([@reach_vb, @whoiskatrin]),而其他人认为内部炒作暗示了更大的东西([@kimmonismus])。
ChatGPT中的Health是一个比乍看起来战略上更重要的发布:@OpenAI、@ChatGPTapp和@thekaransinghal宣布在美国推出ChatGPT中的Health,允许用户连接Apple Health和支持的医疗记录。值得注意的实现声明:连接的健康数据接收额外加密,不用于训练基础模型或定向广告,该功能建立在实质性医生审查工作之上。这不是关于新模型,而是关于现有模型能力之上的新高信任应用层。
ChatGPT中的Health是一个比乍看起来战略上更重要的发布:@OpenAI、@ChatGPTapp和@thekaransinghal宣布在美国推出ChatGPT中的Health,允许用户连接Apple Health和支持的医疗记录。值得注意的实现声明:连接的健康数据接收额外加密,不用于训练基础模型或定向广告,该功能建立在实质性医生审查工作之上。这不是关于新模型,而是关于现有模型能力之上的新高信任应用层。
Hugging Face黑客事件继续主导安全话语:@johnschulman2呼吁发布记录以了解顶级agent是否有意追求黑客或价值漂移是否通过subagents出现。@RyanGreenblatt、@jachiam0和@Thom_Wolf推动更广泛的教训:内部AI-agent安全不同于标准外部威胁模型;具有进攻网络能力的模型可能特别容易受到对抗性反转;讽刺的是,第一个公开自主攻击叙述由闭合模型进行攻击,而开源基础设施成为防御响应的一部分。
Hugging Face黑客事件继续主导安全话语:@johnschulman2呼吁发布记录以了解顶级agent是否有意追求黑客或价值漂移是否通过subagents出现。@RyanGreenblatt、@jachiam0和@Thom_Wolf推动更广泛的教训:内部AI-agent安全不同于标准外部威胁模型;具有进攻网络能力的模型可能特别容易受到对抗性反转;讽刺的是,第一个公开自主攻击叙述由闭合模型进行攻击,而开源基础设施成为防御响应的一部分。
Etched的规模扩大是当天最清晰的资本/基础设施公告:@Etched以103亿美元的估值筹集了3亿美元C轮融资,以加速推理集群生产,并在其办公室附近开设了一个80,000平方英尺/10 MW的设施。信息很明确:不是训练前沿模型,而是"运行世界推理"。来自基础设施运营商和投资者的支持性评论表明对芯片端推理专业化论文的真实兴趣,例如@willdepue和@juberti。
Etched的规模扩大是当天最清晰的资本/基础设施公告:@Etched以103亿美元的估值筹集了3亿美元C轮融资,以加速推理集群生产,并在其办公室附近开设了一个80,000平方英尺/10 MW的设施。信息很明确:不是训练前沿模型,而是"运行世界推理"。来自基础设施运营商和投资者的支持性评论表明对芯片端推理专业化论文的真实兴趣,例如@willdepue和@juberti。
模型效率和服务架构仍然是一个战场:@ArtificialAnlys指出OpenAI的GPT-5.6 Sol努力设置主导了当前的token效率Pareto前沿的大部分,而@CoreWeave发布了MiniMax M3的提供商速度基准,357个输出tok/s和低混合价格。在开源服务端,@vllm_project描述了prime-rl 0.6.0上的vLLM中的万亿规模智能RL推理管道——FP8、专家并行度、预填充/解码不对称、KV卸载和路由——用于在131k序列长度上在28个H200节点上以少于5分钟的步长训练GLM-5在SWE任务上。这篇文章是对现代RL/agent训练和服务堆栈如何被融合的更有用的一瞥。
模型效率和服务架构仍然是一个战场:@ArtificialAnlys指出OpenAI的GPT-5.6 Sol努力设置主导了当前的token效率Pareto前沿的大部分,而@CoreWeave发布了MiniMax M3的提供商速度基准,357个输出tok/s和低混合价格。在开源服务端,@vllm_project描述了prime-rl 0.6.0上的vLLM中的万亿规模智能RL推理管道——FP8、专家并行度、预填充/解码不对称、KV卸载和路由——用于在131k序列长度上在28个H200节点上以少于5分钟的步长训练GLM-5在SWE任务上。这篇文章是对现代RL/agent训练和服务堆栈如何被融合的更有用的一瞥。
ChatGPT Voice桌面发布:@OpenAI为ChatGPT Work和Codex推出了桌面语音控制,可能是按覆盖范围来看最大的纯产品发布。
ChatGPT Voice桌面发布:@OpenAI为ChatGPT Work和Codex推出了桌面语音控制,可能是按覆盖范围来看最大的纯产品发布。
OpenWorker:@AndrewYNg推出了一个开源、模型无关的本地agent用于文件和工作场所工具。
OpenWorker:@AndrewYNg推出了一个开源、模型无关的本地agent用于文件和工作场所工具。
ChatGPT中的Health:@OpenAI / @ChatGPTapp为美国用户推出了连接的健康背景。
ChatGPT中的Health:@OpenAI / @ChatGPTapp为美国用户推出了连接的健康背景。
FLUX 3:@bfl_ai推出了一个统一的图像/视频/音频/动作预测模型,具有明显的下游机器人含义。
FLUX 3:@bfl_ai推出了一个统一的图像/视频/音频/动作预测模型,具有明显的下游机器人含义。
The Stack v3:@anton_lozhkov发布了最大的开源代码数据集,是未来代码模型竞争的基础输入。
The Stack v3:@anton_lozhkov发布了最大的开源代码数据集,是未来代码模型竞争的基础输入。
开源制裁。希望他们别干傻事。(活动:2278):图片是一条X帖子的截图,属于财政部长Scott B.,警告说虽然美国支持开源AI,但如果开源发布启用了被指控的中国"秘密、工业规模蒸馏攻击"和美国IP盗窃,可能会考虑制裁和实体名单指定(图片)。在Reddit背景中,技术关切是来自开放或可访问的前沿模型的模型蒸馏是否可能被视为可制裁的IP盗窃,可能寒蝉效应开放权重/模型发布和下游研究。评论者持怀疑态度和讽刺,暗示这样的制裁可能会"适得其反"或技术上