阿里推出 2.4T 参数 Qwen 3.8-Max,在代码/视觉/文本三维竞速领先 Fable 5;更关键的是展示了自进化 Agent 框架 16 天内自主完成代码生成、测试、反馈循环的全工程闭环能力。
🤖💻 AI 每日速报 — 2026 年 8 月 4 日
阿里巴巴于 8 月 3 日发布了迄今规模最大的旗舰模型 Qwen3.8-Max:总参数量达 2.4 万亿,但每个 token 仅激活 950 亿参数,采用稀疏混合专家(MoE)架构与混合注意力机制。它拥有 100 万 token 的上下文窗口和原生视觉能力,各项榜单表现也越来越不容忽视——Text Arena 排名第五、Vision Arena 排名第二、CodeArena 排名第四,并在 PaperBench 上取得 93.0 分,高于 Fable 5 的 88.8 分。目前 API 已在阿里云 Model Studio 上线,模型权重计划于下周与 Qwen3.8-27B 一同开放。
最受关注、也被人们反复引用的是旗舰演示。模型接到的任务是:从一个空文件夹开始,构建一套能够自我演进的 Agent 框架。它独立运行了大约 16 天的工程循环——生成代码、测试、预览、读取日志,并不断吸收用户反馈和社区最佳实践——最终交付了可实际运行的自我演进 Agent 框架「oh-my-cli」。该项目已在 GitHub 开源,完整运行历史也全部公开。团队还报告了一次长达 125 小时的自主研究任务:模型复现了已发表的论文,并将 AIME24 成绩进一步提升了 2.7 分;在另一套量化工作流中,模型协调了约 330 个 sub-agent,完成了约 6,000 次因子回测。
这次发布的定价策略,看起来像是对闭源旗舰模型发起的一场协同挤压。在中国市场,Qwen3.8 每百万输入 token 收费 12 元,输出 token 收费 36 元,缓存命中仅需 1.5 元;在国际市场,其价格大约只有 Opus 5 的 40% 和 24%。同一天,阿里巴巴还推出了一站式办公 Agent 产品 QwenWork,用户可以通过 PC 客户端和钉钉使用该模型。开源权重模型之间的竞争,正在不断压缩闭源实验室为同等能力定价的空间。
— 阿里云 · Qwen · The Paper
🔗 阿里云 — Qwen3.8-Max 发布 · Qwen · The Paper 报道
OpenAI 于 8 月 3 日发布了一篇深入的工程技术文章,解释其第三代语音系统 GPT-Live 如何从轮流对话演进为流式全双工交互。模型可以同时聆听和说话;过去用于判断 Assistant 何时可以开始发言的经典「轮次检测器」已经被移除。音频以连续信号的形式直接流入模型;当任务需要更深入的推理或调用工具时,GPT-Live 会在后台将任务移交给 GPT-5.5 等前沿模型,同时不中断实时对话。
真正让这篇文章值得如此篇幅的,是其底层工程实现。推理引擎已使用 Go 重写,取代了原来的 Python asyncio 流水线——现在帧传输延迟的 p95 已经与旧系统的 p50 相当。传输层基于 WebRTC,并通过时钟漂移处理机制拉伸或压缩音频,以维持实时播放。一套名为 WARP(WebRTC Abridged Roundtrip Protocol)的新协议,将媒体会话启动过程从六次网络往返缩短至一次;Instant Connect 则会预先协商 SDP 参数,使会话能够通过单个 UDP 数据包启动。这套技术栈还支持有状态推理,包括模型实例的热替换、携带上下文的 prefill,以及不会中断媒体流的上下文压缩。
这套架构目前已经为 ChatGPT 桌面应用的计算机控制功能,以及 ChatGPT 内部的 Agent 协作提供支持。OpenAI 表示,它也将成为即将推出的 GPT-Live API 的底层基础。对于开发者而言,实际意义在于:实时语音正在成为一种任务委派界面——便宜、快速的模型负责维持对话,而昂贵的推理则在关键路径之外完成,用户甚至不会察觉背后发生过模型交接。
🔗 OpenAI — 使用 GPT-Live 实现连续语音交互
Anthropic 于 7 月 28 日公布了 Claude Mythos Preview 的首批成果。它攻击的是密码学算法内部的数学结构,而不只是算法实现。面对 HAWK——一个经过两年、两轮专家评审后仍然留在 NIST 流程中的后量子签名候选方案——Mythos 在格结构中发现了一个非平凡自同构,并在大约 60 小时内将该方案的有效密钥强度削弱了一半。面对缩减至七轮的 AES 版本,它发明了一条名为「Möbius Bridge」的捷径,消除了一个 256 路查找操作,使目前已知最强的理论攻击提速 200 至 800 倍。
这两项成果都不会影响生产系统。HAWK 尚未部署,而针对 AES 的攻击运行在选择明文模型中,需要假设攻击者拥有约 2^105 个选择明文——Anthropic 自己也称其完全不具备实用性。此后,HAWK 团队已经将该方案撤出 NIST 流程。每项成果的研发都消耗了大约 10 万美元的 API 费用,且大部分工作由模型自主完成:一名研究人员搭建了一套循环,让 Mythos 用三天时间和约 10 亿个输出 token 探索针对 AES 的攻击。
这篇文章中最值得关注的部分,是 Anthropic 对验证工作的坦率说明。Mythos 用一周时间发现了 AES 攻击方法;随后,两名研究人员用了将近一个月,才确信这一结果是正确的。该公司表示,近期大部分研究时间都花在验证模型输出上。为了让这个领域的进展保持可衡量,Anthropic 与苏黎世联邦理工学院、特拉维夫大学和海法大学共同构建了 CryptanalysisBench。对于所有关注安全研究的人来说,结论很明确:发现本身已不再是瓶颈,验证发现才是。
— Anthropic · CyberScoop
🔗 Anthropic Research — 发现密码学弱点 · CyberScoop
Safe Superintelligence Inc. 与 NVIDIA 于 7 月 27 日宣布建立长期战略合作伙伴关系。NVIDIA 对 SSI 进行了投资——彭博社估计金额约为 50 亿美元,但两家公司均未确认具体数字——并向 SSI 开放下一代 Vera Rubin 平台。SSI 表示,这将在 12 个月内让其算力提升一个数量级。两家公司还将利用 SSI 的研究洞察,共同推动 NVIDIA 当前及未来计算平台的发展。
不同寻常的是 NVIDIA 为此获得了什么。Jensen Huang 表示,公司是在「罕见地获准了解该公司严密保密的研究成果后」,才决定建立这项合作关系。自 Ilya Sutskever 和 Daniel Levy 于 2024 年创立 SSI 以来,该公司已经近乎沉默地运作了两年,并从 a16z、DST Global、Greenoaks 和 Sequoia 等机构筹集了约 30 亿美元,据称估值达到 320 亿美元。Sutskever 的评论一如既往地直截了当:「我们拥有值得扩大规模的研究,而获得一台大型 NVIDIA 计算机,将让我们能够这样做。」
通过此类交易,NVIDIA 在行业中的角色正在持续变化。它不再只是向任何上门的客户出售芯片,而是在选择哪些实验室能够提前使用下一代平台,并投资它所看好的团队。对于 SSI 这样的实验室而言,其整个主张都建立在一个长期押注之上:开发与人类目标一致的超级智能。这笔交易让 AI 领域最稀缺的资源——下一代算力——从成本明细中的一个项目,转变为一项战略资产。
— NVIDIA · SSI · TechCrunch
🔗 NVIDIA Newsroom — 与 SSI 的合作 · SSI · TechCrunch
Fireworks AI 宣布完成 15.05 亿美元 D 轮融资,公司估值达到 175 亿美元。本轮融资由 Atreides Management、Index Ventures 和 TCV 领投,NVIDIA、Lightspeed、Bessemer、Menlo Ventures 等机构参投。与本轮融资一同公布的关键数据包括:年化收入运行率突破 10 亿美元,是上一年的五倍;每日处理的 token 超过 40 万亿,高于此前的 15 万亿——其中 95% 的用量来自专业化、经过 fine-tuning 的模型,而不是通用 API 访问。
该公司由 Lin Qiao 及多位来自 Meta 和 Google Brain 的联合创始人于 2022 年成立,运营着一个推理云平台,企业可以使用自己的数据对开源模型进行 fine-tuning,并将其投入生产环境。其客户名单包括 Uber、Shopify、GitLab、MongoDB,以及基于该平台构建的法律和编程工具——Harvey 与 Cursor。Qiao 用成本解释了企业为何选择迁移:「与质量相当的闭源模型相比,我们的成本要低五到十倍。」
这是 AI 基础设施历史上推理层规模最大的一轮融资,也直接反驳了一个长期存在的看空观点:随着模型价格下降,优化层公司终将走向商品化。上述数字给出的反向证据是:更便宜的模型吸引了更多企业工作负载进入 AI 基础设施,反而让高质量地运行这些模型变得更有价值,而不是价值更低。对于整个市场来说,Fireworks 在 95% 用量来自专业化模型的情况下达到 10 亿美元 ARR,是迄今最明确的信号:AI 基础设施的利润正在集中到拥有并运行模型这一环节,而不是按 token 租用前沿智能。
— Fireworks AI · Yahoo Finance
🔗 Fireworks — D 轮融资公告 · Yahoo Finance
三菱汽车与东京大学衍生的机器人创业公司 Highlanders 签署了一项基本协议,双方将共同开发并部署制造业人形机器人。按照计划,这些人形机器人将首先进入三菱汽车自己的工厂,积累真实世界的运行数据和实践经验;机器人计划从 2027 年开始在三菱京都工厂投入生产。三菱汽车提供制造专业能力,Highlanders 则贡献围绕 physical AI 应用构建的机器人和 AI 技术栈。
双方公开说明的推动因素,是日本面临的人口结构现实。三菱汽车将这项合作定位为应对工业劳动力短缺的实际方案:通过机器人系统保存并传承熟练制造技术,同时还可能由此开辟一条新的业务线。这是日本传统汽车制造商向规模化人形机器人领域迈出的较为具体的一步。全球其他汽车制造商也在进行类似探索,并同样将工厂视为人形机器人的第一个真正落地场景。
协议目前尚未说明机器人的规格、生产数量,也没有披露最先应用于哪些工厂任务——随着合作向 2027 年目标推进,这些信息预计将陆续公布。但目前已经可以看出一种值得关注的趋势:汽车制造商不再将人形机器人视为研究演示项目,而是开始将其当作劳动力基础设施;工厂车间则成为验证场,在这里,相关经济账终于能够真正算清楚。
— 三菱汽车 · Highlanders · Humanoid Press
🔗 三菱汽车 · Humanoid Press · Highlanders
OpenAI 于 7 月 30 日发布了一篇客户案例,介绍由 ANA Holdings 分拆成立的 AI 客服公司 avatarin,以及它为山田电机网上商城打造的「Kurashi-Marugoto AI Agent」。该 Agent 基于 OpenAI GPT-Realtime 构建,可以全天候使用多种语言运行,通过语音回答产品相关问题。最突出的设计选择是:它不会只是等待用户下达指令,而会主动提出后续问题。在为期两周的公开活动中,约有 3 万人使用了该 Agent,使用后调查中的正面评价比例达到 92%。
其架构遵循了一种值得借鉴的模式:RAG 让产品回答以准确的商品目录数据为依据,GPT-Realtime 则保证对话能够快速响应;山田电机的销售知识被编码进对话流程,因此当购物者更改需求或偏离原本话题时,Agent 也能灵活调整;主动提问的设计,则让交互从简单问答转向引导式探索。avatarin CEO Akira Fukabori 对此的概括是:「顾客不想要 chatbot,他们想要的是智能。‘我家有四口人,需要一台冰箱,但厨房很小,我应该选哪一款?’」
一个值得关注的信号,是这个案例在 OpenAI 自身叙事中所处的位置:这是一个始终在线、支持多语言、以语音为先的 Agent,能够将专家知识延伸到实体店营业时间之外,而且每次对话都会带来关于购物者关注点的新洞察。对于 Agentic Commerce 的发展方向而言,真正值得关注的是那些目前还没有人讨论的数据:当销售现场变成一个永不打烊的语音 Agent 时,「零售界面」将会发生什么变化?
— OpenAI · avatarin · 山田电机
🔗 OpenAI — avatarin 客户案例 · avatarin · Dada3C 报道
如需采取进一步措施,你可以考虑屏蔽此人和/或举报其滥用行为。