OpenAI 达成10亿用户里程碑,GPT-5.6 Luna 降价80%($0.20/M 输入),Sol 架构使服务成本降20%;Agentic 工作通过 Codex 已占其周输出 token 的99.8%。
OpenAI 跨越了一个 ChatGPT 花了不到四年才达到的数字。7 月 31 日的一篇博客文章中,该公司表示其模型现已触达超过 10 亿活跃用户和超过 200 万家企业。这一里程碑伴随着一项关于使用深度的声明:大约六周后,用户每天发送的消息量增加约 50%,并将 ChatGPT 用于大约两倍种类的工作。文章将增长归因于价格下降——"当有用智能的成本下降,更多工作变得值得去做。"
支撑这一论点的定价动作在几天前落地。OpenAI 将 GPT-5.6 Luna 降价 80%(现为每百万输入 token 0.20 美元,输出 1.20 美元),GPT-5.6 Terra 降价 20%(2 美元/12 美元),而 Sol 价格保持不变。据称 Sol 的内部工作将端到端服务成本降低了 20%,并将 token 生成效率提升了超过 15%;该公司还将 Sol 的 ARC-AGI-3 分数从 13.3% 提升至 38.3%,同时使用的输出 token 数量减少了六倍。
值得关注的数据:通过 Codex 的 agent 工作现在已占 OpenAI 每周输出 token 的 99.8%。该公司实际上在将自己描述为一家 agent 公司,而非聊天机器人公司——而这个 10 亿用户的数字是其迈向 IPO 之路的增长故事。
— OpenAI · TechRepublic
🔗 OpenAI — Building Abundant Intelligence · TechRepublic
Google DeepMind 于 7 月 30 日发布了 Gemini Robotics 2,这是一个定位为"为任何类型的机器人提供智能层"的模型系列。与第一版相比,最主要的变化是全身控制:VLA(视觉-语言-动作)模型协调从脚尖到指尖的运动,而非仅处理上半身。在 Apptronik Apollo 2 人形机器人上,系统能够行走、蹲下、从货架上取物,并实时推理多步骤任务。
两个兄弟模型拓宽了应用范围。Gemini Robotics ER 2 是一个具身推理模型,通过观察视频、制定计划,在持续数分钟的任务中做出数百个决策——它可以跟踪进度,在错误后从最后一个正确的步骤恢复,将长任务分配给多个机器人,并调用 Google Search 等工具来澄清模糊指令。Gemini Robotics On-Device 2 在机器人本地运行,DeepMind 表示它只需要不到 200 个真实示例和几小时训练就能适应新的双臂平台。安全有了自己的基准测试 ASIMOV-Agentic,用于评估机器人是否拒绝不安全命令并在不确定时寻求帮助;ER 2 还能检测附近的人并触发安全停止。
发布会上公布的数据给出了全身敏捷性的实际状况。从桌上取物的成功率为 68.4%,从地板上为 45.7%,从货架上为 76.3%;具有 22 个自由度五指手拆卸灯泡的成功率为 92%,但安装仅为 36%。DeepMind 坦诚地承认这一差距——人类水平的敏捷性是 stated 下一个目标。无论如何,方向是明确的:机器人制造商正在用一个通用大脑取代一堆任务特定的控制器。
— Google DeepMind · The Paper
🔗 Google DeepMind — Gemini Robotics 2 · The Paper Coverage
NVIDIA 于 8 月 3 日发布了 NemotronLabs VoiceChat——一个 110 亿参数的语音模型,在 Hugging Face 上开放权重,是首个在对话中调用工具的开源全双工模型。"全双工"意味着它同时听和说:无需唤醒词,用户可以在句子中途打断,模型可以实时调整输出。技术栈将通常的 ASR → LLM → TTS 接力压缩为一个流式网络:Fast Conformer 语音编码器馈入 Nemotron Nano v2 9B 主干,TTS 解码器发出语音,一个单独的输出通道生成工具调用脚本而不污染语音响应。
数据给出了背景。话轮切换延迟约为 450ms;打断解析约 480ms;在 VoiceBench 开源全双工模型中排名第二。在 BFCL-v3 工具调用套件上平均达到 56.1%——但细分数据才是诚实的部分:正确选择工具 82.5%,正确获取参数 44.2%,pass@1 33%。NVIDIA 建议每轮对话不超过五个工具,并指出并行调用不可靠。这是一个第一代开源尝试,不是托管语音 API 的直接替代品。
战略层面的解读更重要。封闭的实时语音 API 此前是唯一能看到双工对话和 agent 工具调用协同工作的地方;现在有了一个在 vLLM(A100 到 B200)上的开源参考实现,研究人员可以深入研究。值得注意的是 OpenMDW v1.1 许可证限制了使用范围仅限研究——所以将其视为学习的蓝图而非可直接部署的技术栈。
— NVIDIA · Artificial Analysis
🔗 NVIDIA — NemotronLabs VoiceChat 11B (Hugging Face) · Artificial Analysis
OpenAI 于 8 月 3 日发布了其对 Apple 商业秘密诉讼最详细的回应,标题毫不含糊:"Apple 错了"。Apple 于 7 月 10 日提起诉讼,指控前硬件高管——包括现为 OpenAI 首席硬件官的 Tang Tan——将机密信息带入 OpenAI 的消费硬件业务。该案位于加州北区,Apple 最近提出了初步禁令动议。
回应对时间线发起攻击。Apple 声称于 2 月联系了 OpenAI 但未得到回复;OpenAI 公布的邮件显示 Apple 的外部律师混淆了两个亚洲姓氏,将便笺发给了错误的人,随后承认了这个错误。OpenAI 表示,此后五个月没有收到任何消息,直到诉讼到来。关于前工程师 Chang Liu,OpenAI 公布了 iMessage 记录,显示 Apple 员工在 Liu 1 月离职后联系他取回项目文件——并认为他继续访问权限源于 Apple 未能清理 iCloud 共享权限,该公司后来将此重新定性为"残留访问"。
OpenAI 称禁令请求"建立在虚假信息之上",并表示既不拥有也不想要 Apple 的商业秘密。无论案情如何,这读起来像是一场关于下一代原生 AI 硬件的领地争夺战——Apple 捍卫其供应链护城河,而 OpenAI 需要证明其硬件努力是独立立足的。法院尚未对禁令作出裁决。
— OpenAI · MacObserver
🔗 OpenAI — Apple Is Getting This Wrong · MacObserver
Tuya Smart(涂鸦智能),这家在纽约证券交易所和港交所上市 AIoT 云平台,于 8 月 3 日推出 Tuya AI Coding——一个将自然语言转化为可部署应用的 AI 原生无代码平台。输入"我想要一个追踪智能宠物喂食器并在食物不足时提醒我的应用",平台一次性生成 UI、交互逻辑和后端:数据库、API 网关、用户认证和设备管理,接入 Tuya 覆盖 200 多个国家的云基础设施。
差异化在于硬件层。大多数 AI 应用生成器止步于网页或小程序。Tuya 的版本原生接入其设备生态系统——超过 10 万个已连接硬件 SKU——所以生成的应用实际上可以控制真实设备、读取设备状态、触发场景。目标用户明确指向非技术人员:设计师、产品经理、创始人、自由职业者、学生。公司称开发周期从数月缩短到数分钟,技术门槛降低 90%。
时机与一个更广泛的转变相吻合。Gartner 预计到 2026 年底,75% 的新企业应用将使用低代码或无代码工具。一个有趣的赌注是:随着 AI 应用生成使前端开发商品化,从演示到产品的最后一公里是连接物理世界——而这恰恰是物联网公司已经拥有的护城河。
🔗 Tuya Developer — AI Coding Kit · Tuya AI Coding · 南方+ 報導
7 月 31 日发布的一篇预印本(arXiv:2608.00181)提出了基准测试表通常回避的问题:当你在长时域工具使用上训练 agent 时,它学到了可迁移的东西吗?作者对一个开源 MoE 模型 Qwen3.5-122B-A10B 进行了后训练,使用 363 个 Model Context Protocol(MCP)任务横跨 27 个类别,采用两阶段 SFT 然后 RL 的流程。关键点是:没有外部基准测试任务或评分者进入训练,没有外部分数影响奖励。
结果支持肯定的答案。在 greedy pass@1 下,训练后的模型在五个外部评估中优于基线:Toolathlon +9.6pp,τ2-Bench +5.3pp,BFCL-V4 +3.5pp,SWE-Bench Pro +5.8pp,Terminal-Bench 2 +2.8pp。引人注目的是 SWE-Bench Pro——尽管训练集中完全不包含软件工程任务,但软件工程性能仍有提升。
配对轨迹分析识别出四种跨办公工作流和代码一致出现的行为转变:更仔细的局部目标形成、建立目标相关的工作状态、在局部修复时保持父目标稳定、以及验证完成。简而言之,RL 在多工具长时域任务上改变了 agent 的工作方式,而不仅仅是它知道了什么——这种工作方式可以迁移到训练领域之外。这读起来更像是习惯形成而非任务记忆。
🔗 arXiv — Cross-Benchmark Generalization in Long-Horizon Agents
清华大学和香港科技大学的一个团队发布了 LiveEdit(arXiv:2606.26740),一个支持文本指令流式视频编辑的框架——已被 ECCV 2026 录用,训练代码和模型已开源。目标是直播场景:直播特效、视频会议、增强现实,这些场景不能等待整个视频完成才开始编辑。
技术问题在于视频扩散模型依赖双向时空注意力——它们需要在处理给定帧之前看到未来帧。流式处理意味着模型只能看到现在和过去,论文表明简单地截断未来帧会在更长的历史上稀释注意力,破坏局部时间先验并产生闪烁和漂移。LiveEdit 以因果、分块的方式处理传入视频——在每个视频块 4 步下达到 12.66 FPS——同时保持编辑区域准确和非编辑区域一致。它还避免重复计算静态背景 token,这是实时推理的主要成本。
论文的表述值得记住:生成的视频可以来自噪声,但编辑必须保留原始结构、光照和运动。这一约束使得流式编辑成为一个独立于流式生成的问题,这也是迄今为止大多数"实时"工具名不副实的原因。这个是开源的,所以可以直接测试。
🔗 arXiv — LiveEdit · 机器之心報導