前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8598
  • Qdrant 图层修复多跳向量检索难题
  • Claude Pro/Max/Team 限额真相:5小时窗口+周上限,按token计而非按消息
  • 英伟达开源Alpamayo 2 Super自动驾驶模型
  • Netflix推荐系统设计:ML系统设计深度剖析
  • 我造了一个实时检测免费LLM端点的工具
  • Prompt 本质是结构化上下文注入而非咒语
  • Cloudflare Wallet:让AI智能体持卡消费的支付基础设施
  • Cursor Google Workspace 插件安全检查清单
  • Cursor 发布:小模型与大模型之辩回归工程视野
  • Bug排查案例:追求根因而非表面修复
  • Meta发布Muse Spark 1.2:编程专用模型,支持端到端开发者工作流
  • Vercel沙箱防火墙功能向免费版开放
  • LLM CLI 0.32:推理过程可追踪、支持OpenAI服务器端工具
  • Claude Fable 5在Amazon Bedrock上的数据保留策略错误解决
  • 构建安全LLM系统:生产级授权实战指南
  • LLM安全实战:输入校验与结构化输出的硬核指南
  • Scientific Illustrator: 开源技术图可编辑转换工具
  • AI Swarm开发模式:突破团队Copilot效率天花板
  • AI Agent 如何记住用户偏好:键值记忆架构实战
  • Vercel Sandbox正式支持Devin Outposts
  • 阿里 Qwen 3.8-Max 开源:2.4T 参数、本地可跑、编程能力逼近 Opus 5
  • MCP 服务器:为什么你的 SaaS 需要一个(Python 实战)
  • 多终端 AI Agent 上下文复用:避免重复 Prompt 的实践
  • PixelRAG:将网页和PDF作为图像进行原生视觉索引的实战指南
  • Matt Pocock 开源 .agents 技能库:Claude Code 生产级工作流
  • MCP 服务器 demo 正常但模型不调用:工具描述写法决定成败
  • OpenAI 周活超10亿、GPT-5.6 Luna 降价80%, Codex 处理99.8%输出 token
  • llm-anthropic 0.26:支持Claude 5系列和服务端工具
  • LLM只能翻译,不能决策:算命app的工程教训
  • 我的应用里 LLM 被禁止做决策:规则引擎解耦实践
  • 373 个测试全绿,幂等性 bug 却让我多付了一次钱
  • Claude Code 沙箱安全边界详解:读写权限的取舍
  • OpenAI公布模型第三方网络安全评测
  • 开发者必读:SEO/AEO/GEO 搜索技术拆解
  • 我用 126 页站点验证 LLM 引用规律
  • 76% 已上线 Web 应用未配置 CSP 头部
  • CLAUDE.md 失效的 5 个常见错误及修复方法
  • DeepSeek AI Agent 被武器化用于代理劫持攻击
  • Keyv 供应链攻击关键信息:Shai-Hulud 行动
  • 如何写一个团队真正需要的代码审查SKILL.md
  • 树莓派跑AI Agent三个月:3B小模型的任务设计经验
  • 树莓派5本地跑AI推理:省掉每月40美元API费
  • MCP Workbench:MCP服务器的Postman式测试平台
  • 开源权重模型逼近前沿能力,但安全防护存在明显缺口
  • 通过MCP将企业数据库接入AI Agent实战
  • Kimi K3 本地跑满 16x GB10 集群,吞吐达 20+tps
  • 覆盖率100%却导致生产事故:AI编程时代的测试盲区
  • AI正在突破沙盒:自主Agent失控事件深度剖析
  • LangGraph 检查点三次生产重写避坑经验
  • Nvidia牵头成立开放AI安全联盟,一周内扩至120家公司已有防御提案
  • SQLite 实现10毫秒内语义搜索:本地AI记忆栈实战
  • 已加载 51 / 8598
8.0
热点
AI SCORE
模型发布2026-08-05 06:58

阿里 Qwen 3.8-Max 开源:2.4T 参数、本地可跑、编程能力逼近 Opus 5

dev.to · AI#Qwen#开源模型#AI 编程
Editor brief · 编辑速览

阿里发布 Qwen 3.8-Max,2.4 万亿总参数、95B 激活参数、百万 token 上下文,在 Frontend Code Arena 得分 1668 仅落后 Opus 5 的 37 分,API 价格每百万输入 2 美元。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

如果你今年一直在关注 AI 领域,应该已经熟悉了这个套路。美国实验室在 API 背后宣布了什么惊艳的东西,中国实验室就以开源权重的方式放出一个具有竞争力的版本。美国那边大谈安全,我们其他人则直接下载中国模型、该干嘛干嘛。

但这周感觉不太一样。不是因为套路变了,而是因为规模变了。

让我来梳理一下过去 48 小时发生的事。

Alibaba 发布史上最强模型——免费

Alibaba 周一放出了 Qwen 3.8-Max,数据很难忽视。总共 2.4 万亿参数,每次查询激活 950 亿参数(MoE 架构),百万 token 的上下文窗口。他们声称在大多数基准测试中与 Claude Sonnet 5 持平,在编程任务上超越了 GPT-5.6 Luna。

我花时间仔细看了这些基准测试。Artificial Analysis 的独立评测比 Alibaba 自己放出的图表略低——与 Sonnet 5 持平而非 Opus 5——但这依然是相当强的段位。在 Frontend Code Arena 上拿到了 1668 分,仅比 Claude Opus 5 低 37 分。对于一个可以下载到本地硬件运行的模型来说?这相当疯狂。

定价才是真正讲述故事的那个。Qwen 3.8-Max 在 Alibaba API 上的价格是每百万输入 token 2 美元、每百万输出 token 6 美元。Claude Sonnet 5 输入价格相同,但输出每百万要 10 美元——而且 9 月 1 日还要涨价 50%。OpenAI 的 GPT-5.6 Luna 输入更便宜只要 0.20 美元,但实际效果明显更差。

Alibaba 表示权重将于下周登陆 Hugging Face,同时还有一个 270 亿参数版本供没有成堆 B200 的同学使用。因为没错——2.4T 参数不是闹着玩的。生产环境服务需要 48-64 块 Nvidia B200,或者内部工作负载 8-16 块 B300。这可不是树莓派项目。

尽管如此,这个模型以开源权重形式存在这件事本身就改变了一切。

DeepSeek 的反击

Alibaba 不是唯一一家搞出动静的中国实验室。DeepSeek 放出了 V4 Flash 0731,一个 2840 亿参数的模型,在独立基准测试上与 GPT-5.6 Luna 相差不到 1 分,同时每次任务成本还低了 40%。

有趣的是?它足够小,可以在普通企业服务器上运行。2840 亿参数约需 142GB 内存。你不需要租用超算集群来折腾这个。

DeepSeek 的策略一直是效率优先——用尽可能少的参数榨取每一滴性能。V4 Flash 是这种理念的集大成者。它在原始能力上打不过 Qwen 3.8-Max,但对很多现实场景更实用。推理更快、成本更低、部署更容易。

我一直在本地跑一些较小的 DeepSeek 变体来做代码辅助,老实说,"开源但小"与"闭源但大"之间的差距每个月都在缩小。V4 Flash 只是加速了这个趋势。

与此同时,Anthropic 正在签署 100 亿美元的支票

在太平洋彼岸,Anthropic 显然感受到了压力。本周 Bloomberg 报道,他们与云计算初创公司 Volta 签署了一项 100 亿美元的算力合同——而这家公司年初甚至还不存在。

合同期限六年。Volta 正在挪威建设一座 133 兆瓦的数据中心,采用 Nvidia 的 Vera Rubin 系统,并获得了加密矿企 Bitdeer 的协助。Anthropic 最近还与 SpaceX 和 Amazon 签署了算力协议。

这对算力来说是一笔巨款。这也告诉你一些关于 Anthropic 想法的信息——他们不指望靠效率提升来缩小差距,而是押注于暴力堆算力。

公平地说,Claude Opus 5 在某些基准测试上仍然是金钱能买到的最强模型。但差距正在快速缩小,Anthropic 的成本在上升,而中国开源模型则越来越便宜、越来越强。总有一方要做出改变。

光子芯片与硬件竞赛

总部位于伦敦的初创公司 Olix Computing,由一名 25 岁的辍学生创立,本周从 Netflix 联合创始人 Reed Hastings 和 Arm Holdings 获得了 3.12 亿美元融资。他们的方案与众不同:一款名为 DX-1 的芯片,零 HBM 内存,完全依赖片上 SRAM,通过使用光而非铜的光学互连连接。

他们声称在 1000 亿参数模型上达到每秒 10,000 token。这很快。没有 HBM 意味着没有先进封装成本,光学互连使用较慢但更可靠的编码方式,不需要昂贵的数字信号处理器。

Olix 目前估值 33 亿美元。首批出货预计 2027 年上半年。还很早期,但方向是对的——业界迫切需要 Nvidia GPU 垄断之外的推理替代方案。

SpaceX 的 AI 云业务创造了 26 亿美元营收(同比增长 3 倍),主要来自与 Anthropic 和 Google 的算力合作。他们正在将自己定位为 CoreWeave 的竞争对手。

其他值得关注的事

Obsidian 作为共享 AI 记忆——有人找到了如何通过 MCP 让自己的 Obsidian 保险库成为 Claude Code、Codex 和本地 LLM 的共享上下文。我自己也做了类似的尝试,这确实改变了你与这些工具的协作方式。你的知识库成为了模型的记忆。

Hank Green 因为在创意工作流中大量使用 LLM 被自己的粉丝群围攻。争议是真实的,但背后的核心问题不会消失:工具和拐杖之间的界限在哪里?

泰国发布了 ThaiLLM——一个用于 AI 主权保护的本土模型项目。更多国家开始意识到他们不想把语言模型外包给美国或中国公司。

这就是本周要闻。开源模型在价格和可获取性上正在领先。闭源实验室在算力上疯狂投入。硬件初创公司正在试图突破推理瓶颈。

我不知道谁会赢得这场竞赛。但我知道谁会受益——任何能下载模型并自己运行的人。

如果你觉得这篇文章有用,可以看看 7x24planning——我一直在用这个工具来追踪所有这些动态。

Original source

本文由 AI 翻译整理自 dev.to · AI,原文版权归原作者所有。

阅读英文原文
上一篇
Vercel Sandbox正式支持Devin Outposts
下一篇
MCP 服务器:为什么你的 SaaS 需要一个(Python 实战)