Gemini 3.7 Flash 主打软件工程和多步 Agent 流程,DeepSWE 从 49% 跳至 65.3%;Qwen3.8-27B(27B 参数、Apache 2.0、262K 上下文)OSWorld 从 63.9% 升至 84.3%,DeepSWE 从 13.3% 升至 42.2%。
本周值得关注:Gemini 3.7 Flash、Qwen3.8-27B、Nemotron Lightning、diagram-design
8 月 11 日至 15 日浮出水面的五件事。新模型发布与两个值得关注的 GitHub 仓库各占一半。
Gemini 3.7 Flash — 聚焦编程的 Flash
Google 于 8 月 13 日发布了 Gemini 3.7 Flash。这一代主打软件工程和多步骤 Agent 工作流,而非通用推理。DeepSWE v1.1 从 3.6 Flash 的 49.0% 跃升至 65.3%——对于 Flash 级别的模型来说,这是一个显著的跳跃。
定价为每百万 Token 输入 $0.75 / 输出 $3.75(首发价),2027 年 1 月 1 日起调整为 $1.50 / $7.50。续费时价格翻倍的规则值得写入日历提醒。上下文窗口保持在 100 万 Token。
我的 ETL 流程用的是 Claude Haiku。现在不打算切换,但本月会在结构化抽取任务上测试这个模型。SWE 那个幅度的提升足够大,值得实际跑一跑,而不是直接无视。
Qwen3.8-27B — Apache 2.0、270 亿参数、26.2 万上下文
阿里巴巴 Qwen 团队于 8 月 14 日 15:00 UTC 发布了 Qwen3.8-27B。规格:277.8 亿参数,支持文本 + 图片 + 视频、Apache 2.0 协议、原生 26.2 万 Token 上下文窗口。本地运行最低需要 24GB VRAM。
报告中列出的基准数字很亮眼:OSWorld-Verified 从 63.9% → 84.3%,DeepSWE 1.1 从 13.3% → 42.2%(对比上一代 3.6-27B 节点)。我目前无法独立验证这些数字。但可以验证的是 Apache 2.0 许可证——这是真的,意味着可以无需签署任何供应商协议即可在本地部署。这个组合(视觉 + 编程 + 270 亿 + 无授权摩擦)让它值得在自托管流程中关注。下周的待办清单里有一项:租一块 GPU 跑基准测试。
NVIDIA Nemotron 3.5 Lightning — 开源、单 GPU、Agent 优先
NVIDIA 于 8 月 11 日左右发布了 Nemotron 3.5 Lightning。"Lightning" 在这里有具体含义:它可以在单块消费级 GPU 上运行。明确的设计目标是后台 Agent 任务——无需云 API 调用即可无人值守运行的工作负载。
更大的背景是 NVIDIA 在开源模型上的系统推进:Hugging Face 上现有 650+ 个检查点,覆盖语言、多模态 RAG、语音和安全。其中大多数是研究产物。Nemotron 3.5 Lightning 看起来是真正面向实际部署而非刷基准论文的那一个。如果你在自有硬件上运行 Agent 工作负载,且希望避免云 API 的延迟和成本,这个值得跑一下基准测试。我目前的技术栈是 Vercel + GitHub Actions,没有 GPU,所以它不会直接进入我的流程。
cathrynlavery/diagram-design — 面向 Claude Code 的 29 种编辑级图表类型
这个仓库本周登上了 GitHub Trending:cathrynlavery/diagram-design — 29 个独立运行的 HTML + SVG 图表模板,专为 Claude Code 使用而构建。截至写作时,11.5k 星,726 个分叉。
README 的定位是"无阴影、无 Mermaid 流水账"。每个模板都是一个独立文件,直接丢进上下文就能用。设计约束——一致的描边粗细、可读的信息层级、打印安全的对比度——让输出在文档中无需后处理就能直接使用。这正是痛点所在:让 Claude Code"画个图"通常产出的东西单独看还算清晰,但放到整篇文档里就不一致了。有了 29 个带统一设计语言的定型模板,这个问题就解决了。
本周我把其中几个拉到了本地 Claude Code 环境中画架构图。流程图、时间线和对比布局这三类会是我日常频繁用到的。
Bumblebee — MCP 服务器和编辑器扩展的供应链扫描器
Bumblebee 来自 Perplexity AI,是一个只读的供应链扫描器:把它指向你的依赖清单、MCP 服务器配置或编辑器扩展目录,它就会标记出已知的可疑包。不自动修复,没有 Agent 模式——只输出只读结果。
本周它重新出现在 GitHub Trending 上——项目目前 2.6k 星,覆盖数据库相比 npm 的全部表面仍然偏薄,但概念是对的。MCP 服务器在 Claude Code 会话中以相当大的环境权限运行,大多数开发者并没有像审计生产环境 API 依赖那样去审计它们。一个轻量级扫描器,跑在 CI 中、遇到已知不良包就直接失败,是解决这个问题正确的思路。把它接入我的 GitHub Actions 流程是下周的计划。
这是为期 6 个月运行三个 AI 策展目录站点实验的一部分。文中技术陈述是真实的;本文由 AI 辅助撰写。