从 50+ 国内外信源筛出真正值得读的 AI 编程、办公提效与工程实践。每天评分、翻译、提炼,让信息差变成生产力。
阿里Qwen3.8-27B以Apache-2.0开源,在SWE-bench Pro、DeepSWE等编码benchmark上超越Claude Opus4.6 Max,DeepSWE从13.3跃升至42.2,OSWorld/浏览器使用任务同样第一。
Qwen3.5 4B 在 Ollama 上的实际表现与宣传存在偏差;发现 think:true 模式可能因 token 预算耗尽而返回空内容,需同时检查 response 和 thinking 字段。
阿里发布Qwen-UI-Agent,在MobileWorld、OSWorld、WebArena等评测全面超越GPT-5和Claude Opus,支持手机/电脑/浏览器端自主操作,已构建覆盖150+应用的真机环境。
作者亲身测试 DeepSeek、Qwen、Kimi、GLM 的 API 成本与输出质量,聚焦国内模型相比 OpenAI 的费用优势,对选型有直接参考价值。
阿里发布Qwen3.8-Max开源版本,2.4T参数总量,约950亿激活参数,采用细粒度MoE架构,首次以自定义许可证开源Max级旗舰模型。
本地Qwen3.8-27B在单张RTX 3090上完成复杂Agent任务:抓取课表、下载视频逐帧分析并转写,展现极高自主性。
阿里 Qwen 发布 27B 参数原生多模态模型,支持文本、图像、小时级视频理解,编程与 Agent 任务性能接近闭源大模型。
Unsloth 发布基于 Dynamic v3.0 量化技术的 Qwen3.8-27B GGUF 模型,精度提升 10%,1-bit 量化版仅需 8GB 内存即可运行,完全开源可复现。
汇总本周 Z.ai GLM 5.2、Moonshot K2.7 Code、NVIDIA Nemotron 3 Ultra 等批量 API 价格变动,Qwen3.6 27B 降价幅度最大。
中国四大LLM厂商中,DeepSeek V4 Flash以$0.14/M输入token的价格实现82.7分Agent编程性能,成本仅为GPT-5.6 Sol的1/50;Qwen偏代码与企业生态,Kimi主打256K长上下文,MiniMax侧重语音创意。
作者通过 Global API 统一入口对四个国产模型家族进行了数周实测,结论是 DeepSeek V4 Flash 性价比最高,Kimi K2.5 在复杂推理任务上表现突出。
的真实计费对比,涵盖中英双语客服、代码生成等场景,附具体成本计算。结论是国产模型成本约为GPT-4o/Claude的1/3。
Program-as-Weights 将 22MB 适配器编译进冻结的 0.6B Qwen3 解释器,在 MacBook M3 上以 30 tokens/s 达到 32B 模型的准确率,显存仅为后者的 1/50。
实测Qwen3.6-35B-A3B生成速度快2.2倍,但因思考时间长3.1倍实际更慢;25项任务质量持平。
阿里 Qwen 3.8 以仅 27B 参数在 Intelligence Index 拿到 52 分,与 GPT-5.6 Luna 持平,远小于参数量意味着更强性价比。
阿里 Qwen3 小杯模型在多项基准上与头部闭源模型性能接近,推理效率优势明显。
数据每日自动更新 · 最后同步 2026-08-23 23:09 · 内容由 AI 整理解读,观点仅供参考