DeepSeek V4-Pro实行峰谷定价,智谱GLM-5.3开源权重编程benchmark登顶(Terminal-Bench 3.0: 28.3),Anthropic未发布Model 2。
自北京时间 8 月 17 日 0 时起,DeepSeek API 开始实行时段差异化定价。非高峰时段(北京时间 9:00–12:00 和 14:00–18:00 以外)费率为高峰时段的五折。
V4-Pro:高峰时段输出 ¥27 / $3.96 每百万 token,非高峰 ¥13.5 / $1.98。
V4-Flash:高峰时段输出 ¥9 / $1.32 每百万 token,非高峰 ¥4.5。
此次调价终结了超低固定费率时代——仅 V4-Pro 非高峰输出价格就已约为原官方定价的 2.25 倍,高峰时段更是达到约 4.5 倍。
信号:这家开源权重领域的领导者如今正在依据容量和能力定价,而非单纯低价竞争。可以预期企业会把大量调用迁移至非高峰时段。
Zhipu 于 8 月 14 日发布了 GLM-5.3,构建于与 GLM-5.2 相同的基础之上——所有提升均来自后训练 scaling。如今在开源权重编程基准上名列榜首:
Terminal-Bench 3.0:28.3(此前为 4.6),DeepSWE v1.1:66.9(此前为 46.2)。
CyberGym:84.5%——在漏洞发现方面与 Claude Mythos 5(83.8%)持平或超越。
在预发布测试期间,它共发现 2,404 个潜在漏洞(其中 1,088 个为高危/中危),包括一个存在了 40 年的 DNS 协议缺陷。
权重将在安全加固完成后约 2 周内开放下载。要点:仅凭后训练就在不断缩小与前沿闭源模型的差距。
Anthropic 长达 186 页的风险报告揭示了一款内部专属模型 Model 2,其能力超越公开的 Claude Mythos 5:
CoBench v2:62.8% 对比 Mythos 5 的 50.3%——该模型已在公司内部被大量用于编程、agentic 任务和训练数据生成。
无发布计划。对齐风险评级从"非常低"升至"低"。
报告还披露了真实事件:生物安全分类器静默关闭了约 11 个月,导致约 1.33 亿次对话(涉及约 50,000 名外包人员)绕过了该分类器。
前沿的真正能力优势如今存在于实验室内部,而非消费产品之上。
想紧跟 AI 前沿动态?每日简报请关注 AI Nexus Daily。