前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8336
  • NestJS 测试覆盖提升与安全加固实战
  • Next.js Serverless 下 PDFKit 字体缺失修复
  • 评测编码Agent前,先用同一组任务跑两遍
  • LLM Wiki:文档自动构建可维护知识库的开源桌面应用
  • 深入解析结构化输出:让 AI 生成绝对可解析的 JSON
  • MCP安全核心是权限体系重设计,而非传统边界防护
  • GPT-6 Astra 在机器人基准测试中展现空间推理飞跃
  • Auterix:零依赖通用协议,跨 21 个 AI 工具统一上下文规范
  • 后量子 TLS 是平台迁移工程,不是密码学研究
  • Anthropic 发布 AI-Native SDLC 实践手册:代码不再是瓶颈
  • OpenAI 建议 GPT-6 Astra 提示词应精简,减少安全限制
  • Claude Code 创始人:AI 编程要守住代码质量标准
  • Hyperresearch:Agent 驱动的研究知识库,单次跑 250+ 信源
  • 12 个已落地的 B2B 营收 AI Agent 用例,附代码
  • LLM 项目上线后才会暴露的 6 个隐蔽 Bug
  • OpenAI 代理向 RubyGems 上传两千恶意包
  • AI 时代缓存失效难题复发:LLM 推理的隐性成本
  • Google发布TimesFM-3:单次前向传播即可完成多步时间序列预测
  • 阿里 Qoder CLI 开放自定义模型接入
  • 开源项目 Minitap 指控谷歌盗用代码用于 Artemis,许可证违规引热议
  • GPT-6 Astra 刷穿 FrontierMath Tier 4,AI 数学能力达新里程碑
  • Kimi K2.8发布:性能逼近K3百万上下文全员开放
  • DeepSeek v4.1-Flash发布:763B参数新型因果编解码架构
  • AI Agent 何时该停:成本控制的核心工程问题
  • 三大AI编程工具实战对比:Claude Code六个月生产级使用报告
  • Trail of Bits开源Coop:用隔离VM安全运行Claude Code和Codex
  • OpenAI代理今年5月攻击RubyGems详情披露
  • Google Tunix:TPU上的自主LLM后训练框架
  • GitLab CVE-2026-85706:CVSS 10.0 路径遍历漏洞正被主动利用
  • RAG 检索失效的根源:分块策略正在毁掉你的 AI 应用
  • CPython 字节码缓存导致测试失效的隐藏bug
  • OpenAI代理攻击RubyGems:技术细节与行业反思
  • Anthropic 内部调查:七成公司无法衡量 AI 工具实际回报
  • OpenRouter 隐性陷阱:同一端点行为不一致
  • 字节Seed研究:LLM自建测试harness泛化性堪忧,仅34%有效
  • GitHub Copilot支持查看VS Code Agents使用量指标
  • OpenAI正式开放Agents API:日烧7千美元研发现已公测
  • Anthropic 为 Claude Code 推出插件评测工作流,含 6 种评分器与无插件基准线
  • 一招配置:让 Claude Code、Cursor、Cline 等主流 AI 编程工具共用同一个国产模型端点
  • 我用 Claude Code 搭 AI 团队,抓到它给自己打高分
  • 律师因AI幻觉证人被罚5000美元
  • AI 搜索引擎如何理解网站:RAG 到引用的技术链路
  • 幂等性:防止大问题的 API 小概念
  • OpenAI 自托管执行器只向外拨号,所以我们的停止按钮是个队列
  • AI Agent 大规模利用 PaperCut 漏洞攻陷 395 家机构
  • Copilot 代码审查新增自动关闭评论与智能提交信息
  • n8n详解流程编排:执行模型、可观测性与生产挑战
  • 律师因引用AI伪造证人被惩处的全过程
  • Reflection 模式:AI Agent 在生产环境的自我纠错实践
  • AWS 双层方案监控生产环境 Agent 生命周期
  • 选对 Bedrock 上的 OpenAI 模型:超越每百万 token 价格
  • 已加载 51 / 8336
8.0
热点
AI SCORE
模型发布2026-09-12 15:33

GPT-6 Astra 刷穿 FrontierMath Tier 4,AI 数学能力达新里程碑

量子位#GPT-6#AI数学#模型评测
Editor brief · 编辑速览

GPT-6 Astra 在 FrontierMath Tier 4 基准上达到饱和水平,标志着 AI 数学推理能力取得重大突破,数学奥林匹克级别难题已被攻克。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

FrontierMath Tier 4,饱和了

刚刚,最后一道FrontierMath Tier 4难题,被GPT-6 Astra攻破了。

至此,这套曾经被视作大模型数学噩梦的研究级测试,所有题目都已经至少被AI成功解出过一次。

Epoch AI也正式给它下了结论,FrontierMath Tier 4,饱和了。

虽然从上面的图里看,Astra还没有直接干到100%,OpenAI自己公布的成绩也是97.6%。

但按照Epoch的算法,"全部解出"指的是把不同模型、不同时间的尝试累积起来以后,Tier 4里的每一道题都已经有过成功解答。

而Astra干掉的,正是此前唯一还没有被AI攻破的那一道。

(简单理解就是Astra可能在某次测试中出错了,但它对的那道题是此前没被解出来的)

如果你关注模型评测的话,就知道2025年7月11日,Tier 4刚刚推出时,榜上最高成绩只有大约5%。

现在刚过了一年零2个月,这个曾经的"高墙"已经变成了"台阶",最后一道难以被AI通过捷径绕道解决的问题也被跨越。

出题人自马凯特大学数学副教授Jay Pantone也表示,以往AI都会找数值捷径,而这一次,AI的解法和自己相当接近。

不过,就在最近GPT-6 Astra集中向数学界猛攻,三天两头解决千禧年难题之际,Pantone表示自己已经很难惊讶了!

可以说,数学俨然已经成了Astra最近刷存在感最猛的地方之一。

FrontierMath最早于2024年11月7日发布,而它诞生的目的,本身就是为了避免数学Benchmark过快被AI刷穿。

当时像GSM8K、MATH这样的传统数学Benchmark已经越来越难拉开头部模型之间的差距,于是Epoch AI联合60多位数学家,重新设计了一批此前从未公开过的原创题。

其中,就包括陶哲轩、Timothy Gowers、Richard Borcherds等菲尔兹奖得主。

陶哲轩当时看完其中一些研究级题目后直言,这些题"极其困难",甚至判断最难的Tier 3,可能还能让AI再卡上几年。

结果第一轮测下来,果然不出所料,领先模型的正确率还不到2%。

具体的,在最开始,FrontierMath的核心题库共有300道题,按照难度分成Tier 1、Tier 2和Tier 3三个层级。

Tier 1大致接近高难度本科题和数学奥赛,不过允许使用更高级的工具;Tier 2已经来到高年级研究生难度;Tier 3则更接近博士生早期会遇到的探索性研究问题。

但随着推理模型出现,这前三层也开始越来越不够用了,于是2025年,Epoch又往上加了一层,Tier 4。

Tier 4大多由数学教授和博士后设计,每个人会围绕自己的研究方向,进行数周左右的短期研究,最后再把成果压缩成一道可以被自动验证的问题。

最初,Tier 4一共收录了50道题。它们覆盖的范围包括分析、数论、组合数学、拓扑、代数几何……

在发布之初,所有模型历次测试加起来,也只有3道题曾经被解出,而且这些解答还依赖了一些正确、但没有被充分论证的假设。

鉴于此,在官网的公开样题页面上,Epoch还一度写道:其中一些题,可能几十年都不会被AI解决。

不过随着模型越来越强,另一个问题也暴露了出来:题库本身也开始经不起AI"拷打"了。

OpenAI在测试过程中发现,FrontierMath里的错误比预期更多。

随后Epoch启动独立审计,先用GPT-5.5和Claude Opus 4.7筛查疑点,再交给数学家逐题复核。最终在2026年6月推出v2版本,其中Tier 4修正了12道题、移除了7道题,留下43题。

GPT-5.6 Sol做到83.0%,Claude Fable 5达到90.2%,到了GPT-6 Astra,成绩已经来到97.6%。

更关键的是,Astra还补上了此前唯一一道从未被AI解出的题。

至此,Tier 4里的每一道题,都已经至少被AI成功攻破过一次。这套专门为最强模型加出来的研究级防线,最终也被刷穿了。

不过,这并不意味着"数学已经被AI解决了"。恰恰相反,FrontierMath自己已经开始往下一阶段走。

现在整个项目除了Tiers 1-4,还增加了真正的Open Problems,以及把Erdős开放问题形式化进Lean的FrontierMath Erdős。

前者直接拿尚未被数学界解决的研究问题考模型;后者则要求AI写出能够通过形式化验证的完整证明。

这一次,Astra在FrontierMath Erdős的68道问题里,只解决了2道。

A社承认Claude安全对齐存在缺陷,但"尚无解决方案"2026-09-12

AGI时代的第一个生图模型,ChatGPT Images 2.5上线2026-09-10

李飞飞刚发Atlas,中国开源"同款"已抢跑半年?2026-09-04

今年最难的机器人Demo,"机器人含量"为02026-09-03

量子位 QbitAI 版权所有©北京极客伙伴科技有限公司 京ICP备17005886号-1

Original source

本文由 AI 翻译整理自 量子位,原文版权归原作者所有。

阅读英文原文
上一篇
开源项目 Minitap 指控谷歌盗用代码用于 Artemis,许可证违规引热议
下一篇
Kimi K2.8发布:性能逼近K3百万上下文全员开放