前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8606
  • Locus MCP:用语言服务器为AI编码代理补全语义导航能力
  • 四个练习帮你测量Token消耗浪费
  • 硅谷游说阻止白宫封禁中国开源 AI 模型
  • 微调的代价:灾难性遗忘的深层机制
  • DeepSeek-V4-Flash 极致性价比震动硅谷
  • 2026年可在笔记本本地运行的5个编程模型
  • 我们团队如何选型LLM和AI Agent框架
  • AI配图正在损害技术博客的可信度
  • 亚马逊 AI 项目超支 860% 历时五月才发现,单项目烧掉 180 万美元
  • grill-me跃居Claude Code技能榜第二
  • 用Skills降低MCP协议的Token消耗
  • 数据库事务隔离级别详解:丢失更新与幻影读的根本原因
  • 持久化执行是装出来的:分布式Job的可靠性设计
  • 多轮对话KV Cache复用:首Token延迟降低30%实战
  • KV Cache池化共享:GPU资源利用率提升实战
  • 生产数据:Claude 3.5 Sonnet代码生成超越GPT-4
  • RAG分块为何不能用字符数代替Token数
  • AI Agent如何驱动真实UI操作:SignalR实现方案
  • MiniMax H3:首个开源2K视频+原生立体声音频模型
  • 程序员视角:AI编程的诚实评价
  • 数学家24小时证伪AI「攻破」的猜想
  • 实习期间用开源模板为律所搭建AI Agent系统
  • HarmonyOS 7封禁系统能力鸿沟:Skill和Agent也能封装调用
  • 沙盒Fork、百万Token上下文、Agent预算管控——工具链成熟度更新
  • AI Agent工具描述占45%上下文:真实数据与认知修正
  • AI功能建设成本低但运行成本高:燃料费藏在哪
  • 别让Prompt实验烧光API预算:先搭测试脚手架
  • 移动端LLM部署决策指南:设备端、云API还是自建小服务器
  • 引入第三方Agent Skill前,先建安全回归测试夹具
  • DeepSeek低价策略冲击硅谷API定价
  • MiniMax H3权重已开源:33B模型怎么跑一文搞清
  • MCP服务器上线前必须验证什么
  • 2026持久AI Agent架构指南:协调层才是瓶颈
  • DeepSeek 低价策略迫使海外平台争相跟进
  • 我给了正确答案却用了错误机制,用户一天内识破
  • 用NVIDIA SkillSpector与LangGraph构建AI技能安全审计流水线
  • 一周三击:Kimi K3开源、Luna降价80%、推理速度分层——价格战重塑多模型架构选型
  • mAP50指标欺骗了我:端侧安全AI调试复盘
  • AI功能建造成本低,运行成本才是隐藏大头
  • 阿里Qwen3.8-Max发布:首个Max级开源模型,支持OpenAI+Anthropic双协议
  • 无标签场景下用变质测试捕获 LLM 错误输出
  • 用规格约束智能体编码全流程
  • 模型准确为何仍救不了文档AI项目
  • 支付重试中的幂等与失败分级
  • 微软推出生产级Agent运行时
  • Spring AI对话成本控制实战
  • AWS智能体全栈架构实践
  • 智能体按需切换 V8 与 Linux 运行时
  • 用AI生成FFmpeg命令的可靠方法
  • 一个刻意收窄边界的RAG库
  • Claude Opus 5主打编程与推理升级
  • 已加载 51 / 8606
8.0
热点
AI SCORE
编程提效2026-08-04 17:22

数学家24小时证伪AI「攻破」的猜想

量子位#AI编程#LLM局限#数学
Editor brief · 编辑速览

AI声称攻破某数学猜想,人类数学家次日发论文指出AI反例不成立,AI证明过程看似正确但已偏离原问题。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

第二天,就有一篇人类论文回应:AI提出的反例不成立

梦晨 发自 凹非寺量子位 | 公众号 QbitAI

OpenAI宣称下一代AI模型解决了10个世界级难题,其中包括推翻了Connes刚性猜想。

第二天,就有一篇人类论文回应:AI提出的反例不成立。

文章配图

作者是堪萨斯大学拓扑物理中心的J. L. Nielsen,她把OpenAI公开的37000行Lean 4代码从头追到尾,把每一个对象对回它的数学原型,最后给出两条互相独立的失败路径。

文章配图

具体的证明过程咱一般人也看不太懂,让AI和数学家神仙打架去吧。

但通过这件事,说明人类对AI科研结果的审查仍然很关键。

文章配图

数学上可以给一个群配一套代数结构。有时候两个长得不一样的群,配出来的结构却完全一样。

Connes在1980年左右提出猜测:只要这个群满足两个附加条件,这种情况就不会发生,结构一样,群就必须一样。

这两个附加条件,一个叫ICC,一个叫Kazhdan性质(T)。

换句话说,想反驳这个猜想,需要举出满足两个条件,但构造不一样的群。

OpenAI新模型的做法是构造两个不同构的群,让它们生成同样的代数,并给出两个群都满足ICC和性质(T)的证明。

整套论证写成37000行Lean 4代码,由Lean内核逐条验证通过,另外附了一份说明文档,解释这两个群是怎么搭出来的。

文章配图

Nielsen指出:AI构造的其中一个群,其实没有满足附加条件,既不是ICC,也没有性质(T)。

文章配图

代码里性质(T)没有忠实对应Kazhdan的原始定义;或者证明只对部分成立,却被算到了整个群上;又或者代码里那个群根本不是说明文档里描述的样子。

为了验证这个结论,Nielsen还做了一件更费力的事。

公开发布的代码是一个整合成单文件的版本,早期分模块源码里的那些名字全都不见了。

她于是列了一张对照表,把每个数学对象在新代码里的名字和行号一一标出:

零上闭链群在第13700行,扭曲群在第14069行,两套代数同构的证明在第36712行,主定理在第36954行。

她还把代码证明ICC的整条推理链追了一遍。这条链从第31430行起步,一层层往上传递,最后在第31610行合成结论。

文章配图

Nielsen指出的问题是,这些引理处理的是经过对偶变换之后的对象,不是原来那个带中心元素的群,因此并没有直接覆盖到关键的那部分元素。

至于它们是否对最终进入定理的那个具体的群里每一个元素都成立,取决于两块构造之间的接口怎么对接。

这说明"要证什么"就出了问题,不是"证得对不对"的问题。Lean只负责验证后者。

对于另一个扭曲的群,Nielsen的态度是保守的。她说自己没有从代码里独立核实它到底满不满足ICC,也承认代码里的引理有可能确实证明了它满足,但那不改变结论,已经有一个群不满足。

她把自己的两条反驳也写成了Lean代码,在Lean 4.32.2下编译。

论文最后一节把这件事放进了一个更大的背景。

Lean内核能保证的事情,只是一段证明在形式上严丝合缝,但不负责是否真的能证明原结论。

这里可以直接引用陶哲轩的说法:验证证明的是形式陈述本身,而不是这个陈述和意图相符,所以人类的审查不能直接被取代。

一份针对五个常用Lean基准的审计给出了4833条发现,包括反例、空洞定理和不可靠公理,全都通过了机器验证。最后是人类构造出反例,才发现被证明的那句话本身是错的。

文章配图

在统计学习理论的形式化工作中,最危险情形被描述为"不是一个失败的证明,而是一个对错误陈述的成功证明"。

张量网络方面的研究也记录过同类现象:系统给出的证明形式上完全正确,只是它证的那个命题比预期的要弱。

Nielsen写道,OpenAI那份形式化可能把它声称的每一条结论都建立对了。但它没有建立、Lean内核也检查不了的,是这些结论和猜想的原话有没有关系。

人读猜想会看到前提,证明助手拿到一个不满足前提的结论,会照样验证关于它的任何断言。

论文地址:https://philarchive.org/archive/NIEWTCv17

参考链接:[1] https://openai.com/index/ten-advances-in-mathematics/[2] https://github.com/openai/ten-proofs/blob/main/ConnesRigidity.lean

年薪百万抢电工,Meta急到自己办技校2026-08-03

AI不再用完即忘:华为诺亚开源MindMemOS,记忆和Skill一起进化2026-08-03

亚太唯一!阿里云跻身Gartner可观测魔力象限"挑战者"象限2026-07-24

业内首款超算+智算的大规模计算底座,在WAIC上我们找到了2026-07-22

量子位 QbitAI 版权所有©北京极客伙伴科技有限公司 京ICP备17005886号-1

Original source

本文由 AI 翻译整理自 量子位,原文版权归原作者所有。

阅读英文原文
上一篇
程序员视角:AI编程的诚实评价
下一篇
实习期间用开源模板为律所搭建AI Agent系统