数学中国

 找回密码
 注册
搜索
热搜: 活动 交友 discuz
查看: 61|回复: 0

24 小时,AI 攻破了人类争论 50 年的数学天花板

[复制链接]
发表于 2026-8-10 00:18 | 显示全部楼层 |阅读模式
24 小时,AI 攻破了人类争论 50 年的数学天花板

原创  南厝姑娘  南厝姑娘  2026 年 8 月 6 日 18:19  福建

先说一个让数学圈集体破防的事实:

一道困扰人类数学家整整 50 多年、长期无人能推动的开放难题,被一个 AI 智能体用大约 24 小时拿下,而且不只是刷了个新纪录——它直接证明了那条争论半个世纪的理论上限,真的可以被无限逼近。

做出这件事的,是腾讯混元自研的科研智能体 Hyra 。而就在几天后,OpenAI 也宣布其内部测试模型 Astra  一口气解决或推动了 10 道悬而未决的数学难题。两记重锤接踵而至,整个学界都在追问同一个问题—— AI ,是不是已经从“工具”变成了“研究员”?

更扎心的是今年菲尔兹奖讨论里流传最广的一句话:

“这可能是最后一届纯人类成果获得菲尔兹奖了。”

听着像段子,但没人敢站出来否认这个可能性。

一 、一道争论了 50 年的题,到底在问什么

先把这道题“翻译”成人话。

它属于数学里一个叫加法组合学的分支,核心是一个关于“和差集”的开放问题。听起来很抽象,但问题本身可以这么理解:

给你一组整数,任意挑两个做加法,能得到多少种不同结果?把加法换成减法,又能得到多少种?

有趣的是,同样一组数字,有些相加会不断产生新结果,相减却经常撞车。于是数学家开始追问一个看似简单、实则要命的问题:

能不能设计出一组特殊数字,让“加法结果”远远多于“减法结果”?最多能多到什么程度?

已有的理论早就划出了一条上限——加法结果的增长速度,最多接近减法结果的平方。

但问题在于:这条上限究竟是一个宽松的估计,还是真的可以无限逼近?

打个比方:工程师算出一列高铁的速度绝不会超过 350 公里/小时。但“不能超过350”,不代表它真能跑到 350 ——实际极限可能只有 200 。数学家吵了 50 年的,就是“350 到底是真正可逼近的极限,还是一条画得太高的上限”。

半个世纪的艰难推进

半个多世纪以来,数学家不断设计新的数字集合,一点点往上逼近:

1969 年,最优指数推进至约 1.0290 。

1973 年,提高到 1.0598 。

2013 年,推进至 1.1259 。

近一年,多项AI辅助搜索将纪录提高到 1.1449 ;Codex 在有人类引导的实验中进一步做到 1.2851 。

2026 年 7 月,Hyra:直接推进至理论极限值 2 ,并证明可无限逼近。

看到了吗?人类用 50 年,把指数从 1.03 艰难推到 1.28 。而 Hyra 给出的,不是一个“又高了一点点”的新纪录——它找到一整套可以不断扩展的数字构造,证明随着集合规模增大,结果能够无限接近理论上限 2 。

也就是说,那条看似遥不可及的天花板,是真的可以够到的。



二 、24 小时里,Hyra 到底干了什么

最关键的一点是——这不是一次单纯的暴力搜索。

根据腾讯混元官方介绍,Hyra 基于本月开源的 Hy3 大模型(总参数 295B 、激活参数 21B),工作流程大致是这样的:

Hyra 的“科研四步法”

第一步|有限搜索:先在有限范围内试出更好的结果,把纪录从约 1.14 提高到 1.21 。

第二步|提出构造:转向用自然语言提出数学构造和论证方案。

第三步|形式化验证:研究团队独立检查并整理出完整证明,再给出 Lean 4 形式化证明,让计算机逐步核验每一步推导。

第四步|开源公开:论文预印本、显式构造、Lean 4 证明全部开源。

经过约 24 小时运行,Hyra 找到了论文的核心思路:利用十二进制数字结构和一个精巧的构造控制差集,再结合循环群上的对称加法基与中国剩余定理,使和集以及差集的扩张达到最优指数 2 。

这件事的含金量在哪?

过去 AI 做数学,更多是“帮人类搜答案”——在巨大的搜索空间里找一些人类没空尝试的组合。但这次不同:Hyra 是从发现线索、提出构造,到给出能够被计算机验证的完整证明,全程深度参与。

论文 7 月 29 日发布在 arXiv上 。腾讯首席 AI 科学家姚顺雨随即转发并喊话:“Hy AI4S is hiring .”——没有 JD ,没有岗位描述,就一张成绩单,开始招人。

我们的 AI 已经开始自己搞科研了,现在,需要更多人来扩大战果。

三 、Open AI 紧跟着补了一记重锤

如果说 Hyra 是单点突破,那 OpenAI 的跟进就是一波齐射。

8 月 1 日,OpenAI 宣布其下一代模型系列命名为 Astra ,其中一款内部测试模型已解决或推动解决 10 道长期未解的数学难题,完成相关推理的词元成本仅约 2000 美元。

Astra 的战果覆盖领域

高维几何

编码理论

群论

算子代数

量子复杂度

格密码学

极值组合学


每道题都是开放超过十年、核心进展长期停滞的硬骨头。OpenAI 还公开了一份 249 页的手稿合集,详细展示推理步骤,并附带全部 10 个结果的 Lean 4 形式化证书——代码在 GitHub 上以 Apache 2.0 开源,“sorry”计数为零,意味着形式化证明中没有任何步骤遗漏或未证。

更戏剧化的是,Anthropic 旗下的 Fable 模型在 24 小时内"复现"了其中 5 道。两大 AI 巨头在最前沿的数学疆域短兵相接,人类数学家则被迫卷入一场“验证能力的考验”—— AI 给出的证明,人类检查起来反而很费劲。



四 、AI 从"工具"到"研究员",到底变了什么

把这两件事放一起看,真正震撼的不是某一道题被解开了,而是 AI 在科研中的角色,正在发生质变。

过去的 AI 是“超级计算器”:人类给方向、设目标、判真伪,AI 只在中间环节加速。但现在,Hyra 和 Astra 开始自己提出构造方案、运行推理、读取结果、再继续迭代——从辅助计算,走向了独立提出方案。

这恰恰是腾讯混元此刻招人最耐人寻味的地方。没有 JD ,但能倒推出两类急需人才:

混元想组建的“人机科研队伍”

第一类|造 Agent 的人:Agent 架构、强化学习、上下文学习、自动评估、训练系统、GPU kernel ——把 Research Agent 造得更强。

第二类|懂科学的交叉人才:未必会训模型,但能把科研目标转化为可执行、可评估、可反复优化的任务,也能判断 AI 的结果是真突破还是刷分。

AlphaFold 项目里的结构生物学家、OpenAI 大力招揽的顶尖数学家,都是同一套逻辑。科研智能体时代,最稀缺的不再是只会造模型的人,而是既懂 AI 、又懂具体科学问题的“翻译官”。

五 、踩油门的,和踩刹车的

最后说一个更微妙的信号。

一边,是姚顺雨拿着 AI 刷新数学纪录的成绩单招人,油门踩到底;另一边,是最靠近技术前沿的 OpenAI 和 Anthropic 罕见联合发声,呼吁建立国际协调机制,主动给 AI 发展“踩刹车”。

“ AI 能力的发展存在迅速加速的真实风险,最终可能超出人类理解或控制这些系统的能力。”

表面看,一个在踩油门,一个在踩刹车。但背后指向的是同一个现实:

AI 自进化,已经开始走进真实的科研与研发流程。更微妙的是,AI 现在不仅能研究科学,它还在研究 AI 本身——递归自我改进,已经不再是天方夜谭。

所以真正该追问的,不是“ AI 能不能做科研”——这个问题的答案已经摆在桌面上了。真正该追问的是:

关键控制权,应该交给谁?什么问题值得研究?什么结果可以相信?AI 可以迭代到什么程度,又该在什么时候停下来?

这些,都不能只由 AI 自己决定。

这或许也是“人机科研队伍”这个词最深层的含义——不是 AI 替代科学家,而是科学家 + AI ,组成一种新的科研物种。

至于这个新物种会把科学研究推进到什么程度,回到那句让整个数学圈沉默的热评:

“这可能是最后一届纯人类成果获得菲尔兹奖了。”

没人敢说它一定成立。但也没人,敢说它一定不成立。

南厝姑娘

本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有帐号?注册

x
您需要登录后才可以回帖 登录 | 注册

本版积分规则

Archiver|手机版|小黑屋|数学中国 ( 京ICP备05040119号 )

GMT+8, 2026-8-12 01:19 , Processed in 0.131110 second(s), 16 queries .

Powered by Discuz! X3.4

Copyright © 2001-2020, Tencent Cloud.

快速回复 返回顶部 返回列表