数学圈与人工智能界,这回算是彻底搅和到了一块儿。
作者丨高允毅
编辑丨马晓宁
那种原本只属于纯数学领域的硬核成果,如今已经实打实地跑进了大模型训练的流水线。
有个叫Z9的小红书博主在梳理文献时留意到,最近全网热议的三维挂谷猜想,被佛罗里达大学的研究团队直接“搬运”到了神经网络训练流程里,打算用跨界手段去破解大模型的“黑盒难题”。
他们发表的论文题为《GeoLAN: Geometric Learning of Latent Explanatory Directions in Large Language Models》,核心逻辑是利用挂谷猜想证明过程中衍生出的关键概念——“粘性挂谷集”,为大模型内部的语义空间确立一套“摆放规范”。这就好比从训练伊始就把纠缠在一起的概念理顺,让AI的思考轨迹变得真正可追溯。
这局面,恰似前人开荒,后人寻宝。
01
大模型的底层通病:表征坍塌
咱们先从大家都有切身体会的“黑盒问题”聊起。
眼下的大模型,无论是解题、写代码还是做分析,准确率都相当可观。可一旦追问它“这一步是怎么推导出来的”,它往往含糊其辞,或者直接编造一个看似合理的理由来搪塞。
这个问题的根源,深植于一个叫“表征坍塌”的底层特性之中。
不妨把大模型的语义空间想象成一个拥有数千层货架的巨型智能仓库。理论上,这里能分门别类地收纳无数概念:逻辑、情感、事实、推理等,各自占据独立位置。
但在Transformer的训练机制中,模型表现得颇为“偷懒”。它倾向于把所有语义信息一股脑堆砌在仓库入口的一小块区域,而任由剩下九成空间闲置。
后果便是,所有概念被迫挤入一个狭窄的高维锥形区域内,学界将此现象称为“各向异性”。
这种拥挤状态会引发一系列连锁反应。
例如,概念纠缠会导致风马牛不相及的内容被强行塞入同一方向,致使单个神经元既要响应“猫”,又要激活“圣经经文”。
更麻烦的是,你根本无法厘清哪部分表征对应哪条逻辑链条,连模型自身都无法还原真实的思考路径。
当相近却不同的概念被挤压在一起,混淆便随之而来。只需稍微变换提问方式,AI就容易胡言乱语。
对此,论文中有个精准概括:少数几个“流氓维度”霸占了大部分信息方差,白白浪费了模型的有效容量。
这几乎是所有主流Transformer架构的通病,从GPT、Llama到Gemma,无一幸免。
面对这一困局,行业过往的解法多是“事后补救”,即等模型训练完毕,借助稀疏自编码器等工具,强行拆解纠缠的概念。
但这种拆出来的结果往往只是“看起来合理”,未必契合模型内部的真实逻辑,保真度始终难以达标。
现在,GeoLAN的思路来了个急转弯:别等乱了再收拾,从一开始就按规矩摆好。它在训练全程给表征空间施加几何约束,确保每个概念都能各归其位。
02
挂谷猜想怎么和 AI 扯上关系?
要读懂GeoLAN的逻辑,得先弄明白挂谷猜想到底在说什么。
1917年,数学家挂谷宗一提出了一个看似简单,却折磨数学界半个世纪的难题:拿一根1厘米长的针,在桌面上转一圈,它扫过的最小面积是多少?
外人或许以为,转一圈总得画个圆,面积肯定不小。但数学家们发现,这个面积可以无限接近于零。
怎么做到的?
如果让针一边旋转一边滑动,它竟能扫出一个面积几乎为零的奇异图形。这意味着在二维世界里,全方位的几何轨迹可以被塞进极小的角落。
挑战随即升级:若置于三维空间呢?当这根针能在上下左右及无数个立体方向上旋转,要把这些全方向的针全部容纳进一个空间,该空间最少需要多大?
基于二维经验,在三维空间中,这个图形的绝对体积依然可以被压缩至接近零。
但这引出了新谜题:虽然图形空洞无体积,但其微观结构是否也发生了萎缩或退化?数学家引入“分形维数”来衡量其骨架的密实程度。
最终,王虹等人证实,即便将图形体积压榨得再空洞,为了兼顾每一个方向的针,其内部交织的骨架仍保持着坚实的“三维饱满度”,微观维度上丝毫未退化。这正是王虹终结世纪难题的关键所在。
正是在这项硬核证明中,诞生了一个极为核心的概念——“粘性挂谷集”。
所谓“粘性”,实则是一套防挤压规则。它专门约束线段和管状结构,防止它们相互靠拢。
若一组管子遵守此规,便会乖乖铺开,保持应有的空间大小;反之,若不守规矩全挤在一个小角落,空间的“体量”就会缩水,宛如被压扁一般。
读到此处,你应该能对应上了:大模型的表征坍塌,本质上不就是“语义管子不满足粘性条件,导致全线扎堆”吗?
GeoLAN的做法,是直接将挂谷猜想的数学结论转化为工程标准:既然数学已严格证明“满足粘性则空间不坍缩”,那我们就给大模型的语义空间加上同款粘性约束,使其表征天然避免挤压。
要将此规则植入训练过程,关键在于构建一个可量化的惩罚函数,即让模型能够计算并据此调整的惩罚机制。
为此,GeoLAN设计了两套可计算的惩罚规则,将挂谷猜想中的几何法则转化为训练目标。其一为KT-CW,专治“语义扎堆”;其二为KT-Attn,专治“注意力偷懒”。
KT-CW的原理很简单:训练时随机抽查语义空间的各个方向。一旦发现某方向堆积了过多语义信息,便对模型进行扣分。此举迫使模型将知识均匀铺满整个高维空间的每个角落,充分利用此前闲置的维度,从根源上解决“拥挤”问题。
另一套KT-Attn则针对注意力机制的懈怠行为。大模型的注意力头在训练后期常陷入严重同质化,许多头终日只盯着同一个词或位置打转,有效劳动力极少。该规则强制规定每个注意力头必须关注截然不同的语义区域,确保注意力实现全方向覆盖,从而根治注意力头的秩坍缩现象。
这套组合拳效果立竿见影。
在Llama-3-8B上,GeoLAN硬是将原本被挤扁的锥形表征空间揉捏成圆润的球形,显著降低了拥挤程度,提升了各方向的均匀性,同时保持了任务准确率。
在Gemma-3-4B上,MMLU准确率从0.59提升至0.60,增幅约0.75个百分点。TruthfulQA的语义稳定性也有显著改善。
在更大体量的Gemma-3-12B上,偏见率指标也在统计学层面出现了明显下降。
更有意思的是,论文还揭示了一个名为“金凤花区”的现象。
即均匀分布这套严苛的几何约束,对于参数量过小的模型而言反而是灾难。小模型天生依赖概念纠缠来实现极致的语义压缩,强行打散只会导致内部几何结构恶化。
而对于体量庞大的巨无霸模型,其庞大的预训练过程已自发建立起极其复杂的流形结构,再加这套规则不仅水土不服,还会拖累整体性能。
唯有像四到八十亿参数这样的中等体量模型,恰好拥有足够空间来消化均匀分布带来的红利,效果反而最佳。
不仅如此,论文还推导出了一个精妙的定理——“语义粘性定理”:当表征满足“防挤规则”时,不同的语义概念会自动分解为近似互相垂直的子空间,论文将其形象地称为颗粒。每个子空间均可独立解释、独立调整,这意味着困扰业界多年的黑盒问题就此变得透明。
一篇ACL论文,一把将挂谷猜想从纯数学殿堂拽入了AI工程现场。
03
菲尔兹奖得主,当天宣布加入OpenAI
另一个引人瞩目的细节是,本次菲尔兹奖得主之一,数学大佬Jacob Tsimerman,在获奖当天便宣布,未来将很快入职OpenAI,投身AI安全领域。
这让人不得不正视前沿数学与AI之间日益紧密的联系。
就在一年前,他与伯克利AI安全研究者Andrew Critch合著了论文《A Taxonomy of Omnicidal Futures Involving Artificial Intelligence》,以数学家的极致严谨,为AI风险路径搭建起严密的分类体系。
他本人更是AI的重度受益者。在2025年,他有5篇数学论文上线arXiv,直言AI让自己的科研产出效率直接翻了一番。
更具戏剧性的是,在颁奖前三天,有人借助Anthropic最新的Claude Fable 5,一夜推翻了悬置87年的雅可比猜想,震动全球数学界。此人正是他的学生Levent Alpöge。
面对AI不断逼近甚至超越顶级数学家“智商”的趋势,连数学泰斗蒂莫西也公开感叹:这是他生平首次见到大语言模型在自己完全陌生的领域,轻松攻克家喻户晓的世纪难题。
数学与AI的关系,早已超越了“密不可分”的描述范畴,二者正以惊人速度融为一体。
回顾过去一年AI在数学竞技场上的成绩单:从DeepMind的AlphaProof在国际奥数赛场斩获银牌,到OpenAI的推理模型一举推翻埃尔德什单位距离猜想这桩八十年悬案,再到GPT-5.6仅用一小时搞定循环双覆盖猜想,以及Claude Fable 5一夜荡平雅可比猜想。短短两个月内,AI连续创下多项世纪纪录,且攻坚速度呈指数级加快。
在AMS访谈中,Jacob直言:“数学界存在大量‘自我安慰’,大家盯着AI现在不如数学家,就推断它永远不如数学家。”他用自己的实践证明,虽然模型的证明“不完整、不严谨”,但“通常能拉出大致正确的方法,帮你走完八成的路”。
他甚至认为,两年内,AI在数学证明这件事上,将全面超过人类。
那么问题来了:四年后的2030年菲尔兹奖,还会有人类得主吗?
菲尔兹奖有硬性年龄限制,获奖者必须未满40岁。这意味着,如果AI在未来四年内系统性超越人类数学家的原创发现能力,评审委员会将面临前所未有的困境:你是把奖颁给做出最好数学工作的人,还是颁给“人类中做出最好数学工作”的人?
更耐人寻味的是数学与AI的双向加速。三维挂谷猜想刚被证明,三个月后便诞生了GeoLAN,纯数学成果直接落地为大模型训练工具。今天菲尔兹奖上表彰的André-Oort猜想、希尔伯特第六问题突破,明天又会演化出何种AI能力?
过去常说,数学家在前头拓荒,AI在后面捡宝。但现在,捡宝的那个,已经开始自己开路了。
参考链接:https://arxiv.org/html/2603.19460v1
上车,雷峰网带你看遍全球 AI 顶会精华
可独家畅览:
专家演讲PPT
大会报告全文
热门论文解读
学术新星访谈
【站点差异】本稿将发布到 kuaixianchao.com。请换一种措辞、句式与段落节奏,避免与发往其他站点的版本雷同;事实与数字仍必须与原文一致。















