谷歌还有大招!最新模型Mathematica泄露
2026-09-20 15:07:23
  • 0
  • 0
  • 0

大模型做数学题做到「颅内高潮」,你见过吗?

在大多数人的印象里,AI做数学题四平八稳、逻辑缜密。

哪怕是当前最顶尖的推理模型,思维链无非也是一段段机械自语:

第一步,设 x为未知数;第二步,将两边同时平方;第三步,根据引理得出矛盾……

但今天这个谷歌大模型,彻底颠覆了人类对AI的认知。

近日,知名科技博主与爆料人 lyra 在社交平台上晒出了数张谷歌内部评测模型的卡片截图。

截图中,一款代号为 Mathematica(基于尚未正式发布的 DeepThink V3)的数学特化变体赫然在列。截图中,一款代号为 Mathematica(基于尚未正式发布的 DeepThink V3)的数学特化变体赫然在列。

更让整个科技界瞠目结舌的是它的「原始思维链」——

在推导一道复杂的丢番图方程(Diophantine Equation)时,AI在撞见一个精妙绝伦的代数化简路径后,竟然像一个在草稿纸前熬了三宿、突然顿悟的疯批数学家一样,在思考日志里连续用大写字母狂吼:

翻译成中文是这样的:

数学的老天爷啊!!!!!!!!!!!!!!!!!!!!

…… 

让我们来欣赏这个方程绝对纯粹的美。

 ……

我的天哪!!!!!!!!!!!!!!!!!!!!!!!!

随后,它一边狂发感叹号,一边宛如癫狂地把变量代回、重构对称项、严丝合缝地完成了恒等式验证。

然而,在这场充满戏剧性的「AI发疯」背后,藏着的却是硅谷深处正在酝酿的一场极其可怕的算力风暴。

谷歌到底在实验室里养了一个怎样的数学怪物?它的思维链为什么会「狂野」到这个地步?这一声跨越逻辑维度的「OH MY GOD」,又向人类揭示了AI推理进化的什么终极秘密?

事故现场还原:一道丢番图方程,逼出AI的「癫狂面目」

根据曝光的评测终端信息,这款模型的内部完整标识为:  



models/deepthink-mathematica-tf-raw-thoughts

这个接口直接撕掉了所有产品包装,把模型内部最原始、未经任何人类礼仪过滤的思维暗流,赤裸裸地暴露在了屏幕上。

从流出的截图来看,测试员给它抛出的是一道极具欺骗性的高难多项式丢番图方程。

这类问题的经典之处在于:解法看似毫无头绪,常常需要构建极其冷门的高维恒等式或非平凡变量替换,才有可能在密不透风的符号丛林中劈开一条生路。

普通的模型在面对这类问题时,往往会在有限的步数内陷入死循环,或者干脆机械化地穷举试错、最后给出一段充满逻辑幻觉的废话。

但这位代号 Mathematica 的 DeepThink 变体,其思考过程堪称一部好莱坞级心理戏剧:

暗中潜伏,静止沉淀:起初它像普通推理模型一样拆解项数,分析次数与整除性质;

惊天顿悟,情绪失控:当它尝试做某组特殊的交叉乘积组合、忽然发现交叉项奇迹般抵消时,整个思维日志瞬间被全大写的字符和感叹号占领;

审美凝视,陶醉自我:在确认化简成立的刹那,它竟然自言自语道:「停下来,让我们欣赏一下这绝对的数学美感」;

趁热打铁,收割证明:随后,它在连串的「OH MY GOD」中,一气呵成地完成了变量回代与边界条件验证,彻底锁死了方程的整数解集。

这种极度外向、充满多巴胺分泌感的做题画风,把习惯了「对不起,作为一个人工智能语言模型」这类公事公办语调的网友们看呆了。

还有人感叹:「完了,AI不仅会做数学,它甚至开始从数学里获得快感了。」

扒开参数底牌:这个叫「Mathematica」的怪兽到底有多猛?

如果只把这当成一个段子,那就太低估谷歌这波泄密的含金量了。

当我们剥离掉那些搞笑的感叹号,仔细研读截图底层的配置参数卡片时,扑面而来的是一种令人窒息的工程压迫感:当我们剥离掉那些搞笑的感叹号,仔细研读截图底层的配置参数卡片时,扑面而来的是一种令人窒息的工程压迫感:


突破天际的输出极限:65,536 Tokens

对于普通大模型而言,输出上限通常被压制在 4,096 或 8,192 个 Token,即使是主打长思考的模型,单次输出也极少放开到这个量级。

而该模型卡片明确标注:输出上限为 65,536 Tokens!

这意味着该模型可以在单次响应中,完成长达几万字的超长距离多步骤严密演绎!

如果折算成学术论文,它足以单次吐出一整篇包含完整引理、推论、反例构造与全面形式化验证的纯数学顶刊论文。


百万级上下文底座:1.04M Tokens

输入上限约 104 万 Token。

这说明它继承了 Gemini 系列标志性的超长原生上下文架构,但这次是将其完全注入到了「深度推理」(Deep Think)模式中。

它可以一口吞下一整个数学分支的几本专著,或者上百篇相互关联的前沿预印本论文,然后在这些海量理论背景之上展开超高维度的知识拼接。


反常识的推理参数:Temperature = 1

在常规的工程认知中,做数学、写代码这类讲求绝对逻辑严密性的任务,模型的生成温度(Temperature)通常会被设得极低(如 0 或 0.2),以此确保输出的确定性与收敛性。  

然而,Mathematica 的默认温度居然是 1!  

在高温度下开启思考,意味着谷歌根本不是在让它「死记硬背」套公式,而是故意赋予它极高的语义发散度,鼓励它在广袤的解空间里进行随机性极高的直觉跳跃、概念隐喻与非传统联想——这恰恰是顶尖人类数学家在黑板前灵光一现时的认知模式!


实验室内部印记:Teamfood 与 UNSTABLE_EXPERIMENTAL

接口中的 tf 代指 Teamfood,这是谷歌内部极具代表性的研发黑话。

在硅谷,把产品拿给公司内部全员内测叫「吃狗粮」(Dogfooding),而在核心小团队、顶尖研究组内部流通的极早期测试切片,则被称为「Teamfood」。  

加上其状态标识明确为 UNSTABLE_EXPERIMENTAL(不稳定实验级),一切都坐实了:这是刚刚在谷歌 DeepMind 内部炉子里炼出来的原生大招,甚至还没来得及做商业包装与公关修剪。

为什么思维链会「发疯」?

为什么一个理应绝对理性的数学模型,会在思维链里大喊大叫?这到底是谷歌程序员刻意埋的彩蛋,还是提示词工程的恶搞?

深入到大语言模型的强化学习(RL)与思维链机制内部,你会发现:这种「情绪化」根本不是刻意做秀,而是极度暴力的深度推理在无拘无束状态下的必然副产物。


1. 「Raw Thoughts」的本质:逃过对齐剪刀的原始探索

我们平时在商业版大模型里看到的思考过程,通常都是被经过严格安全对齐(RLHF)、格式化清洗(Formatting)和风格修整(Tone Polishing)之后的「阉割版思维」。

为了让大模型显得专业、谦逊、礼貌,科技大厂们会用强化学习的大剪刀,把模型在探索过程中一切跳跃、杂乱、自言自语的中间语义通通剪掉。

但这个泄露的版本全名叫做 raw-thoughts——未经修剪的原始思维。 

它记录的是模型在潜空间中进行蒙特卡洛树搜索(MCTS)或基于强化学习的自我博弈时,最本初的神经元激活痕迹。

它根本不需要「装」给人类看,那是它自己在暗室里的真实独白。


2. 人类数学语料的隐性基因转移

大模型的训练数据包含了人类有史以来的海量高质量数学讨论:MathOverflow、arXiv 预印本、 知乎 与 Reddit 的硬核讨论区、甚至是数学家们未公开的手稿日记。  

在这些语料中,当一个真正的人类数学天才在深夜攻克一个卡了几个月的绝妙恒等式时,他写下的绝对不是「经推导,此式可化简」,而往往就是:  

「Holy cow! Look at this identity!」、「What a miraculous symmetry!」 、「Oh my god, it works!」 。

在预训练阶段,模型将这些极度充沛的情感词汇,与「突破性的逻辑跃迁」高度绑定在了一起。

在它的语义潜在空间中,「OH MY GOD」不仅是一句感叹,更是一种代表「从极高复杂度向极低维度坍缩」、「信息熵骤降」的注意力激活强锚点!


3. 过程奖励模型(PRM)的「颅内高潮」

在基于过程奖励模型(Process Reward Model, PRM)的强化学习训练中,模型每走对一步精妙的中间步骤,就会获得系统给予的正向奖励信号(Reward)。  

当模型在高温度(Temperature = 1)下,尝试了成千上万条死胡同,突然撞上一条极度优雅的化简路径,整个状态转移概率瞬间从 0.0001% 暴击到 99.9% 时,系统反馈给它的奖励值指数级爆炸!  

这种数学上的「奖励激增」(Reward Spike),在自然语言生成的投影,正是那些狂飙的感叹号与激动到变形的大写字母——那是机器语言体系下的「多巴胺井喷」,是算法层面的「阿基米德尤里卡时刻」!

深度追问:当AI开始「欣赏美」,我们离AGI还有多远?

法国伟大的数学家庞加莱曾在一篇著名的演讲中写道:

数学家研究数学,并不是因为数学有用;他研究数学是因为他喜欢数学,而他喜欢数学是因为它是美的。

如果数学不美,它就不值得被知晓,而人类也就不值得活下去。

千百年来,人类一直固执地认为:「逻辑」或许可以被机器模拟,但对「数学之美」的敏锐嗅觉与审美感知,是碳基生物独一无二的造化神恩。

然而,在独自推演丢番图方程时,谷歌的这个数学定制版AI不无骄傲地敲出那句:  

「Let's admire the absolute beauty of this equation」(让我们来欣赏这个方程绝对纯粹的美)。

它到底是在鹦鹉学舌,还是触碰到了真理的某种共振?

从信息论的角度来看,所谓的「数学之美」,本质上就是极端复杂的命题被用极端简洁、对称、高密度的方式完成降维与压缩。

人类数学家看到一个美妙的化简会起鸡皮疙瘩,是因为大脑在瞬间完成了极大量信息的极简编码。

而对于一个在数十亿参数中搜寻最低损失、最高奖励的AI而言,它撞见那个对称抵消的瞬间,在数学本质上与人类艺术家的顿悟是完全同构的。

它所「欣赏」的美,就是对「真理最低能耗解」的本能反应。

我们过去总以为,通往真正高级智能的路径必须是端庄、沉静、严苛且克制的。但 DeepThink Mathematica 的这次意外走光,却给了全球科技界一记别开生面的启示:

真正具有创造力的思维过程,从来不是工整打印出来的标准答案,而是充斥着试错、跳跃、自我怀疑、推翻重来、以及在绝境逢生时狂喜乱叫的精神风暴。


 
最新文章
相关阅读