门萨智商测试被AI考爆了!151满分登顶,99.97%人类被碾压

  新智元报道

  AI,直接把人类的智商测试干爆表了。

  门萨挪威智商测试,35 道难到离谱的图形推理题,限时 25 分钟。

  Claude Fable 5.1,外加看图作答的 GPT-6 Astra 杀进考场,结果一道没错,直接轰出了这张卷子的理论极限 151 分。

  而且是最近 7 次连考,次次满分。151 只是卷子的天花板,它们自己的天花板在哪,还没人知道。

  放到人类里,全世界近 98% 的人连 130 分的门萨入会线都摸不到,你我大概率都在被碾压的那一大拨人里。

  不信邪的话,你先试试这张卷子里堪称地狱难度的第 33 题,答案放在第一节的末尾。

  门萨挪威测试第 33 题

  看懵了也别灰心。这题不光虐人,绝大多数 AI 也在这里栽了跟头。

  这张卷子狠就狠在不考任何知识储备,它就甩给你一堆毫无头绪的破图形,看你能不能在一团乱麻里自己揪出规律。

  心理学家管这种临场找规律的本事叫「流体智力」,它也是人类自诩聪明、用来碾压机器的最后一道防线。

  结果现在,这道防线被AI轰得连渣都不剩了。

  人类只测到 145,AI 考了 151

  点开 TrackingAI 的榜单,最先看到的是一条钟形曲线。

  那是人类智商的分布,绝大多数人挤在 100 分附近的山包上。

  过去,AI 的头像还零零散散落在曲线左边的低分区。

  现在,它们一个接一个挤到了曲线最右端那条孤零零的尾巴上,挤得头像都叠在了一起。旁边立着一根竖线,标注写着「本测试最高可能分(暂时)」。

  TrackingAI 上各家 AI 的门萨挪威成绩,最右侧竖线是这张卷的满分线

  这张榜单是美国记者 Maxim Lott 攒出来的。

  他像个苛刻的监考老师,每周给 30 多个主流 AI 做门萨挪威测试,有的模型听文字描述答题,有的直接看原图答题。成绩取最近 7 次的平均,所以想靠一次好运蒙上榜,门儿都没有。

  他用的这套门萨挪威测试,本来是给人类准备的。人去做这张卷子,系统最高只报 145 分,再往上就不细分了。

  而 TrackingAI 给 AI 打分,是按答对的题数继续往上换算,35 道全对就是 151,已经超出了门萨给人类设的量程。

  不过,145 封顶只是这张卷子的限制,人群里的智商并不封顶。

  我们按智商的标准分布估算了一下,151 分大约 3000 个人里才有 1 个。

  放到全球 80 多亿人里,151 分以上的人一共只有 270 万左右,一座千万人口的大城市里也就三千来个。

  门萨俱乐部的入会线是 130 分,这两位满分 AI 已经高出整整 21 分。

  而 151 还只是这张卷子的天花板,要是卷子能接着往上测,到了 160 分这一档,全世界只剩二十多万人。

  AI站着的,已经是人类智商金字塔最顶上那一小撮人的位置。

  而且能挤进这一小撮的,远不止这俩怪物。

  在 TrackingAI 的榜单上,GPT-5.6 Sol 和 Gemini 3.1 Pro 考到了 145,公开卷上突破 140 分的模型已经排成一长串,国产模型也杀进了第一梯队。

  这么多模型挤在高分段,差距就全拉在了最后几道压轴难题上。

  TrackingAI 统计过,前 10 题几乎是个 AI 就能拿分,到了卷子末尾,第 35 题只有 5 个 AI 做对,第 33 题更是只剩 2 个做了出来。

  按 Lott 的换算,35 道里错一道就只有 148 分,所以做对第 33 题的那 2 个,基本就是这两位满分选手。

  开头那道题说好在这里公布答案,正确选项是E。

  每道题做对的 AI 数量,橙色是门萨挪威卷,第 33 题只剩 2 个

  满分本身已经够吓人,可要知道,就在几年前,AI 还是个严重偏科的学生。

  从 64 分到 151 分,AI 只用两年半

  2023 年 3 月,芬兰一位心理评估专家给 ChatGPT 做了一套正规的韦氏成人智力测验,只考词汇、常识这些语言题。

  ChatGPT 直接考出155 的语言智商,秒杀 99.9% 的人类。

  可一遇到「塞巴斯蒂安孩子的父亲叫什么名字」这种拐个弯的脑筋急转弯,它就当场死机。

  非语言部分更是没法测,用这位专家的话说,ChatGPT「没有眼睛、耳朵和手」。

  看得出来,语言和知识一直是 AI 最拿手的那门课,图形推理才是它最大的软肋。

  而门萨挪威卷考的,恰恰就是图形推理。

  这种矩阵题最早是英国心理学家约翰·瑞文在 1936 年设计的,心理学家普遍把它看作最能测出一个人整体聪明程度的题型。

  AI 啃这块硬骨头,从 1962 年 MIT 第一个做几何类比题的程序算起,硬生生啃了 60 年。

  我们根据公开资料整理的 AI 做智商题时间线

  直到 2024 年初,Gemini Advanced 做门萨卷上最简单的第 1 题,还能一本正经地编出一串「A+B=C」的方程,题里明明没有任何算式。

  2024 年 2 月,Gemini Advanced 做门萨第 1 题,凭空编出一串方程

  Lott 把题一道道翻成文字念给 AI 听,结果也好不到哪去。有的 AI 只蒙对 6 道,考了个耻辱的 64 分,跟闭着眼睛在答题卡上乱涂差不多,最好的 Claude-3 也才刚刚越过人类平均线。

  所以当时的 Lott 断言,AI 还没有人类那种通用智能。没想到半年多以后,转折点就来了。

  2024 年 9 月,OpenAI 的 o1 学会了三思而后行,开口之前先在内部推理,一步步试错、检查,分数一下冲过了 120。

  半年多前还说 AI 不行的 Lott,这回写下的标题是「AI 智能的巨大突破」。

  从此,先想再答成了所有旗舰模型的标配,分数一路往上冲,今年 4 月,榜单上破天荒跳出了第一个 151 分。

  我们根据 TrackingAI 和 Maxim Lott 公开的数据整理,每个点都是当时刷新的最高纪录

  就这样,一个偏科了 60 年的学生,只用两年半,就从 64 分的瞎蒙选手考到了 151 分满分。

  按 Lott 的统计,从 2024 年 5 月到 2025 年 10 月,头部 AI 的智商分数平均每个月狂涨 2.5 分。

  相比之下,人类涨得有多慢,心理学里有现成的数据。

  整个 20 世纪,随着营养和教育改善,人类的智商测验分数大约每十年才涨 3 分,这就是有名的弗林效应。

  这么一比,人类要花 30 多年才爬完的 10 分,AI只要 4 个月就涨完了。

  涨得这么快,任何正常人的第一反应都是,它是不是偷偷把答案背下来了?

  换张没上过网的卷子,照样逼近满分

  Lott 当年也这么怀疑过。

  毕竟门萨挪威测试在网上挂了很多年,题目和答案早被网友扒了个干净。

  连 TrackingAI 自己都把 35 道题的文字版连同正确答案一起公开了,所以 AI 训练时大概率刷过。

  TrackingAI 公开的门萨挪威题文字版,右侧一栏就是正确答案

  为了排除这种可能,2024 年 5 月,他专门找了一位门萨会员从零出了一套新题。

  这套题只找读者试做过一轮用来定分数标准,从没在互联网上露过面,任何 AI 的训练数据里都不可能有。

  换卷之后,刷题效应确实露了出来。直到今天,有的模型一换到这张保密卷就原形毕露,比公开卷掉了二十来分。

  可头部模型换了一张从没见过的卷子,照样逼近满分。

  保密卷只有 16 道题,能打出的最高分大约是 136,OpenAI 的 GPT-5.6 Terra 看图版已经杀到 135。

  Fable 5.1 和 Astra 也都有 130 分,旁边还并肩站着一个国产模型。

  保密卷的成绩分布,这张卷从没上过网,竖线是它的满分线

  去年 10 月,Lott 还胸有成竹地立过 flag,估计 AI 至少要再等两年,才能在这张卷子的看图版上拿满分,说好 2027 年万圣节回来验收。

  结果不到一年,GPT-5.6 Terra 就一脚油门冲到了线前,比他的预测早了一年多。

  既然背答案解释不通,剩下的结论就只有一个,两年半前还在瞎蒙的AI,是真的长脑子了。

  能难住 AI 的题,人类快出完了

  卷子被考满了,出题的人只能接着换更难的。

  所以 TrackingAI 在满分线旁边标的才是「最高可能分(暂时)」。

  Lott 去年底就盘算着,今年要给 130 分以上的区间补一批更难的题,好把高分段的 AI 重新拉开差距。

  当然也有人不服。

  「Keras 之父」François Chollet 设计了一套专门为难 AI 的推理测试 ARC-AGI。

  他前不久还放话,如果把智能定义成把经验转化为能力的效率,也就是见同样多的例子谁学得更快,现在的 AI 大约还落后人类 6 个数量级,差了一百万倍左右。

  偏偏 Chollet 自己给 AGI 划的终点线,也落在出题上。

  今年 2 月他透露,ARC-4 正在憋大招,明年初发,后面还要出到第6、第 7 代。

  用他自己的话说,关键是一直出新题,直到再也提不出人类能做、AI却做不到的题为止。

  他当时给 AGI 估的时间是 2030 年前后。

  这个月初有人再问他,2030 年的判断还作不作数,他改口说会更早,因为进展比他预想的快。

  有人问 Chollet,2030 年实现 AGI 的判断还算不算数

  智商测试诞生于 1905 年。120 年来,从学校分班到军队挑人,人类一直心安理得地用这把尺子给同类排座次。

  这把尺子背后藏着一个人类几乎从没怀疑过的前提,被测量的只会是人,能站上最高刻度的也只能是人。

  如今尺子还在,前提却已经塌了。一个压根不是人的东西,顺着刻度从头爬到了尾,最顶端的那根线也没能拦住它。

  Lott 还可以出更刁钻的卷子,Chollet 也能接着掏出下一代 ARC。

  可照着 AI 两年半从瞎蒙到满分的速度,人类的大脑里还能榨出多少道 AI 解不出的题,已经没人敢打包票。

  等到人类题库彻底枯竭的那一天,我们要重新思考的就不只是 AI 到底有多聪明,还有剥掉「聪明」这层外壳之后,人类自己究竟还剩下些什么。

  参考资料:

  https://x.com/aisafetymemes/status/2103369359481852116

  编辑:摩西