门萨智商测试被AI考爆了
AI,直接把人类的智商测试干爆表了。
门萨挪威智商测试,35道难到离谱的图形推理题,限时25分钟。
Claude Fable 5.1,外加看图作答的GPT-6 Astra杀进考场,结果一道没错,直接轰出了这张卷子的理论极限151分。
而且是最近7次连考,次次满分。151只是卷子的天花板,它们自己的天花板在哪,还没人知道。
放到人类里,全世界近98%的人连130分的门萨入会线都摸不到,你我大概率都在被碾压的那一大拨人里。
不信邪的话,你先试试这张卷子里堪称地狱难度的第33题,答案放在第一节的末尾。
门萨挪威测试第33题
看懵了也别灰心。这题不光虐人,绝大多数AI也在这里栽了跟头。
这张卷子狠就狠在不考任何知识储备,它就甩给你一堆毫无头绪的破图形,看你能不能在一团乱麻里自己揪出规律。
心理学家管这种临场找规律的本事叫「流体智力」,它也是人类自诩聪明、用来碾压机器的最后一道防线。
结果现在,这道防线被AI轰得连渣都不剩了。
人类只测到145,AI考了151
点开TrackingAI的榜单,最先看到的是一条钟形曲线。
那是人类智商的分布,绝大多数人挤在100分附近的山包上。
过去,AI的头像还零零散散落在曲线左边的低分区。
现在,它们一个接一个挤到了曲线最右端那条孤零零的尾巴上,挤得头像都叠在了一起。旁边立着一根竖线,标注写着「本测试最高可能分(暂时)」。
TrackingAI上各家AI的门萨挪威成绩,最右侧竖线是这张卷的满分线
这张榜单是美国记者Maxim Lott攒出来的。
他像个苛刻的监考老师,每周给30多个主流AI做门萨挪威测试,有的模型听文字描述答题,有的直接看原图答题。成绩取最近7次的平均,所以想靠一次好运蒙上榜,门儿都没有。
他用的这套门萨挪威测试,本来是给人类准备的。人去做这张卷子,系统最高只报145分,再往上就不细分了。
而TrackingAI给AI打分,是按答对的题数继续往上换算,35道全对就是151,已经超出了门萨给人类设的量程。
不过,145封顶只是这张卷子的限制,人群里的智商并不封顶。
我们按智商的标准分布估算了一下,151分大约3000个人里才有1个。
放到全球80多亿人里,151分以上的人一共只有270万左右,一座千万人口的大城市里也就三千来个。
门萨俱乐部的入会线是130分,这两位满分AI已经高出整整21分。
而151还只是这张卷子的天花板,要是卷子能接着往上测,到了160分这一档,全世界只剩二十多万人。
AI站着的,已经是人类智商金字塔最顶上那一小撮人的位置。
而且能挤进这一小撮的,远不止这俩怪物。
在TrackingAI的榜单上,GPT-5.6 Sol和Gemini 3.1 Pro考到了145,公开卷上突破140分的模型已经排成一长串,国产模型也杀进了第一梯队。
这么多模型挤在高分段,差距就全拉在了最后几道压轴难题上。
TrackingAI统计过,前10题几乎是个AI就能拿分,到了卷子末尾,第35题只有5个AI做对,第33题更是只剩2个做了出来。
按Lott的换算,35道里错一道就只有148分,所以做对第33题的那2个,基本就是这两位满分选手。
开头那道题说好在这里公布答案,正确选项是E。
每道题做对的AI数量,橙色是门萨挪威卷,第33题只剩2个
满分本身已经够吓人,可要知道,就在几年前,AI还是个严重偏科的学生。
从64分到151分,AI只用两年半
2023年3月,芬兰一位心理评估专家给ChatGPT做了一套正规的韦氏成人智力测验,只考词汇、常识这些语言题。
ChatGPT直接考出155的语言智商,秒杀99.9%的人类。
可一遇到「塞巴斯蒂安孩子的父亲叫什么名字」这种拐个弯的脑筋急转弯,它就当场死机。
非语言部分更是没法测,用这位专家的话说,ChatGPT「没有眼睛、耳朵和手」。


