刚刚,Gemini 4 Pro偷跑上线
真是深藏不漏!
这一次,谷歌终于把底牌扔出来了。
就在这两天,大模型竞技场Arena悄然杀入一款新模型,名字竟挂着「gemini-3.8-flash」。
上手实测的AI大佬和开发者交手几轮后,几乎倒吸一口气——
这极有可能是谷歌DeepMind,悟了整整半年的下一代旗舰Gemini 4 Pro!
一张疯传全网的基准图,简直堪称「恐怖」。
Gemini 4 Pro完全杀疯,编码、智能体、推理等领域实力,全面碾压GPT-6 Astra、Claude Fable 5.1。
开发者Vidhi体验过后,被Gemini 4 Pro完全震惊到了。
一张猫咪的SVG图,就证明了一切。GPT-6 Astra直接扔出了一只「大猫咪」(似猫非猫,更像laofu)。
正如传言所说,谷歌内部实现了RSI,Gemini 4 Pro才能和Astra/Fable正面对打。
沉寂许久的巨兽,真的强势回归了!
Gemini 4 Pro匿名偷跑,击败Astra和Fable
AI圈许久未有这么兴奋了。
要知道,谷歌上一个大版本更新Gemini 3.1 Pro,已经是7个月前(2月19日)的事儿了。
谷歌I/O大会上,劈柴曾预告:Gemini 3.5 Pro将在6月上线。
未曾想,这一重大发布鸽了又鸽,最终「胎死腹中」!
就在这个月初,WSJ独家爆料,Gemini 3.5 Pro取消了,原因很简单——
3.5 Pro的进化程度,连Flash都比不上。
好在,Gemini 4在预训练中评估优秀,后训练还在顺利进行中。
如今,Gemini 4 Pro竟穿上了gemini-3.8-flash的「马甲」,在Arena上首个检查点现身了。
毕竟Gemini 3.8 Flash这款模型,早在9月初发布,同名再出现极不寻常。
一大波上手体验后的开发者们,对4 Pro印象深刻,甚至体感超越了Astra和Fable。
从泄露的基准测试图中,可以发现,4 Pro实现了全面压制,成绩单非常亮眼——
▪︎DeepSWE v1.1:AI智能体编码任务上,4 Pro拿下了最高88.%分,比Astra还要多近2%;
▪︎GDPval-AA v2:在真实知识工作任务中,4 Pro唯一获得了2064 Elo;
▪︎Terminal-bench 2.1:4 Pro终端编码能力也是最强的95.3%;
▪︎OSWorld-2.0:计算机使用能力方面,4 Pro斩获86.8%,击败了Astra和Fable。
若这张表分数属实,Gemini 4 Pro真是「地表最强」的AI了。
在价格方面,相较于Astra和Fable,也是「御三家」中最具性价比的那个。每百万Token输入价格2.25美元,每百万Token输出价格11.25美元。
AI研究员Qwinah进入Gemini 4 Pro后端后发现,它有1000万输入上限,25.6万输出上限,永久跨会话记忆,不用API即可连网。
全网首测4 Pro,登上热搜
真正比跑分更有看点的,是全网一大的波惊艳实测。
UI网页设计,品味大提升
这不,开发者Bee测完之后,直呼「Gemini 4 Pro太不真实了......」
短短14分钟,4 Pro打造了一个以素描、铅笔与石墨质感为主题的「创意展示网页」。
它竟可以将网页的「滚动即笔触」概念化,向下滑动线条逐渐加深,交互感非常丝滑。
下面这个是一个兼具赛博朋克和复古未来主义的工作网站。
4 Pro在设计过程中,首屏结合了3D网格、数据仪表盘,还有可交互的3D模型。
3D+SVG,夯爆了
全网疯传的一个经典「鹈鹕骑自行车」的测试,Gemini 4 Pro输出的效果非常震撼。
配色、日夜切换、车灯、解剖标注、踏频控制,整个完成度完全不输顶尖大模型。
Pankaj Kumar在体验后,直接总结了几个变化:
速度很快,SVG和3D生成明显进步;一次提示就能把复杂要求吃得比较准。
甚至,它已经能直接生成带完整交互逻辑、视觉效果不错的小游戏。
再来看一个像素风3D宝塔测试,有种身临其境的味道了。
下面这个是4 Pro用时10分钟,制作出的空客H145直升机3D模型。


