刚刚,Gemini 4 Pro偷跑上线

新智元 · 经八阕原文

真是深藏不漏!

这一次,谷歌终于把底牌扔出来了。

就在这两天,大模型竞技场Arena悄然杀入一款新模型,名字竟挂着「gemini-3.8-flash」。

上手实测的AI大佬和开发者交手几轮后,几乎倒吸一口气——

这极有可能是谷歌DeepMind,悟了整整半年的下一代旗舰Gemini 4 Pro!

一张疯传全网的基准图,简直堪称「恐怖」。

Gemini 4 Pro完全杀疯,编码、智能体、推理等领域实力,全面碾压GPT-6 Astra、Claude Fable 5.1。

开发者Vidhi体验过后,被Gemini 4 Pro完全震惊到了。

一张猫咪的SVG图,就证明了一切。GPT-6 Astra直接扔出了一只「大猫咪」(似猫非猫,更像laofu)。

正如传言所说,谷歌内部实现了RSI,Gemini 4 Pro才能和Astra/Fable正面对打。

沉寂许久的巨兽,真的强势回归了!

Gemini 4 Pro匿名偷跑,击败Astra和Fable

AI圈许久未有这么兴奋了。

要知道,谷歌上一个大版本更新Gemini 3.1 Pro,已经是7个月前(2月19日)的事儿了。

谷歌I/O大会上,劈柴曾预告:Gemini 3.5 Pro将在6月上线。

未曾想,这一重大发布鸽了又鸽,最终「胎死腹中」!

就在这个月初,WSJ独家爆料,Gemini 3.5 Pro取消了,原因很简单——

3.5 Pro的进化程度,连Flash都比不上。

好在,Gemini 4在预训练中评估优秀,后训练还在顺利进行中。

如今,Gemini 4 Pro竟穿上了gemini-3.8-flash的「马甲」,在Arena上首个检查点现身了。

毕竟Gemini 3.8 Flash这款模型,早在9月初发布,同名再出现极不寻常。

一大波上手体验后的开发者们,对4 Pro印象深刻,甚至体感超越了Astra和Fable。

从泄露的基准测试图中,可以发现,4 Pro实现了全面压制,成绩单非常亮眼——

▪︎DeepSWE v1.1:AI智能体编码任务上,4 Pro拿下了最高88.%分,比Astra还要多近2%;

▪︎GDPval-AA v2:在真实知识工作任务中,4 Pro唯一获得了2064 Elo;

▪︎Terminal-bench 2.1:4 Pro终端编码能力也是最强的95.3%;

▪︎OSWorld-2.0:计算机使用能力方面,4 Pro斩获86.8%,击败了Astra和Fable。

若这张表分数属实,Gemini 4 Pro真是「地表最强」的AI了。

在价格方面,相较于Astra和Fable,也是「御三家」中最具性价比的那个。每百万Token输入价格2.25美元,每百万Token输出价格11.25美元。

AI研究员Qwinah进入Gemini 4 Pro后端后发现,它有1000万输入上限,25.6万输出上限,永久跨会话记忆,不用API即可连网。

全网首测4 Pro,登上热搜

真正比跑分更有看点的,是全网一大的波惊艳实测。

UI网页设计,品味大提升

这不,开发者Bee测完之后,直呼「Gemini 4 Pro太不真实了......」

短短14分钟,4 Pro打造了一个以素描、铅笔与石墨质感为主题的「创意展示网页」。

它竟可以将网页的「滚动即笔触」概念化,向下滑动线条逐渐加深,交互感非常丝滑。

下面这个是一个兼具赛博朋克和复古未来主义的工作网站。

4 Pro在设计过程中,首屏结合了3D网格、数据仪表盘,还有可交互的3D模型。

3D+SVG,夯爆了

全网疯传的一个经典「鹈鹕骑自行车」的测试,Gemini 4 Pro输出的效果非常震撼。

配色、日夜切换、车灯、解剖标注、踏频控制,整个完成度完全不输顶尖大模型。

Pankaj Kumar在体验后,直接总结了几个变化:

速度很快,SVG和3D生成明显进步;一次提示就能把复杂要求吃得比较准。

甚至,它已经能直接生成带完整交互逻辑、视觉效果不错的小游戏。

再来看一个像素风3D宝塔测试,有种身临其境的味道了。

下面这个是4 Pro用时10分钟,制作出的空客H145直升机3D模型。

来源:新智元(经八阕转载) · 查看原文
Scroll for more