刚刚,阿里Qwen3.8-Max来了量子位
不er?你告诉我现在搁哪儿还有便宜还好用的模型啊……(真心发问.jpg)
说时迟那时快,友友们,这不就来了嘛!!!
就在刚刚,阿里巴巴突袭发布新一代基座大模型Qwen3.8-Max。
用四个字概括就是:「能打」「便宜」。
总参数量达到2.4万亿,在编程、专业工作、长程任务、多模态智能体等场景上的表现直接next level。
就在今天最新放榜的权威第三方榜单Arena中,Qwen3.8-Max更是一路冲到全球大模型第一梯队,表现直逼Anthropic的Claude系列模型:
△Text Arena文本能力榜单,包含数学、代码、创业写作等领域
在编程表现上,Qwen3.8-Max甚至还超过了Claude Opus 5和Fable 5的High版本,确实有亿点不简单???
△编程能力(前端)榜单,考察多步骤推理及工具调用的编程智能体能力等
性能能打是一方面,关键是吧,人家连价格也一块打了下来——
国内每百万Tokens输入12元、输出36元,隐式缓存命中仅1.5元,输入与输出的国际价格仅为Opus5的40%与24%……真·便宜大碗。
性价比高,能力还强,那还了得?
瞧嘛,此前抢先体验Qwen3.8-Max预览版的网友,已经火速交上第一批实!测!反!馈!
看下面这位老哥,直接用Qwen3.8-Max复刻了一版《愤怒的小鸟》,直言价格很合适,一周使用下来额度消耗不到九成,赞!
还有网友只用一条提示词,就用Qwen3.8-Max搭出了一个完整、可交互的开发者作品集,最后给出的评价也相当言简意赅:《夯》!
哦对了,还有一堆网友们,已经针对模型「超能打」的表现开始聊得火热朝天了!
下面这位友友表示,已经迫不及待想把Qwen3.8-Max用起来了,顺便还不忘祝A社、O社IPO好运~(夺笋啊)
下面这位网友还提到,Qwen3.8-Max基准测试都把5.6-Sol给KO了,大家对A社和OpenAI的期待恐怕也得跟着变——
毕竟又贵又闭源,门槛确实摆在那儿......
还有朋友实测后感慨,Qwen3.8-Max的表现甚至超过了Fable 5,这波能力属实有点超出预期了奥!
真·有口皆碑了也是。
既然,Qwen3.8-Max来都来了,我们也直接实测一波,看看模型到底能不能打!
编程、专业工作、长程任务、多模态分析统统梭哈!
说实话,阿里Qwen的前几代模型我几乎是发了一个测一个,零零散散测下来,最大的感受就是——
确实夯,也确实能打……
而这次到了Qwen3.8-Max,感觉又不一样了,因为面对真实世界里的复杂问题,这模型已经能一路拆解、执行,直到交付最终成果了。
在具体评测表现中,Qwen3.8-Max在科研复现、多模态理解、长视频和电脑操作多项超越GPT-5.6、Opus 4.8与Fable 5,在编程、终端Agent和专业工作也稳居行业头部——
贴心的我,也帮大家浅浅总结了一下Qwen3.8-Max的亮点能力,让大家一睹为快!
编程能力:能把复杂任务端到端地自主交付,理解需求、搭建工程、运行实验、检查结果、继续优化全流程梭哈。官方披露的一个极端案例是,它能从一个空文件夹出发、在无人干预下自主推进十多天,最终交付一个真实可用的完整项目。
长线程任务:具备系统级自主规划与执行能力,在数千轮超长程交互里也不迷失目标。
专业工作:能一次交付需要返修3到5轮的APP原型,也能在一小时内处理数百份法律文档,完成上千个条款标注。
多模态智能体:几百页的复杂材料、上百小时的视频内容都能消化,还能顺手整理成直接可用的成果。
我:如此之能干,如此之务实,还有这好事儿?那我可就直接狠狠一个大测特测!!!
Vibe一下,编程能力大考验
既然,Qwen3.8-Max如此擅长AI Coding,那我们直接上来就考察一下这模型的「编程本事」。
好巧不巧的是,最近的我正愁每周例会上该怎么把这一周的AI热点捋清楚,做成一份能给领导交差的分享。
这下好了,我索性把这事儿交给Qwen3.8-Max~(鬼点子生成中)
不过,光用一句提示词搭个网页,多少有点太简单了,于是乎——
我直接化身产品经理,喂给了Qwen3.8-Max整整一大页产品需求,让它「从零」开发一个可运行的AI资讯网页。
在具体需求上,我不仅明确要求了网页需要具备的核心功能,还对数据、页面体验、技术约束、验收标准、交付要求进行了明确约束,主打一个狠狠刁难!!!
大概过了5分钟。


