阿里发布千问3.8-MAX,2.4万亿个参数华尔街日报

8/2/2026

阿里巴巴发布千问3.8-Max,参数规模达2.4万亿,是千问家族迄今最强模型,也是首个开源Max级权重的版本(下周发布)。API定价输入2.0美元/百万tokens、输出6.0美元/百万tokens。基准测试显示其编程与通用智能体能力与Anthropic Fable5相当,部分指标超越,并在芯片设计、量化研究、电商模拟等长程任务中展现出显著的自主执行能力。

阿里巴巴旗下千问(Qwen)团队于8月3日正式发布千问3.8-Max,总参数量2.4万亿,激活参数95B,是千问家族迄今规模最大、能力最强的模型。这也是千问首次将Max级别模型开源——权重将于下周在开源社区Hugging Face和ModelScope发布。

定价方面,千问3.8-Max通过千问AI平台(阿里云)提供API调用:输入2.0美元/百万tokens,输出6.0美元/百万tokens,隐式缓存0.25美元/百万tokens。

基准测试显示,千问3.8-Max在编程智能体和通用智能体多项指标上与Anthropic Fable5表现相当,部分指标超越后者。例如,PaperBench得分93.0,高于Fable5的88.8;CoWorkBench得分74.8,与Fable5的75.9接近;WideSearch得分81.9,与Fable5的81.2持平。

性能:与 Fable 5 相当,部分超越

根据千问团队发布的完整基准测试数据,Qwen3.8-Max 在多个核心指标上与 Anthropic Claude Fable 5 持平或超出:

▪︎ PaperBench(论文能力):Qwen3.8-Max 得分 93.0,超过 Fable 5 的 88.8 和 GPT-5.6 Sol 的 90.5

▪︎ IFBench:Qwen3.8-Max 82.8,Fable 5 为 63.5,GPT-5.6 Sol 为 72.7

▪︎ HealthBench:Qwen3.8-Max 60.2,超过 GPT-5.6 Sol 的 55.3

▪︎ CoWorkBench(通用协作):Qwen3.8-Max 74.8,Fable 5 为 75.9,差距极小

▪︎ JobBench(AI工作能力):Qwen3.8-Max 53.4,接近 Fable 5 的 57.4

多模态方面同样表现突出:

▪︎ OSWorld-Verified:Qwen3.8-Max 86.1,超过 Fable 5 的 85.0

▪︎ AndroidWorld:85.3,Fable 5 为 88.8

▪︎ MLVU(长视频):90.8,Fable 5 无数据

值得注意的是,Fable 5 的部分结果可能包含回退机制,千问团队在注释中对此作了说明。

编程能力:从空文件夹到生产级交付

千问团队用三个真实案例测试了千问3.8-Max的自主编程能力,全程无人工介入。

案例一:十天级自动编程。 模型从零创建oh-my-cli项目,自主运行约16天,累计完成265次commits、127个PR、151个issues。它将用户反馈、社区实践与自测结果统一纳入工程循环,实现需求自动领取、代码生成、测试验证的完整闭环。

案例二:复现并超越论文。 模型独立工作约125小时,写下约7,600行代码,执行超过1,100步操作,跑了33轮GPU训练,完整复现了论文《Unified Data Selection for LLM Reasoning》的六项主要结论。随后进入"自我进化"阶段,提出并测试18种改进方案,最终在竞赛级数学基准AIME24上比论文原方法再提升2.7分。

案例三:24小时击败87%人类队伍。 模型参加WWW2025多模态对话意图识别挑战赛,在526支人类队伍中,经45次提交迭代,准确率从0.60升至0.853,击败458支队伍。

办公与长程任务:数百职业场景的生产级验证

千问团队在数百种高价值职业场景中测试了千问3.8-Max的实际交付能力。

企业合规律师:单次通读数百份文档,标出1,284条相关条款,一小时内完成——同等工作通常需要法务团队约一周。

UI/UX设计师:生成包含8个页面的高保真可交互原型,全程未经人工返修。

结构工程师:仅凭一份图纸,在浏览器中还原30层写字楼的抗震结构模型,传统流程需一周以上。

量化研究:从一句任务描述出发,调度约330个子智能体,完成约6,000次回测,将原本需要数周的量化研究压缩为一次对话内完成。

在E-Commerce Bench(365天电商经营模拟基准)中,千问3.8-Max以¥416,252(4.16倍回报)胜出,超过第二名GLM 5.2达38%,较上一代千问3.7-Max提升152%。

芯片设计:500轮交互,面积缩减81%

千问3.8-Max在芯片设计优化任务中展示了长程自主规划能力。

目标是优化一个G CD/RSA密码硬件加速器的逻辑门数量。模型在无参考设计、无人工干预的条件下,历经约500轮交互、71次评估,跨越13个关键里程碑,将初始设计从8,298门优化至678门,在所有参评模型中表现最优。

物理实现层面,芯片面积从106×106 µm²收缩至46×46 µm²,布线长度从33,369 µm降至4,187 µm,并实现500 MHz频率下的时序闭合,芯片面积整体缩减81%。

多模态能力:视觉贯穿执行全流程

千问3.8-Max的视觉能力不止于"看懂图片",而是作为持续反馈回路贯穿任务执行。

模型在执行过程中会持续观察中间产物——检查页面布局、物体方向、动画效果——发现问题后自主定位偏差并修正。千问团队将这一能力定义为"原生视觉反馈回路"。

基准测试方面,千问3.8-Max在OSWorld-Verified得分86.1,超过Fable5的85.0;AndroidWorld得分85.3,接近Fable5的88.8;ParametricCAD Bench得分91.5,超过Fable5的87.5。

为便于开发者接入,千问团队同步推出千问-MM-Plugins,为不同智能体框架提供图像与视频处理、多模态记忆、视觉工具调用等扩展支持。

Scroll for more