全球Token「印钞流水线」大升级:Agentic Infra新智元

7/20/2026

「你已达到使用上限,请等待额度重置。」

用过Claude Code、Codex 的人,大概都被这行字噎过。bug刚修到一半,弹窗一出,全停了。

如今你把活整件甩给Agent,它替你干、也替你烧钱,每一次调用都在按Token结算。

Token,俨然成了这个时代最像「货币」的东西。

有意思的是,这「货币」还在疯狂贬值:过去一年,单个Token的生产成本被硬生生打下来10倍。

是谁,在哪儿,把它造得这么便宜?答案藏在一层你从不打开、却天天在用的地基里。

就在今年的WAIC上,无问芯穹一口气亮出了「前店后厂一中心」,一整套完整的Agentic Infra战略布局:

▪︎算力集散中心(一中心):Agentic Infra自主式基础设施平台;

▪︎Token工厂(后厂):Agentic MaaS大模型服务平台;

▪︎AI生产力商店(前店):Agentic Infra行业解决方案。

不是「Token 工厂」,是Agentic Infra

2025年,无问芯穹率先在业内喊出了Agentic Infra。不到一年时间,这个词已经成了行业里的「标配」。

可仔细看,如今多数厂商做的「Agentic」,不过是在传统基础设施上加了一个Agent入口。

但这样做根本撑不起真正的智能体时代。当海量并发请求一拥而上,光靠一个新入口,底层系统很容易就崩了。

真正的解法,得往更深处走。今年6月,两家海外Cloud公司各自提出的解法,与无问芯穹隔海共同呼应了「Agent时代到底需要怎样的AI基础设施」这个命题。

首先,是CoreWeave发布了一款服务于「AI研究与迭代」的智能体——ARIA。它能够自主分析实验数据、提炼洞察并驱动持续改进。这意味着CoreWeave正式从单纯的「算力提供商」升级为「算力+AI自动化研发」的综合平台。

其次,是Fireworks AI发布带强化学习的端到端平台——Training Agent。用户只需描述任务,智能体就能自动选模型、跑超参扫描、写评估、部署模型。

而无问芯穹的解题思路是——让整座基础设施自己变成一个会干活的Agent。

在他们看来,真正完整的Agentic Infra至少得同时迈过三道坎:

▪︎全链路:撑得起从算力到Token再到生产力的整条链,用全栈优化提升基础设施系统性能;

▪︎AI原生:能用AI改进AI基础设施本身,不仅服务人类用户,还针对智能体这类数字用户的需求做改造;

▪︎全覆盖:训练、强化学习、推理全流程覆盖,稳固更多样化的技术优势,同时携手行业百业的客户,赋能降本提效。

无问芯穹把这三件事,收进了一道乘法公式:

AI生产力 = 智能资源规模 × Token 转化效率 × AI 生产力转化效率。

公式里的三个变量,正好对上「前店后厂一中心」三块业务。并且在相乘之后,还首尾相接地成了一个闭环。

一中心:把散在各地的算力,聚成一股

第一个变量,是智能资源规模。

如今,算力的胃口,早就涨得比供给快。可光靠买卡、堆算力,既烧钱又追不上。

真正的出路,是把已经散在各地、型号不一的存量算力盘活,聚成一股能用的力量。

为此,无问芯穹的「算力集散中心」主要做了两件事。

第一,是面向大模型的异构集群跨域训练系统。

▪︎超远距离聚合:联合中国电信,完成国内首例超4000公里距离的大模型跨域混训,在新疆哈密与广东深圳两地集群间,实现联合训练性能提升165%。

▪︎多数据中心聚合:联合4个不同代际、不同型号的GPU集群,联合训练70B参数大模型,四集群协同性能提升41%。

▪︎混合云算力聚合:实现本地私有集群与公有云算力的安全互通混训,不仅将整体性能提升了68%,而且还治好了企业「自己的卡不够用、云上的卡却闲得发慌」的问题。

到今天,这套系统已在全国部署触达超37000P算力、覆盖16种主流芯片。

第二,是跨集群强化学习。

强化学习正成为这一轮智能跃迁的胜负手,所需要的算力规模显著增大,动辄千卡甚至万卡起步的体量,并不是每个机房都能塞得下的。

然而,想要同时利用多个集群,就不得不面临机房之间通信和故障的瓶颈。

对此,无问芯穹的做法是从网络、平台到框架一层层优化,把跨域通信的效率整整提高了三到四倍,实现通信开销100%全掩盖。

再配一套故障无感的训练机制,它硬是让跨域强化学习训练,连着跑了整整一周都没断。

无问芯穹联合创始人兼CEO夏立雪今天在发布会现场表示,随着强化学习规模需求的持续提升,无问芯穹还将针对并行策略、通信融合、智能算子、极致容错等核心技术持续深耕,「未来会将跨域计算资源的支撑规模拓展至十万卡级以上,支撑下一代Agentic AI 的在线进化。」

但把算力聚起来只是第一步。真正让「一中心」配得上「自主式」三个字的,是它开始自己管自己。

无问芯穹今天发布了一项与基础设施自我优化和进化直接相关的「前店」解决方案:基础设施智能体蜂群。

首先看「平台管家智能体系统」和「智算集群运维智能体系统」。

举个例子,一个「平台管家」智能体如今成了整个基础设施智能体蜂群的统一入口。

你直接交代一句「帮我看看昨天哪些训练任务失败了」,它便会顺着日志、监控、任务事件一路查下去,并且独立解决80%的日常问题。剩下20%的深度问题,则会再转交对应的垂类智能体。

比如,碰到棘手的集群运维难题,专门的智算集群运维智能体系统就会接手。这是一个7×24小时全天候值守的「运维专家团」,能端到端地完成告警闭环处置。定位到根因后,它们会直接拟好修复方案,并问你要不要一键重建。

经过大规模生产环境验证,这套运维智能体系统可实现运维人效提升5倍以上,关键故障处理效率提升6倍。

这不仅为大规模GPU训练与推理业务提供了更加稳定、高效的基础设施保障,也让运维人力能够被真正解放出来。

比运维更硬核的,是高性能算子生成智能体系统KernelMind。它直接用AI造出面向不同芯片的高性能算子,可在真实编译试错与知识沉淀中持续自迭代,稳定交付工业级算子。

在GLM 5.2模型的实测中,对比行业基线,KernelMind在NVIDIA旗舰卡中实现了端到端7.3%的性能提升,在AMD旗舰卡中更是带来了39%的整体性能跃升。

放以前,这一步得靠顶尖专家一行行手搓才行。

后厂:把推理成本,一年打下来10倍

第二个变量,是Token转化效率。

对于后厂来说,核心命题只有一个:极致效率服务Token的规模化、高质量生产。

这背后,其实是整个AI产业的一次重心转移。

过去三年,大家拼的是谁堆的卡多、训的模型大;可当Agent铺开之后,战场就从「训练」大规模扩展到了「推理」。决定谁能真正赚钱的是海量调用之下,每个Token的成本能压到多低。

模型推理时,不同阶段对设备的要求完全不同——Prefill疯狂吃算力;Decode极度吃通信和延迟。

对此,无问芯穹的答案,是它首创的「跨集群异构PD分离架构」(Prefill-RelayDecode-MainDecode,PDD)。

也就是,把Prefill和 Decode这两步彻底拆开,分别丢到不同机房、不同厂商的芯片上去跑。谁擅长算就专心算,谁擅长低延迟输出就专心输出,各尽其能。

而基于以太网的KV Cache跨集群传输,需要解决带宽和延迟瓶颈两大难题。

带宽这一关,它靠一次技术迁移解决。通过把原本用于Decode实例重复前缀存储去重的Decode Radix Cache技术,创新性地迁移至跨集群异构PD分离架构之中,将跨集群的KV Cache传输数据量降低了一个数量级。

延迟这一关,它首创了PDD三级分离架构。遇到传输要耗上数十秒的请求,先由极少量机器上的RelayDecode抢先向用户输出Token,用户端因此感受不到这段传输延迟;等数据传输完成,再把输出任务无缝切换给MainDecode。

实测显示,首Token延迟(TTFT)直接降低了51.5%,单Token成本再降37.5%。

结合一系列技术优化,无问芯穹的单位Token推理成本,硬是在一年内,整整降了10倍。未来,仍有10倍的下降空间。

正如夏立雪在现场所总结的:6月的GTC大会上,黄仁勋展示了英伟达的「算力即收入」曲线。无问芯穹的Token工厂,则希望用「优化即利润」的增长飞轮,向推理时代交出Token效率的答卷。

Scroll for more