中国大模型调用量连续21周领跑全球的深度解析
出海专栏 2026-09-23 00:43
财π新闻 据格隆汇2026年9月21日报道,中国AI大模型调用量稳居全球第一,截至9月20日已连续21周超越美国。最新数据显示,9月14日至9月20日当周,全球AI大模型总调用量为129万亿Token,环比增长1.57%,其中中国大模型周调用量达67.46万亿Token,环比增长10.28%,是同期美国大模型14.21万亿Token周调用量的4.7倍,且全球调用量前五名中中国占据四席。
全球大模型调用格局持续向中国模型倾斜从长期数据维度观察,中国AI大模型的市场占比提升轨迹清晰可查。2025年9月22日当周,全球大模型调用市场的份额分布呈现明显的海外主导特征,谷歌以约39%的份额位居厂商第一,美国厂商整体合计占约80%,中国厂商的整体占比不足20%。仅仅一年之后,市场格局便发生了近乎完全的翻转,DeepSeek以25.4%的份额升至厂商第一,中国厂商整体份额超过45%,美国厂商的整体占比回落至约43%。
在9月7日至9月13日的统计周期内,全球AI大模型总调用量达到127万亿Token,环比增长10.43%,中国大模型周调用量达61.17万亿Token,环比增长7.85%,同期美国大模型周调用量为21.8万亿Token,中国调用量约为美国的2.8倍,这是中国大模型周调用量连续第20周超过美国。进入9月14日至9月20日的统计周期,美国大模型周调用量环比下滑34.7%至14.21万亿Token,中国大模型周调用量则保持10%以上的正向增长,将领先优势进一步拉大至4.7倍,实现连续21周领跑全球。
全球调用量榜单的席位分布变化同样直观反映出市场选择的转向。在9月7日至9月13日的调用量前十榜单中,中国模型占据7席以上,合计占比超70%,腾讯混元Hy4 Preview排第2,智谱GLM-5.3 Flash排第3,DeepSeek V4 Flash排第4。到9月14日至9月20日的统计周期,全球调用量前五名中已有四款中国AI大模型,其中DeepSeek V4.1-Flash升至第一,周调用量达15.8万亿Token,环比增长219%。这款9月10日才正式发布的新模型,上线不到24小时便在平台上处理了约1万亿Token,发布48小时的调用量达到约2.8万亿,刷新了平台付费模型的调用量增长纪录。
值得注意的是,当前全球大模型的能力评测榜单与调用量榜单出现了明显的错位特征。在Artificial Analysis发布的智能指数榜上,排名前五的模型全部为海外模型,排名最高的国产模型智谱GLM-5.3位列第7,与榜首模型的分数差距为8分,月之暗面7月发布的Kimi K3位列第9,其余国产模型的排名也相对靠后。这种能力榜单上的追赶态势与调用量榜单上的领跑态势形成鲜明对比,背后是AI产业落地逻辑的深刻转变,越来越多的开发者和企业用户开始用实际调用行为为中国模型投票。
中国大模型极致性价比形成核心市场竞争力中国大模型能够在全球调用市场实现份额的快速提升,核心支撑来自于行业公认的极致性价比优势。从公开的API定价数据来看,中国主流大模型的API定价仅为海外对标模型的10%至20%,即便在这样的定价水平下,中国模型厂商仍能保持20%至40%的毛利水平,实现商业可持续性与市场竞争力的双重平衡。具体到不同产品的定价对比,输入定价Kimi-2.5约为海外Opus-4.6的六分之一,输出定价MiniMax M2.5约为海外模型的十分之一至二十分之一,部分场景下的等效市场定价甚至可以低至约0.006美元每百万Token,远低于海外同类型产品的定价区间。
这种高性价比的产品定位,恰好匹配了AI产业从测试阶段走向大规模业务落地阶段的市场需求变化。此前行业内普遍流行“token-maxxing”的使用思路,不少企业鼓励员工尽可能多地使用AI工具,快速推进内部AI采用的覆盖范围,但经过一段时间的实践后,企业逐渐发现这种无限制的使用模式会造成AI账单居高不下,同时很难衡量大量Token消耗对应的实际经济价值。从2026年年中开始,行业内的使用思路全面转向“token optimization”,也就是在平衡性能领先和性价比的前提下,对AI账单执行更严格的投入产出考核,“Token ROI”成为下半年行业讨论的核心关键词。
基于新的投入产出评估逻辑,企业用户开始对不同复杂度的任务执行分层选型策略。对于高价值、高风险的核心任务,比如渲染引擎开发、操作系统内核编写、复杂工业软件核心模块调试等场景,企业仍然愿意为能力顶尖的海外旗舰模型支付高额费用,保障任务输出的准确性和稳定性。但在真实的企业日常工作流程中,大量的任务属于中低复杂度类型,这类任务不需要每次调用都使用最强的旗舰模型,却对调用价格、响应速度和服务稳定性有着极高的敏感度,这部分占据日常调用量绝大多数的市场空间,恰好成为中国大模型切入的核心赛道。
目前已经有大量海外企业开始在实际业务中采用中国大模型作为日常工作的默认选项。加密货币交易平台Coinbase正尝试通过内部模型网关,把智谱GLM 5.2、Kimi K2.7等中国大模型设为工程师的默认调用选项,同时保留员工根据特殊任务需求自主选择其他模型的权限。住宿平台Airbnb的CEO切斯基早在2025年10月就公开表示,公司的AI客服智能体大量依赖阿里千问大模型,评价其性能表现良好,同时具备响应速度快、使用成本低的显著优势。外卖平台DoorDash也已经完成月之暗面Kimi K2.6大模型的业务部署,支撑其日常的大量客服和订单处理相关的智能体运行需求。
能源供给优势筑牢成本底层支撑中国大模型能够维持远低于海外对标产品的定价同时保持合理毛利,首要的成本优势来源是国内极具竞争力的能源供给体系。在大模型的算力成本结构中,电力是占比最高的单项支出,整体占比达到50%至70%,电力成本的高低直接决定了大模型推理服务的整体成本底线。中国西部拥有大量绿电富集区域,这些区域的电价长期维持在较低水平,依托这些低廉的电力资源,中国生成100万Token的算力电力成本仅为0.03元至0.12元,相比欧美地区的同类型算力电力成本低30%至50%以上,直接从最核心的成本端拉开了与海外模型的成本差距。
除了低廉的绿电资源供给之外,全国规模庞大的智能算力基础设施,为整体成本优势的落地提供了坚实的底座支撑。当前中国全国智能算力规模已经达到2185 EFLOPS,庞大的算力集群形成了显著的规模效应,能够摊薄单卡算力的单位部署成本和运维成本,进一步降低大模型推理服务的单位固定成本。随着国产算力硬件的持续迭代,本土AI芯片的性能不断提升,浪潮信息在AICC2026人工智能计算大会上发布的元脑SD200 Ultra超节点AI服务器,采用本土AI芯片,单机就可以承载运行2.8万亿参数的Kimi K3大模型,将Token生成时延第一次压到5.85毫秒,实现了“本土芯片+国产大模型”垂直链路的全面打通,让算力基础设施的成本优势得到进一步释放。
华为在9月17日举办的全联接大会上,也亮出了覆盖计算、互联、存储的11颗关键芯片“全家桶”,其中既包含鲲鹏CPU、昇腾NPU等核心计算芯片,也有面向集群横向、纵向扩展的交换芯片和高速光互联芯片,还有专门面向AI KV缓存设计的存储芯片,依托灵衢UnifiedBus统一互联架构,这套完整的本土算力体系可以构建支持百万卡规模的智能体超节点集群。这种从“单芯片追赶”转向“系统级超节点”的技术路线选择,进一步放大了中国算力集群的整体规模优势,避免了单芯片性能差距带来的限制,从系统层面持续优化算力集群的整体能效表现。
反观海外市场,算力相关的成本正在持续快速上涨。欧洲AI云厂商Nebius宣布自10月1日起上调GPU按需租金,其中H100型号GPU租金上涨约17%,H200型号上涨20%,B200型号上涨19%,B300型号上涨21%,每GPU小时的最高价格达到9.5美元。此前英伟达新一代芯片发布后,已经带动欧美云厂商完成多轮算力提价,AI推理与训练的成本压力持续向应用层传导。更上游的半导体供应链也出现供给紧张的情况,韩国半导体行业协会9月15日发布预警,半导体设备关键零部件的交期大幅拉长,沉积设备零部件的交付周期从4个月延长到10个月,激光设备从日本采购的核心部件最长等待周期达到40个月,海外算力供给的紧缺进一步推高了整体算力使用成本,让中国大模型的成本优势更加凸显。
工程迭代优化持续释放降本核心潜力如果说能源供给和算力基础设施是成本优势的底层基础,那么持续的工程迭代优化就是中国大模型实现降本增效的核心抓手。中国模型厂商在混合专家架构稀疏度设计和推理目标函数上投入了大量研发资源,完成了更充分的工程优化,最终使得大模型在智能体场景下的响应速度和经济效益显著优于海外同类型模型。以DeepSeek V4.1 Flash为例,这款总参数552B的MoE模型,在输入侧仅激活8B参数,输出侧激活16B参数,同时将KV缓存压到约890字节每Token,对HBM显存的需求降到上一代模型的四分之一,对SSD存储的需求降到上一代的八分之一,大幅降低了推理过程中的硬件资源消耗。
全行业推进的算电协同体系建设,正在从多个维度持续压降单Token的算力与电力消耗。绿电直供模式的不断推广,让大模型算力集群可以直接对接西部绿电基地的低价电力资源,减少中间输电环节的成本损耗,进一步降低单位电力的采购价格。推理效率优化工作在全行业持续推进,各大模型厂商不断打磨算子实现逻辑,DeepSeek V4.1的主Attention算子完全由团队自主编写,将推理过程中的计算资源浪费降到最低,大幅提升了单位算力的Token产出效率。
算力调度的智能化升级,也为整体成本下降贡献了显著作用。通过智能调度系统,算力集群可以根据不同时段的电力价格波动、不同用户的请求优先级、不同模型的资源需求动态分配算力资源,在保障用户服务体验的前提下,尽可能将大量非紧急的推理任务调度到电价更低的时段执行,进一步摊薄单位Token的电力成本。同时,国产AI芯片的能效水平正在持续快速提升,新一代本土AI芯片的每瓦算力产出相比上一代产品实现大幅增长,在相同的电力消耗下可以完成更多的Token推理任务,从硬件底层持续降低单位Token的电力消耗水平。
一系列工程优化措施的叠加效应,让中国大模型在保持服务能力满足绝大多数日常业务需求的前提下,实现了成本的持续可控下降,最终形成了难以被海外模型复制的极致性价比优势。这种优势不是依靠单一环节的成本压缩实现的,而是从能源供给、算力基础设施、模型架构设计、推理工程优化到智能调度全链条协同优化的结果,支撑中国大模型在全球市场的调用量占比持续稳步提升,连续21周稳居全球第一的位置。
(编辑:付健)

购物车