全球调用量前五全是我国模型——OpenAI降了80%的价,为什么还是追不上?
月初,一组数据在海外开发者社区传开了。
全球最大的AI模型调用聚合平台OpenRouter发布了最新一周的统计:7月27日至8月2日,DeepSeek V4 Flash以7.22万亿Token的周调用量排在全球第一。排在它后面的,依次是小米MiMo-V2.5(6.3万亿)、腾讯混元3(4.82万亿)、DeepSeek V4 Pro(3.28万亿)、智谱GLM-5.2(2.89万亿)。
前五名,全部是中国模型。
更大的盘子里,中国模型的周调用量合计28.13万亿Token,占全球总量的63.5%;美国模型合计4.38万亿,占比35.5%。中国模型已经连续14周在这个平台上领跑美国。
这不是某一款模型突然走红的故事。这是一个趋势积累到某个临界点后,被一组数字集中呈现出来的时刻。
一、DeepSeek V4 Flash:上线5天,登顶全球
先说清楚这个模型到底是什么。
DeepSeek V4 Flash于7月31日正式开启API公测。它采用MoE(混合专家)架构,总参数2840亿,但每次推理只激活其中约130亿参数。打个比方,它像一个有2840把工具的工具箱,但每次干活只挑出最合适的几把来用,既省力又精准。它支持100万Token的上下文窗口,最大输出38.4万Token。
在Artificial Analysis的智能指数评测中,DeepSeek V4 Flash拿到50分。作为参照,OpenAI的GPT-5.6 Luna是51分。差距只有1分。

但价格差距远不止1分。
DeepSeek V4 Flash的标准定价是:输入每百万Token 1元,输出每百万Token 2元。它还提供了约98%的缓存命中折扣——如果开发者反复调用相似内容,命中缓存的部分只按标价的2%收费,也就是每百万Token 0.02元。行业里常见的缓存折扣大约是90%,DeepSeek把这个数字推到了98%。
这意味着什么?开发者在实际使用中,大量重复请求的成本几乎可以忽略不计。
再说一个单日数据。8月3日,DeepSeek V4 Flash单日处理了约8万亿Token,其中5万亿来自免费试用额度,3万亿是开发者付费调用。8万亿Token大概是什么体量?大约相当于5600万套《三体》三部曲的文字量。
这些数字不是实验室里跑出来的,是真实用户一遍遍调用堆出来的。
二、OpenAI的反应:降价80%,还是追不上
OpenAI的反应其实不算慢。
就在DeepSeek V4 Flash上线公测的同一天——7月31日,OpenAI宣布GPT-5.6 Luna大幅降价。输出价格从每百万Token 6美元降到1.2美元,输入从1美元降到0.2美元,整体降幅80%。另一款模型Terra也降了20%。此时距离这两款模型正式发布,才过去大约三周。
降价确实有效果。Luna首次进入OpenRouter榜单,排在第八位,周调用量1.95万亿Token,环比增长456%。但这个数字不到DeepSeek V4 Flash的三分之一。

更扎心的一幕发生在OpenCode平台的评论区。OpenAI核心产品与平台负责人Tibo亲自下场为Luna做推广,结果被开发者直接回了一句:"我们希望得到DeepSeek的价格。"
即便Luna降了80%,DeepSeek V4 Flash在自有API上的单任务成本仍比它低约60%。原因不只是单价低,还有那个98%的缓存折扣机制——开发者反复调用同类内容时,账单会缩水到几乎可以忽略。
开发者不傻。他们不会为1分的性能差距多付几倍的钱。能不能稳定跑起来、账单会不会失控、缓存能省多少,才是每天都要面对的现实问题。
三、前五全是中国模型,这说明了什么?
单看一周的排名,你可以说有偶然成分。但连续14周的领先,就不是偶然了。
把时间线拉长来看,这个趋势其实从2026年初就开始了。2月份,中国模型在OpenRouter上的Token调用量首次超过美国。之后差距一路拉大,从微弱领先到63.5%对35.5%的压倒性优势。
数据来源:OpenRouter周报(2026年7月27日-8月2日)
这说明了什么?至少有三件事值得想想。
第一,AI竞争的主战场,已经从"谁的模型最强"转向"谁能让更多人用得起"。性能差距缩小到1分的时候,价格差距就成了决定性因素。DeepSeek把推理成本压到GPT-5.6 Luna的十分之一甚至更低,开发者自然会用脚投票。
第二,中国模型在MoE架构上的技术路线选择,正在产生实际回报。MoE的核心思路是"大模型、小激活"——总参数可以做很大来保证能力上限,但每次推理只激活一小部分来控制成本。DeepSeek V4 Flash用2840亿总参数、130亿激活参数的组合,在性能和成本之间找到了一个非常好的平衡点。这个思路小米、腾讯、智谱也在用,只是具体配比不同。
第三,调用量不等于全面胜出。价格足够低会带来大量尝试性使用,免费额度也会放大短期数据。模型在复杂推理、长链推理、行业深度场景中的表现,还需要更长时间的检验。OpenAI和Anthropic在最前沿的推理能力和安全研究上,仍有不可忽视的积累。
四、这到底意味着什么?
8万亿Token不是凭空来的。它背后是芯片在转、服务器在跑、数据中心在散热、电力在消耗。开发者愿意付费调用3万亿Token,说明这些模型确实在帮他们解决实际问题——写代码、做分析、处理文档、搭建应用。
这些Token也不是终点。每一个Token都意味着模型接触了一次新的表达、新的知识、新的场景。用得越多,反馈越多,迭代越快,下一轮模型就可能更好。这是一个正循环。

对OpenAI来说,压力是实打实的。降80%的价格是一个信号——说明他们自己也不认为高价还能维持。但降价只是防守,不是进攻。真正的问题是:当中国模型在性能上只差1分、在价格上便宜十倍、在调用量上遥遥领先的时候,OpenAI靠什么维持自己的护城河?
对中国AI行业来说,这当然是好消息,但也不该过度乐观。调用量领先不等于技术全面领先,价格优势也不等于长期壁垒。真正的考验在于:能不能在最前沿的推理能力上持续突破,能不能在安全和对齐上建立可信记录,能不能把价格优势转化为可持续的商业模式。
回到那个最直接的问题:OpenAI降了80%的价,为什么还是追不上?
答案可能很简单——因为这一轮竞争的规则变了。以前比的是谁的模型更聪明,现在比的是谁的模型更便宜、更稳定、更被开发者信任。在新的规则下,7.22万亿Token就是开发者投出的选票。
这票投给了谁,榜单上写得清清楚楚。

