高强度写代码的场景里,最便宜的 Token 反而是 Codex 套餐

发布时间:2026-08-04 阅读时长:7分钟

同一周的两条消息,摆在一起看很割裂。

一条是榜单,多模型聚合平台 OpenRouter 的数据显示,7 月 27 日到 8 月 2 日这一周,全球大模型调用总量 56.8 万亿 Token,其中中国模型占 28.13 万亿,接近一半,榜单前五席位全部是中国产品,这个领跑已经持续了十四周。

另一条是吐槽。一篇采访了多位一线开发者的文章,标题叫《国产大模型,贵到用不起》。

两条都不假。我的判断是,它们能同时成立,是因为算的根本不是同一笔账:调用量统计的是流量,而开发者掏的是钱包,中间隔着一整套定价结构。

一、便宜的第一层:单价确实低

先看最直观的那一层,Token 单价。

按公开价目,GLM-5.2 每百万 Token 的输入和输出价格是 1.4 美元和 4.4 美元,DeepSeek-V4-Pro 是 0.435 和 0.87。对面呢,GPT-5.6 Sol 是 5 和 30,Claude Fable 5 是 10 和 50。

输出侧的差距超过十倍。所以调用量领跑这件事,看起来顺理成章。

一个开发者在 OpenRouter 上跑批量任务,同样的活儿用国产模型能省一个数量级的钱,用脚投票再正常不过。这也解释了为什么榜单前五全是中国产品:在按次计费的散客市场里,单价就是全部。

高强度写代码的场景里,最便宜的 Token 反而是 Codex 套餐 配图 1

如果故事到这里结束,那确实是个爽文,但账单不这么算。

二、便宜的幻觉:越是重度使用,反而越贵

转折出现在编程场景。据《最话 Funtalk》7 月底的报道,一位 AI 领域的科研工作者,因为工作需要每天在写代码的场景里消耗几十亿 Token。采访当天他消耗了将近 40 亿。按 GLM-5.2 的单价折算,这一天的成本大约 1084 美元,合人民币七千八百多。

而他实际付了多少?他开的是 Codex 套餐。Plus 每月 20 美元,Pro 从每月 100 美元起。

另一位重度开发者的账更直观:他在 Codex 上一周实际花费 300 元人民币,没有公司报销。而同样这 300 元,买不到 GLM-5.2 同等数量的 Token。

一线开发者给出的原话是,Codex 套餐是目前能买到的最便宜的 Token,比智谱、Kimi 便宜好几倍。

这句话反直觉,但机理并不复杂:对面卖的是包月,这边卖的是按斤计费。 单价低十倍,架不住一个按量收费、一个封顶。你以为进的是自助餐厅,结账时发现商家还是按克称。

国产不是没做过套餐,是套餐里的限制多。Kimi Code 分四档,额度按周刷新;GLM 的编程套餐按每 5 小时的调用次数限额,高峰期还要按三倍扣额度;阿里 Qoder 的企业版按一位运维朋友的用法三天就见底。至于智谱,2026 年 1 月因为算力紧张,把每日可销售的额度直接砍到原来的两成,每天上午十点放量,几分钟就被抢空。

三、便宜的尽头:算力这本账付不起包月

为什么国产不敢做真正的包月?

答案在算力。按 2025 年中国信通院和工信部的口径,中国现存数据中心 449 个,美国是 5427 个;总算力中国 1053 EFLOPS,美国 2400。更关键的是结构差异:美国那部分里高端 GPU 占比极高,中国的算力有相当比例来自昇腾、寒武纪等国产芯片,单卡性能与 H100 仍存在代差。

但真正致命的不是总量,是一个容易被忽略的商业机理。传统云厂商敢卖不限量的云服务器,是因为可以超卖。

一台 ECS 实例的 CPU 利用率可能只有一成,一台物理机能同时卖给十个客户,大家不会在同一时刻满负载。

大模型推理没有这个空间。来一个 Token,就要实打实烧一次 GPU。显存、算力核心、电费,全是刚性支出。用户如果二十四小时不间断地刷,成本线会被直接击穿。

所以国产厂商算完账的结论是清醒的:以现在的算力成本和亏损状况,卖包月等于拿固定月费去赌用户不会用满,而国内开发者动辄一天几十亿 Token 的用法,这个赌局必输。

价格战其实早就结束了。2026 年 3 月起,智谱、阿里云、腾讯云、百度在 Token 价格上集体上调,涨幅从 5% 到 460% 不等。

四、便宜换来了什么:调用量和营收反差

回到开头那个割裂。

调用量这一侧:中国模型周调用 28.13 万亿 Token,连续十四周领跑。往前追,6 月 22 日到 28 日那周是 20.39 万亿,对面美国模型 4.25 万亿。

营收那一侧:智谱 2025 年营收 7.24 亿元人民币,亏损超过 30 亿;MiniMax 约 7900 万美元,折合五亿多人民币。对面 Anthropic 的年化经常性收入约 600 亿到 700 亿美元,主要驱动力正是企业级 API 和写代码这类场景,Cursor、GitHub Copilot 这样的大客户一年能贡献 14 亿美元。

调用量第一,营收差两个量级。这组反差说明的事情很直接:免费额度换来的用量不是生意。

有个数字可以当注脚。8 月 3 日,开源项目团队 OpenCode 披露,DeepSeek V4 Flash 在其平台上单日调用量达到 8 万亿 Token。其中 5 万亿是免费试用额度消耗,3 万亿是付费。

五比三。这个比例本身就是答案。

五、怎么选:三种处境,三条路

判断完了,落到动作。技术选型别看单价,看你属于哪一类。

轻量调用、非编程场景:国产模型的单价优势是真实的,翻译、摘要、分类、批量处理这类活儿,直接用,省下来的是真钱。

高强度写代码:先算总价再看单价,这与直觉相反但更接近事实。有套餐兜底的通常比按量计费的划算,先估算自己的日均消耗,再决定买哪种形态。顺带提醒一句,部分开发者通过中转渠道拿到的低价 Token 存在被换成小模型的风险,这笔账要算进去。

要私有化部署,或者数据不能出境:这是国产开源模型不可替代的场景,和单价高低无关。这一周刚好有两个新选择:阿里 Qwen3.8-Max 首次开放 Qwen-Max 级别的权重,2.4 万亿参数、950 亿激活;DeepSeek V4 Flash 采用 MIT 协议,2840 亿总参数、激活 130 亿,官方称已原生适配 Codex 的接口格式。

国产模型这一年真正的进步不在榜单排名,在于它已经能稳定承接一部分真实工作。但只要算力这本账没有翻篇,包月就做不起来,而做不起包月,就吃不到高价值的重度用户。

调用量能证明模型可用,证明不了商业模式跑通。

标签: AIToken成本Codex实战AI编程工具国产大模型

继续阅读

查看更多 →
下一篇 如何做到让同一个AI任务成本相差 15 倍?