用最贵的模型干所有活,曾经是企业用 AI 的标准姿势。现在,它正在变成 AI 时代最大的一种浪费。
最近撞上这堵墙的,是旧金山一家做 AI 自动化的公司,Lindy。它的 AI 月账单一度冲到比员工工资还高,最后干脆把 100% 流量从 Claude 切到 DeepSeek,预计每月省下数百万美元。
一家公司为了省钱,连主力模型都换掉,这本身就说明:AI 靠烧钱换增长的蜜月期,结束了。CNBC 给这个转向起了个名字——从 tokenmaxxing(能堆多少 token 就堆多少)转向 efficiency(每一分钱花得值不值)。
而真正省钱的关键,不在换个便宜模型,在于学会给任务分流——别再让一个模型包揽所有活。
一、账单是怎么一步步失控的
过去两年企业用 AI,默认逻辑是「用最强的那个准没错」。写代码、做客服、整理文档、跑数据分析,不管什么活,一律喂给最贵的前沿模型。那时候大家比的是谁敢用、谁用得起,成本不是第一位的。
问题出在 Agent 普及之后。一个 Agent 干一件事,背后可能是几十次模型调用——规划、检索、调工具、验证、再迭代。任务从「问一句答一句」变成「自己跑一整套流程」,token 消耗跟着指数级往上翻。
于是账单失控了。Lindy 只是第一个把数字摊开给大家看的,但绝不是唯一一个。还有个细节:一些企业已经直接暂停了 AI 投入,先等 ROI 验证清楚再说。肉疼的,远不止一家。
这套打法在 token 便宜、大家抢着证明自己「在用 AI」的阶段,没什么问题。可一旦规模上来,账单就开始反噬。
二、这场成本战,国内其实打得更早
当美国公司刚开始为账单头疼时,国内的成本战其实已经打了一年。
国产模型从一开始就把价格当武器。DeepSeek、通义、豆包这些,把调用价格打到了前沿模型的零头。对企业来说,「用国产替代」从来不是退而求其次,而是省钱的第一选择——很多活国产模型干得够好,价格还只有几分之一。
平台层更激进。美团低调上线的 tabbit 国际版,直接免费接入了 GPT-5.5、Claude Opus 4.8、Gemini,连国产的 Kimi、GLM、MiniMax 也一并打包,用户不用单独订阅就能用。平台替你扛 token 成本,图的是抢入口。
所以 Lindy 切 DeepSeek 在硅谷是新闻,在国内几乎是默认操作。国外刚意识到「不能一直用最贵的」,国内企业早就在混着用、换着用了。这一轮,国内反而走在了前面。
三、模型路由:把活分给对的模型
那「分流」具体怎么做?业内有个更专业的说法,叫模型路由。
打个比方。没人会每段路都打专车——上班通勤打个快车,赶飞机才叫专车,楼下买瓶水干脆走过去。模型路由就是给 AI 任务分配「车型」:
粗活,用便宜模型。分类、打标签、摘要、格式转换、简单问答这类,对智商要求不高,便宜模型完全够用,成本能差出一个数量级。
细活,才上前沿模型。复杂推理、长程 Agent 任务、需要全局规划的活,省不得,该用贵的就用贵的。
判断哪段路值「专车」,正是企业的真本事。Box CEO Aaron Levie 有句话说得准:距离业务越近,调优空间越大。同一笔预算,懂业务的人能把模型组合调出别人两三倍的效果,靠的就是知道每个环节该用什么档位。
这套逻辑可以整理成一张表,落地时直接套:
任务类型
推荐档位
例子
高频、低难度
便宜模型 / 国产开源
分类、摘要、格式化、初筛
中等复杂、要质量
中档模型
文案生成、常规客服、代码补全
低频、高难度
前沿模型
复杂推理、长程 Agent、关键决策
四、省钱不是终点,ROI 才是
但这里得提个醒:别把降本本身当成目标。
光盯着省钱,很容易掉进另一个坑——为了便宜,把关键场景的质量也砍了。本该上前沿模型的核心决策,硬塞给便宜模型,省下的那点钱,远不够赔上一次错误判断的代价。
Levie 的另一句话点到了根子上:想控制 token 成本,前提是真正理解自己的业务流程。哪些环节是门面、错不起,哪些环节是后台、够用就行——分不清这个,路由就是瞎分。
所以正确的顺序是:先把任务按重要性和难度分级,再决定每一级用什么模型,最后才是算总账。降本只是结果。真正该先问的是另一个问题——这一步,到底值不值得用最贵的那个模型。
五、落地动作
如果你是创业者或 PM:别再无脑默认用最贵的模型了。花半天时间,把产品里的 AI 调用都列出来,按重要程度分几档,能换便宜模型的尽量换。这件事的投入产出比,可能比你这个季度做的任何一个功能都高。
如果你在做 AI 应用:「帮客户在相同预算下获得更多智能」本身就是一门生意。Levie 说得直白——每家公司自己做路由很难规模化,这恰恰是应用层公司的机会:靠对场景的理解、对评测的打磨,替客户把每一分钱花在刀刃上。
说到底,用得起最贵的模型不算本事,知道什么时候不用它,才算。