如何做到让同一个AI任务成本相差 15 倍?

发布时间:2026-08-04 阅读时长:6分钟

这是 Cursor 团队做的对比:用前沿模型负责规划和编排,把具体执行交给便宜模型,总成本降到原来的十五分之一,而效果没有明显损失。

关键洞察在于,大型任务里真正需要前沿智能的环节很少:任务分解、设计决策、关键取舍。一旦模糊性被消解成明确的指令,便宜的模型执行起来效果一样好。差的不是模型,是怎么组织模型。

这件事今年有了个正式名字。7 月底北京发布的智能体专项政策里,第二条写着要发展驾驭层工程,英文是 Harness Engineering,要求围绕上下文工程优化、任务持久化、多智能体协作和系统可扩展来夯实底座。一个去年还只在英文技术圈流传的造词,进了公文。

Harness 的本意是马具。这个比喻其实相当准确:**模型是马,harness 是缰绳、嚼子和挽具。马已经足够快了,接下来比的是谁会驾驭。**本篇把这层缰绳拆成三段,每段都给能上手的做法。

如何做到让同一个AI任务成本相差 15 倍? 配图 1

一、第一段缰绳:别让最贵模型干笨活

最直接的一层是分工,现在流行的做法叫子代理委托。以 Codex 为例,你可以在配置目录下定义一个工作型子代理,指定它用便宜的模型和较高的推理档位,然后让主模型只做两件事:把任务拆开、把产出审一遍。中间的具体实现,全部委托出去。

用过的人给的反馈是额度消耗明显下降,产出反而变多。原因不难理解:主模型的上下文没有被大量实现细节污染,它能一直保持在做判断的状态。

这一层的实操判断是:你的 Agent 配置里,如果只有一个模型在从头干到尾,那基本可以确定既贵又慢。

回头再看那句 15 倍,它不是省钱技巧,是一个结构性的事实:智能是有价格梯度的,而大部分工作不需要买最贵的那一档。

二、第二段缰绳:把完成定义清楚

第二层比第一层更值钱,也更容易被忽略,先看一个研究结果。

面壁智能和清华的团队提出了一个叫 ALIGN 的方法,用来解决智能体和环境之间的接口失配。他们做了个对照实验,仅仅是改写环境返回给智能体的反馈措辞,没有换模型、没有改架构,一个 70 亿参数模型在标准任务集上的成功率从 13.4% 提升到 31.3%。在四个基准上最高提升 45.67 个百分点,连续无效动作减少约 65%。

改的是措辞,翻倍的是成功率。这个结果指向一件事:智能体的失败很多时候不是不会做,是不知道自己做错了。环境给的反馈太含糊,它只能继续瞎试。把这个道理搬到日常工作里:你交给 Agent 的任务,验收标准写清楚了吗?

测试怎么跑、什么算通过、边界情况怎么处理、哪些文件不许动。指令说的是干什么,验收标准说的是什么时候停,后者才是缰绳真正吃力的地方。

这也是我认为产品经理在这一轮里位置反而变得更重要的原因。定义验收标准这件事,本来就是产品岗的核心技能,只不过以前的验收对象是人,现在多了一类不会累也不会问的执行者。

三、第三段缰绳:让循环自己转起来

第三层是把前两层固化成一条能反复跑的流程。

Vercel 的创始人给了一个具体的形态:Issue 到 Agent 到 PR 到 Release,这条循环会成为软件项目的常态,而维护者的职责,变成优化这条循环并为它设定标准。

我认同这个判断的原因是它符合工程史的规律。持续集成刚出现时也是手工触发的,后来变成了没人会去想的基础设施。Agent 现在处在那个手工阶段:多数人还在一个窗口里聊天式地指挥它干活,而领先的团队已经在把它接进流水线。

Box 的 CEO 把这层的重要性说得更靠前。他的判断是,当任务规模从百万级 Token 迈向亿级,能高效拆解工作并把它路由到合适模型的那层结构,将成为继模型能力之后最重要的变量。

注意他的措辞:继模型能力之后。不是替代,是接棒。模型能力仍在涨,但它对结果的边际贡献在下降,而 harness 那一侧几乎还是空白。

四、缰绳拉不住的地方

有项研究做了个相当残酷的测试:让前沿智能体在六天、数千美元算力的条件下,独立完成一项开放式研究。工程任务它全部做完了,但对两个真正的核心科学问题毫无实质进展,最终被原论文作者判定为拒稿,研究者还归纳出五种典型失败模式。

对照另一面:腾讯混元的研究智能体解决了一个 1969 年以来悬而未决的数学极值问题,OpenAI 用约 2000 美元的算力推翻了一个存在多年的猜想,证明附带形式化验证。

一边是超人表现,一边是彻底失败,分界线相当清楚:能被验证的任务,缰绳拉得住;不能被验证的开放问题,目前拉不住。

所以给读者的判断标准可以很简单:这个任务有没有一个明确的、能自动判定的完成信号。有,就值得投入做 harness;没有,先别指望自动化,那部分仍然是你的活。

五、缰绳握在谁手里

15 倍它真正说明的不是省钱,是这个阶段的杠杆位置变了。

过去两年,能力提升几乎全部来自换更强的模型,你什么都不用做,等下一版就行。现在这条路的收益在变薄,而组织方式那条路几乎没人走过。

政策文件把这件事写进正文,说明它已经不是少数人的手艺。对个人来说,这一层的门槛其实比训模型低得多:分工、验收、循环,三件事没有一件需要你懂算法。

马已经够快了,接下来一年,差距会出现在会不会牵缰绳的人之间。

标签: AI驾驭层工程AI成本优化多模型协作上下文工程

继续阅读

查看更多 →
上一篇 高强度写代码的场景里,最便宜的 Token 反而是 Codex 套餐 下一篇 大厂最大的浪费,是留不住做出好产品的人