8 月 13 日晚,DeepSeek 把 Harness 的开发者预览版(v0.1)开放测试,源码同步按 MIT 协议开源,一行 npx @deepseek-ai/dsh web 就能装上。隔天,V4 Pro 正式版(DeepSeek-V4-Pro-0813)上线 App、网页和 API,国家超算互联网也同步上架了这套源码。
模型和执行框架同一周落地,这个组合比单独看任何一个都有信息量。它说明竞争的单位已经变了,从一个模型,变成模型加上跑这个模型的那层壳。
一、Harness 是什么?
按官方的定位,Harness 是一个把模型连到文件系统、终端、网页、代码工具和其他智能体的执行框架,负责组织上下文、安排工具调用、推进任务完成。它不是新模型,也不是 API 的图形界面。
这个概念可以一层层垒上去看:最底下是模型,负责生成。往上一层是工具调用,让模型能读文件、跑命令、访问网页。再往上是上下文组织,决定每一步该把什么信息塞进去、什么该丢掉。最上面是执行循环,判断任务有没有完成、没完成下一步做什么、错了要不要重试。
Harness 管的是最上面两层。过去这两层一直是各家工具自己实现的,比如 Claude Code,比如各种编码智能体,谁的循环写得好谁的实际表现就好——即使底下的模型是同一个。
现在 DeepSeek 把自己的那层拿出来开源了。

二、三个值得注意的设计
一切都是插件。 模型适配器、工具、文件系统、shell、网页访问、子智能体、界面,全部可以通过配置替换。这条设计的实际含义是,你可以只留循环,把里面的每一块换成自己的。
三种运行形态。 网页界面、终端界面、无界面模式。前两种是给人用的,第三种才是关键——无界面模式意味着它能被别的程序调用,能进自动化流水线,能在服务器上跑长任务。一个只能在对话框里用的东西和一个能被脚本调起来的东西,是两类产品。
配套的模型能力也跟上了。 V4 Pro 支持 100 万 token 上下文,最高 38.4 万 token 输出。智能体类基准里,Terminal Bench 2.1 拿到 87.9,DeepSWE 62.7,Toolathlon-Verified 74.1。报道称其整体表现可与 Claude Fable 5、Opus 4.8 相比,对这个说法我不背书,跑分和实际效果之间都会隔着一段距离,值得关注的是长输出这一项——38.4 万 token 的输出上限是为长任务准备的,并不是为聊天准备的。
三、对小团队意味着什么?
我不认为这件事的价值在省钱,真正的变化在另外两条。
第一,你终于能改壳了。 用闭源工具的时候,你的内部系统能不能接进执行循环,取决于厂商开不开那个口子。想让智能体在跑任务的中途查一下自己的工单系统、写一条数据库记录、走一遍内部审批,你只能等。源码在手里,这件事从等待变成了排期。
第二,换模型的成本从重写变成改配置。 插件化的模型适配层意味着底下换谁都行。对于一个还在比价、还没定下来长期用哪家模型的小团队,这个结构本身就值钱。
代价也要说清楚。官方在文档里明确标注了快速迭代期可能出现破坏性变更。v0.1 就是 v0.1,接口随时会动,现在把生产流程押上去,下个版本可能要重写一遍适配。
四、要不要迁,分情况来看
手上已有稳定工作流的,别整体搬。挑一条非关键的流水线用无界面模式跑一遍,跟现在的方案做对照,看两件事:同样的任务它需要几轮才收敛,出错的时候错在哪一层。这个对照价值比跑分价值更大。
卡在成本上的,先别急着换。真正该先算的是,你的支出里有多少花在模型本身,有多少花在壳把无用信息反复塞进上下文。这两笔账的优化手段完全不同,算错了换谁都省不下来。
要把内部系统接进来的,这是现在就值得动手的场景,而且基本是唯一一个。你的诉求是深度定制,而深度定制在闭源工具那边根本没有入口。
模型决定事情能不能干,而壳则决定它干不干得完。过去一年大家的注意力全在前者,接下来会有更多厂商将重点挪到后者。