这篇稿子我8月13号晚上就写完了,压了两天没发。
现在回头看,幸亏压了。这两天里,我原稿里的数字全过期了。

13号晚上我抓到的是28199个star,当时觉得这数字已经够唬人了。刚才我又去GitHub的API上拉了一遍——
93038个star,8521个fork。48小时。
我把这两个数字并排贴在这,你自己感受一下。
先说清楚这东西是什么
一句话交代:DeepSeek这次开源的不是模型,是让模型能当agent干活的那套外壳,官方名字叫DeepSeek Harness。
模型是发动机,harness是整台车。你把V4的API key给我,我什么也干不了;但你给我一个跑着V4的Claude Code,我能让它自己读代码、改文件、跑测试、提commit。中间那一大堆东西——工具怎么调、上下文怎么管、会话怎么存、出错怎么重试、界面长什么样——就是harness。
今年三月我开始写harness系列的时候,中文圈聊这个的人还很少,留言里问得最多的是"这不就是agent框架吗"。现在DeepSeek官方产品页首屏就写着"Everything is a plugin",Hacker News主帖底下709分292条评论,没人再问这个词是什么意思了。半年时间,一个词从行话变成了常识。
它不是第一个,这一点得先说清楚
这两天有不少说法,讲DeepSeek是第一个下场做开源harness的模型厂商。这个说法不成立。
OpenAI的Codex CLI,2025年4月就开源了,Apache-2.0协议,起初是TypeScript后来整个用Rust重写。Google的Gemini CLI,同年开源,Apache-2.0,TypeScript。两家都比DeepSeek早一年多,DeepSeek是第三个。论体量前两位还领先:Codex CLI 105954个star,Gemini CLI 106521个,DeepSeek Harness 93038个——只不过前两位跑了一年多,后者用了两天。
把三家摆在一起,DeepSeek这次的动作反而显出了真正的不同:区别不在开不开源,在开源的是什么。
Codex CLI和Gemini CLI开源的是一个产品的源码。能读、能改、能自己编译,但架构定死,想扩展只能走人家预留的口子——Codex是AGENTS.md加MCP,Gemini是extensions加MCP。我特意翻了Gemini CLI的README,通篇只提Gemini模型,那句MCP支持写的是"用于自定义集成",接的是工具,不是换模型。
DeepSeek Harness开源的是一套能拼出harness的零件。models、tools、skills、sessions、sandboxes、filesystems、loops、orchestration、UI,九类东西全是插件,底下只有一个叫Cordis的内核负责挂载、卸载、依赖注入。agent的主循环是插件,界面是插件,连模型本身也只是一个插件。
拿车打比方:前两家给你一辆车,还附赠图纸;DeepSeek给你一条产线。
(多说一句,上面那份九类清单我是从官网产品页扒的,GitHub的README里没有。这一点后面还要说。)
93K星要放在什么坐标里看
上一季我拆过的Hermes Agent七周95K、Superpowers半年121K,都是个人开发者靠口碑滚出来的。DeepSeek Harness两天93K是另一种打法,厂商品牌加上憋了三个月的社区期待,没有可比性。star这东西,前三天看的是关注度,三个月后看的才是留存。
但真正让我盯着看了半天的,是另外三个数字:
Codex CLI:12594个open issue。
Gemini CLI:835个。
DeepSeek Harness:0个。
不是因为它没bug,是因为issue区根本没开。README里写得很清楚,反馈和bug报告走GitHub Discussions或者Discord。
我又看了眼最后推送时间:停在8月13号13点,也就是开源当天中午。93038个star、8521个fork砸进来的这两天,主仓库一行代码都没推过。
这两件事拼在一起,说明一种很具体的姿态:代码是"扔出来"的,不是在开源社区里"长出来"的。DeepSeek一贯如此,他们开源模型权重也是这个风格——东西给你,怎么用你自己琢磨,别指望我跟你在issue区一条条对线。
我不觉得这是黑点。developer preview阶段,README自己都用全大写吼着"会有兼容性破坏式变更",先把issue区关掉避免被淹,是合理的运营选择。但对着"开源"这两个字,心里得有个分寸:代码开源和开发过程开放,是两回事。Codex CLI那12594个open issue看着像屎山,那是一年多里真实用户和维护者互相拉扯留下的痕迹;DeepSeek Harness的0,是干净,也是还没开始。
同一天,还发生了另一件事
这是我压稿两天最大的收获——13号那天,DeepSeek不只干了开源这一件事。
同一天,V4-Pro正式版发布。同一天,API涨价通知发了出来,8月16号生效。
引Engadget的数字:V4-Pro的输出token,从每百万0.87美元涨到峰时3.96美元,四倍半,谷时1.98美元。V4-Flash的输出,从0.28美元涨到峰时1.32美元,四倍七,谷时0.66美元。从此引入峰谷两档,以前那个一口价没了。不同token类型涨幅不一样,多家媒体报道里最高的一档到了1100%。
官方理由是"更合理地分配资源"。翻译一下:卡不够用了,用价格把你们赶到半夜去跑。
为什么这件事对harness这个话题这么关键?
因为我13号那版初稿里,用了一堆社区数据论证"DeepSeek是被社区推着下场做harness的",其中最扎眼的是r/DeepSeek上那个1772个赞的帖子:「DeepSeek的输出token比Claude Opus 4.8便宜28倍」。评论区没人质疑数字,大家聊的都是"那我为什么还要付Claude的钱"。
16号起,这个28倍要重算了。那帖说的是Flash,Flash输出峰时涨了四倍七,如果Opus那边价格不动,28倍在峰时会缩到6倍上下——这是我按公开价格粗算的,谷时另说。
还有张890个赞的梗图,配文大意是:别人用着又贵又体面的opus和fable,一副专业人士的样子;你用着flash,但你把harness调到跟大模型打平。
这张图是整件事的题眼:模型的差距,可以用harness补回来。
现在再看,成色变了。模型便宜到几乎白送的时候,"用harness补差距"是一种精打细算的快感;价格涨上来还分了峰谷,这件事就从省钱变成了必须省。开源一个能把每个环节都拆开优化的harness,和把API价格提上去,同一天发生,我不觉得是巧合。
至于DeepSeek为什么非得亲自造这台车,下一篇专门讲。
Everything is a plugin,一句话预告
技术细节留到第三篇,这里只交代我的第一反应。
看到"everything is a plugin"这行字,我第一反应不是兴奋,是警觉。
因为这套东西我太熟了。微内核加插件总线,Eclipse的OSGi就是这么干的。当年做企业级产品,我啃过OSGi的classloader隔离机制,啃到怀疑人生。那套东西的甜头是极致灵活,苦头是复杂度不会消失,只会转移到插件边界的契约设计上——版本地狱、废弃插件、谁也管不了的治理,一样不少。这些坑DeepSeek躲没躲过去,第三篇细拆。
上手命令倒是简单:
npx @deepseek-ai/dsh web
浏览器开127.0.0.1:3080就出来了。我13号晚上跑通了,配上自己的API key扔了个小任务试手。先说个印象,可能跟很多人的预期不一样:它不是冲着替代Claude Code去的。打开界面那一下你会有点懵,因为它没打算把你伺候舒服,它默认你是来拆东西的。这跟Claude Code那种"装完就能干活"的产品感完全是两个路数。
HN和Discussions里在吵什么
HN主帖从13号的242分107评论,涨到现在的709分292评论。
夸的那派,最高赞那条抓的点很锋利。他说DeepSeek Harness把模型看到的一切都记进一条只增不改的会话日志——system prompt、推理过程、工具调用和返回、子agent调度、每一次上下文注入,全在里面。然后补了一刀:这跟那些把推理轨迹加密或者混淆掉的美国模型形成了鲜明对比。
这一刀扎得准。你用Claude Code,模型的完整推理轨迹是看不全的;OpenAI那边的推理模型更是明说了原始思维链不对外。
底下有人对着这个功能撇嘴,"就是些日志罢了"。这句我不同意,而且不同意得很坚决,第四篇专门反驳。剧透一句:做过金融系统的看到append-only这四个字,应该条件反射想到event sourcing。
骂的那派也不客气,文档写得烂是最集中的吐槽。这个批评我只接一半:README确实寒碜,除了安装步骤和一句"everything is a plugin",连哪些东西是插件都没列。但我翻了仓库的docs目录,二十多篇文档躺在那儿,架构、插件模型、扩展点设计、工具调用流水线、术语表、教程一应俱全,多数还配了中文版。所以不是没写文档,是门面没做好——有人骂完就走了,其实往里走两步东西全在。
Discussions区画风跟HN完全不同。热度最高的两个帖子是"DeepSeek Harness 微信交流3群"和"6群",64条和25条回复;技术贴排头的是"Session resume fails",讲provider注册表冲突导致会话恢复失败。官方还专门开了个"Terminal Benchmark 2.1提交通道",在Discussions里收benchmark提交,这个动作信息量不小,第六篇细说。
一个93K星的国际项目,最活跃的讨论是中文微信群。这个现象本身值得记一笔。
这一季怎么读
上一季十八篇,我拿八个项目铺了一张harness的全景图。这一季只干一件事:把DeepSeek Harness这一个项目拆穿拆透。
十篇,四个板块。前两篇讲发生了什么、DeepSeek为什么非做不可。中间五篇是硬骨头——插件内核怎么设计的、事件流藏着什么野心、模型凭什么也能当插件、benchmark为什么现在才敢公开跑、712个报名项目背后是什么打法。第八第九篇把它放回全景图里横着比,该下的判断一个不躲。最后一篇我自己上手,跑通、写插件、把老资产往里搬,能兼容多少如实报告。
每一篇我都会拽一个具体的对照物来比——Claude Code那八个写死的hook钩点、DeepAgents的middleware插槽、pi-mono的Extension机制、ECC那套跨九个harness的适配层,还有这篇里刚请进来的Codex CLI和Gemini CLI。光讲一家的设计,读者记不住,也判断不了好坏。
赶时间的:想知道值不值得上手直接跳第十篇,想搞明白架构第三第四篇是主菜,关心行业格局第九篇观点最重。
最后
压稿这两天,我把28199改成了93038,补了一整段涨价的事,还把几条二手消息挨个回原始出处核了一遍——有一条"社区最大的抱怨是没有终端界面"的说法,我翻遍Discussions没找到对应帖子,直接删了。这种时候写快不如写准,两天后没人记得谁先发,但错的数字会跟着你很久。
有件事倒是没变。八月十三号这一天,一家模型公司同时干了两件事:把API价格提上去,把整台车的图纸扔出来。
模型的钱要照收,但车怎么造,你随便拆。
