这两天,DeepSeek 开源了自己的DeepSeekHarness:
https://github.com/deepseek-ai/deepseek-harness
我看到这个消息以后,第一个反应是:感谢 DeepSeek。
我为什么会有这个反应?
倒不是因为 Harness 是一个新概念。
过去一年,只要是在做 Agent 的人,对这个词都不会陌生。懂技术的人看到法索,也知道我们真正做的不是给模型加一层界面,而是在搭一套面向法律工作的 Harness。
但对技术圈以外的人来说,Harness 一直是一个很远的词。
DeepSeek 带来的变化,不是创造了 Harness,而是直接把这个原本主要在技术圈里使用的词,放进了产品名称。
它没有把产品叫作另一个 Code、Agent 或 Copilot,而是直接叫 DeepSeek Harness。
借助 DeepSeek 本身的影响力,更多人第一次知道,原来模型之外的这整套系统,也有自己的名字。
对我们这些一直在做 Harness,也一直在向别人解释 Harness 的人来说,这个变化很重要。

01
“你们接了哪些模型?”
这个问题,可以说是我被问得最多的一个问题。
这个问题当然很正常。
模型最容易被看见,名字也最容易被记住。但仅仅知道模型的名字,还不足以判断一个 AI 产品。
如果要判断一个 AI 应用,除了看它接入了什么模型,至少还要看它背后的 Harness。
那 Harness 到底是什么?
如果用最简单的话解释,模型提供理解、生成和推理能力,Harness 负责把模型和具体工作连接起来。
它要处理的是:
模型这一步应该看见什么,可以使用哪些能力,前面已经完成了什么,哪些结果需要核查,以及整个过程能不能持续和追溯。
DeepSeek 这次开源 Harness,恰好把这套平时藏在产品背后的系统直接摊开了。
它的官方架构采用“一切皆插件”的设计。

这张图列出了很多组件。然而,真正值得注意的是,模型适配器只是其中的一部分。
模型还需要和工具、会话以及 Agent Loop 共同工作,才能从一次调用进入一项可以持续推进的任务。
也就是说,接入模型只是起点。
起点之后,才是 Harness 怎样让模型参与一项真实工作。
一套成熟的 Harness,不是不在意模型。
恰恰相反,它需要足够了解不同模型的能力,知道在什么任务里应该选择什么模型。
在法索 AI 里,每一个需要模型参与的任务节点,都有属于这个节点的一套评测。
我们选择的,不一定是总体排行榜上最强的模型,而是经过具体评测以后,能够在这个节点上发挥最好表现的模型。
一个模型总体能力更强,不代表它在每一项具体的法律任务里都是最合适的。
所以,比“接了哪些模型”更重要的问题是:
为什么在这个任务里选择这个模型,又用什么证明它在这里表现得足够好。
但模型怎么选、怎么配合,也只是 Harness 需要解决的问题之一。
DeepSeek Harness 是一个开放、通用的 Agent Harness,法索做的则是法律应用。
两个产品解决的问题并不相同,但有了 Harness 这套共同语言,法索的价值也更容易被解释。
如果今天再有人问我,法索 AI 和一个模型接口有什么不同,我会说:
法索真正的价值,不是接入了哪个模型,而是围绕中国律师的真实工作,建立了一套法律 Harness。

02
法索要接住的,
不是一个问题,而是一个案件
我身边有不少律师朋友。
开始做法索以后,我也花了很多时间深入了解他们的真实工作,看一件案件是怎样从材料进入,一步一步形成判断和结果的。
在律师的工作里,起诉状和答辩状已经是很后面的结果。
在把结论写进文书以前,律师需要阅读材料、整理事实、判断请求和抗辩、检查证据,再把这些内容组织成一套可以继续使用的案件分析。
法索最早把其中相对稳定的工作提炼成七个分析模块:案件概要、案件大事记、请求权基础、案由、抗辩、判决趋势、证据梳理与策略制定。
七个模块不是因为模型擅长做七件事,而是因为这些工作共同构成了一份相对完整的案件分析。

但真实案件并不会停在一份报告里。
案件材料会增加,事实会变化,律师会形成新的判断,对方也会提出新的主张和抗辩。
系统不能每一次都从头开始,也不能把同一案件里的材料、分析和后续工作拆成彼此无关的对话。
所以,法索的基本工作单位不是一次提问,而是一个持续存在的案件。
律师可以围绕同一个案件管理材料、查看七个模块的分析,也可以通过案件助手“小索”继续讨论和完成后续任务。
律师看到的是一个案件工作台。

工作台背后承接的,才是模型怎样理解材料、调用专业能力、保存案件上下文,并持续参与案件办理的完整系统。
这也是我们一直不愿意把法索简单叫作“法律 ChatGPT”的原因。
通用对话产品通常从一个问题或一轮任务开始,而法索从一个持续存在的案件开始。

03
一套法律Harness,
难在哪里
一套法律 Harness 的价值,不在于列出了多少个 Agent、Skill 和工具。
——这些名词并不难写进一张架构图。
真正困难的是,它们能不能在真实案件里共同工作,并形成律师愿意使用的结果。
一套法律 Harness,首先要知道自己站在哪一个位置。
同一组案件材料,法官、检察官、仲裁员和律师不会用同一种方式思考。
律师还要区分原告和被告:
原告律师要围绕诉讼请求组织事实和证据,被告律师要寻找抗辩空间以及对方主张中的缺口;法官和仲裁员要在双方意见之间判断争议、证明责任和裁判依据,检察官又有自己的审查目标。
角色和立场不同,提出的问题、检索的方向、判断证据的方式,以及最后要形成的结果都会不同。
真正困难的,不是让模型回答一个法律问题,而是让系统明确当前代表谁、承担什么任务,再沿着相应法律角色的专业思维完成分析。
法索现在已经能够根据不同的法律角色和立场,用不同的专业路径分析同一案件。
系统还要遵守法律工作的质量要求。
事实判断需要回到具体材料,法律依据要真实可查,检索结果应该能够追溯原文。
不能确定的事情,不应该被强行写成确定结论。
最后,系统还要给律师留下审核、干预和接管的位置。
我们不认为法律 AI 可以承诺“零幻觉”,也不认为 AI 应该取代律师作出最终判断。
我们能做的,是尽可能减少无依据生成,让事实、依据和分析过程更容易核查,并让律师能够在关键节点介入。
这些能力也不是把几个通用组件连接起来以后自然产生的。
它们来自对律师工作现场的长期理解,也需要在不同案件和真实使用中不断验证。
所以,如果要判断一套 Harness 做得好不好,不要只看它列出了多少 Agent、Skill 和工具,也不要只看架构图上有没有这些组件。
更重要的是,它们能不能在真实任务中长期、稳定地共同工作,并持续形成符合专业标准的结果。

04
模型越强,
越考验对工作的理解
每当大模型又向前走一步,都会有人问,应用层还有没有价值。
我倒不太担心这个问题。
模型变强,对所有 AI 应用公司都是好事。
很多原来做不到,或者成本很高的事情,会因为模型能力提升而变得可行。
但真正把模型放进一件案件以后,仍然有很多问题需要回答。
*它代表哪一方?
*应该先阅读哪些材料?
*当前真正的争议是什么?
*什么时候需要检索法律依据?
*哪些结论必须回到原始材料?
*哪里存在不确定性?
*最后又应该把什么交给律师判断?
这些问题不会随着一个更强模型发布,自动出现在产品里。
同一个模型进入不同的 Harness,可能成为编程 Agent、研究助手,也可能进入一件持续几个月甚至更久的诉讼案件。
产品之间的差异,最后还是会落到团队对真实工作的理解:
任务怎样组织,上下文怎样建立,专业方法怎样沉淀,以及什么样的结果才算完成。
模型越强,越能扩大 AI 可以进入的工作范围。
但它也越考验产品团队是否真正理解,用户到底在完成什么工作。

所以我说感谢 DeepSeek,是很认真的。
不是因为它发明了 Harness,也不是因为它证明了法索选择的方向就是对的。
它真正改变的是,更多人开始知道,模型之外还有一整套决定 AI 能不能工作的系统。
下一次再介绍法索 AI 时,我们终于不用再先解释“接了哪些模型”,而是可以直接从 Harness 谈起。
