DeepSeek 的画风一直跟其他大模型厂商不一样,就一直没有竞争过最强的模型、最聪明的模型这一个位置,在我的感受里面,他一直的形象都是够用的模型里面最便宜的,便宜的模型里最强的。
所以在 DeepSeek-V4-Flash0731 出来的时候,会有大模型公司斩杀线的说法。

现在DeepSeek V4 Pro 上线了。
模型叫 deepseek-v4-pro,目前 API 节点已经切到 DeepSeek-V4-Pro-0813。 比较抓眼球的几个数字也很直接:1M Context,支持 Tool Calls、Responses API、Anthropic API;价格大概是百万 Token 输入 3 元、输出 6 元,缓存命中 0.025 元。

所以我的第一反应应其实不是又来了一个“国产最强模型”。这种标题过去一年已经看太多了,大家也对最强祛魅了,反正大家都知道:下一个最强。
我在想:如果一个接近第一梯队的模型,真的能便宜到这个程度,那 Agent 这件事情的账是不是开始算得过来了?
因为这半年模型市场已经有一个很明显的变化。
大家还是会发 Benchmark,还是会比推理、代码、数学,那是因为那个时候真实场景还是比较少,会更多关注banchmark 带来的对比。
现在很多企业都上了生产业务,或者说很多个人已经充分使用各种第一梯队模型在执行具体工作了,所以现在已经慢慢从“模型能不能回答这个问题”,变成了给它一件复杂的事情,它到底能不能真的做完,还需要人介入到什么程度。
反正我看模型,更多的是看:能不能把事情做完、做完要多少钱、跑起来快不快、接入到现有工作流能不能跑
如果单看能力,Kimi K3 其实也很强,但是我一个 199 的订阅,2 次对话就跑完了,我就知道这个模型我用不起,综合性价比还不如 codex订阅。
Agent 现在跑 token 很夸张,System Prompt、工具描述、企业规则、知识库、用户历史状态,这些东西可能每一轮都要带。尤其当 Agent 开始长期运行以后,模型一次调用有多便宜,就不是一个“API 省几块钱”的小问题了。
它直接决定一个场景到底有没有商业价值,假设一个 Agent 一天只调用模型 10 次,那用哪个模型影响不大,但如果它一天调用 1000 次呢?如果公司内部有 100 个 Agent 呢?如果以后一个员工背后不是一个 Agent,而是十几个不同的后台 Agent 呢?
那好像只能选够用的模型里面最便宜的,这跟当初 R1 出来的感觉其实有点像,R1 当时带来的冲击,也是把一个原本看起来很贵的能力迅速打了下来,你便宜一个 20%,意义不大,便宜到原来的几分之一甚至十几分之一,那就是结构性的改变了。
当然,我们也不能只算模型的百万 Token 多少钱,因为一个便宜 5 倍的模型,如果为了完成任务要反复跑 8 次,它其实实际投入更多,还不算时间成本、人力投入。一个单 Token 很贵的模型,如果一次就把事情干完,也可能更划算,这个也是我们之前只用最新、最好模型的原因。
因为我们一直以来算的都是完成一次任务到底多少钱,我甚至觉得未来模型真正有用的成本指标应该是 ,而不是/Token,只不过这个很难量化和统一而已,如果有做这个测评的,可以试试用这个指标做 banchmark,我感觉会更有市场哈哈哈,但方向应该会往这里走。
再往后看两周,我觉得会挺热闹。
先说 DeepSeek,目前 V4-Pro-0813 已经可以通过 API 访问,模型节点、价格、API 能力已经比较明确,但一部分更详细的性能信息还主要来自社区流传,所以接下来我最想看的反而是它正式把材料补齐以后,怎么解释这轮提升到底从哪里来。
尤其是后训练,从DeepSeek-V4-Flash0731 来看,后训练的重要性被低估了,模型架构没有发生非常大的变化,Agent 能力却可以提升很大,这说明模型厂商在训练这个脑子怎么工作方面还没有做到极致,这一层未来可能比继续单纯堆参数更有意思。
另外就是国内模型肯定还会继续发,不过这条斩杀线会带来比较大的压力,可能会导致国产模型持续跳票,
再一个,当大家对大模型的需求从看谁最强,变成够用的模型谁最便宜,我觉得模型价格战还会继续,但可能会是一个更隐蔽的价格战:缓存越来越便宜、推理档位越来越多、Fast / Flash 版本越来越强,还是那个逻辑,大家实际看的是 ,/Token 甚至会涨,但实际完成同一个任务的成本会继续往下掉。
这样大模型的斩杀线的逻辑就明确了:谁能做出一个明显比 DeepSeek 更强,同时还贵得有道理的模型?
回答不了这个问题,那就只能持续跳票了......
然后对 AI 深度学习感兴趣的可以点击:
