今天早上刷到 DeepSeek API 文档更新,deepseek-v4-pro 的模型版本号从 preview 切成了 DeepSeek-V4-Pro-0813。没有发布会,没有官方博客,连条推文都没有。就这么 quietly GA 了。

我第一反应不是激动,是手痒。上个月刚把 Dify 里的 Agent 供应商从 GPT-5.6 Sol 切到 DeepSeek V4-Flash,账单直接腰斩。这次 Pro 转正,我倒要看看它能不能把 Claude Fable 5 也从我的工作流里挤出去。
我先在 Dify 里接了一把
Dify 的模型供应商设置里,DeepSeek 官方接口其实一直在。但 v1.16 之后我更习惯走「OpenAI-API-compatible」这条通用通道,因为模型名不用等 Dify 官方更新,base URL 一填就能跑。Dify 对官方模型的适配往往慢半拍,通用通道反而更稳。
配置出奇地简单:
# Dify Settings -> Model Providers -> OpenAI-API-compatible
model_name: deepseek-v4-pro
base_url: https://api.deepseek.com/v1
api_key: sk-xxxxxxxx保存,测试连接,绿色对勾。从打开设置到跑通第一条消息,三分钟不到。

顺手跑了个 function calling 测试,让 Agent 调一个天气查询工具。V4 Pro 的 tool_calls 结构跟 OpenAI 格式一致,Dify 原生的 Agent 节点不用改任何模板。这点比某些国产模型的"伪兼容"强多了——表面上是 OpenAI 格式,真到 tool 调用就丢字段。
但这里有个坑。旧版 deepseek-chat 和 deepseek-reasoner 在 7 月 24 日之后已经指向 V4-Flash 的非思考和思考模式了。如果你跟我一样手里还留着几个月前的供应商配置,现在调 deepseek-v4-pro 才是拿到 0813 正式版的正确姿势。旧名字不是不能用,只是它背后已经不是你以为的那个模型。
另一个细节:Dify 里同一个 base URL 不要重复加。我之前已经有 V4-Flash 的供应商,这次新建 V4 Pro 时发现模型下拉列表里两个名字很容易搞混。建议在模型显示名里直接写清楚:DeepSeek V4-Pro-0813,别偷懒只写 deepseek-v4-pro。
这次转正到底转了什么
先列硬参数,不多废话。
Pro 和 Flash 的价差正好三倍,定位也清楚:Flash 负责高频轻量任务,Pro 负责长上下文、复杂 Agent 和一次性大输出。跟 Fable 5 一比,V4 Pro 的输出价只有对方的六十分之一。注意是"之一",不是"左右"。这个数字本身就有冲击力。
但便宜不是白送的。Fable 5 的并发和稳定性经过大量生产验证,V4 Pro 的 500 并发意味着你把它塞进高并发的客服系统里,可能会撞上瓶颈。这跟模型能力无关,是基础设施的成熟度问题。
真正让我意外的是 Anthropic API 兼容。Dify 里如果之前接的是 Claude 供应商,现在理论上可以把 base URL 改成 https://api.deepseek.com/anthropic,模型名改成对应 ID,就能让原来的 Claude Code / Claude Desktop 工作流直接跑在 DeepSeek 上。这招对那些被 Fable 5 账单折磨的 Agent 开发者来说,简直是明抢用户。
跑分很猛,但先别急着磕头
DeepSeek 自己放出来的数据确实吓人。
• Terminal Bench 2.1:72.1 → 87.9 • Cybergym:52.7 → 83.3 • DeepSWE:12.8 → 62.7 • AutomationBench:12.8 → 31.8
DeepSWE 涨了近五倍。这个数字大到不像同一款模型,更像是换了一套考试大纲。实际上也确实有猫腻:Terminal Bench 从 2.0 升级到了 2.1,不同版本不能直接比;DeepSWE 是 DeepSeek 自己的 Harness 框架,评测权重几乎和模型一样黑盒。
OpenRouter 援引 Artificial Analysis 给 V4 Pro 的综合智能指数是 45.3,"优于 70% 的模型"。这跟"追平 Fable 5"的叙事之间,差着一条马里亚纳海沟。
同一天 Grok 4.6 也发布了,xAI 号称在 Artificial Analysis Intelligence Index 上追平 GPT-5.6 Sol,定价 6。这场面很有意思:DeepSeek 和 xAI 不约而同地选在 8 月 12 日深夜发旗舰,一个打价格战,一个打"数字同事"概念。真正睡不着的可能是 OpenAI 和 Anthropic 的定价团队。
所以我的态度是:价格是真的便宜,跑分先信一半。等第三方复现、等开源权重更新、等 huggingface 上的真实测评出来,再下结论不迟。我自己跑下来的感觉是:编程基准靠谱,Agent 长链任务的稳定性还需要在自己业务里磨。
我实测了三个场景
既然 Dify 里接好了,就顺手跑了几轮日常任务。
场景一:读一个 30 万字的 PDF 会议纪要合集
直接丢进 Dify 知识库,检索模式用多路召回 + Rerank,大模型总结用 V4 Pro。它确实能一次吃完,不用切片。总结出来的要点覆盖度不错,但会漏掉一些边缘但关键的讨论——就是那种"最后五分钟有人小声提了一句"的内容。384K 的输出上限在这里没派上用场,因为输入已经塞满了 1M。
这个场景里,V4 Pro 的真正价值不是"读得多",而是"不用切"。之前用短上下文模型,我得先把 PDF 拆成 20 段,每段跑一轮总结,再拼一轮。现在一次调用搞定,工程复杂度直接降了一个数量级。但代价也明显:一次调用烧掉近 1 块钱,如果每天跑几十份,账单也不秀气。
场景二:让 Agent 重写一个 Python 日志聚合脚本
给了它三个要求:把正则换成结构化解析、加异常重试、输出性能对比。V4 Pro 在 Dify Agent 里跑了 2 分 15 秒,生成了 180 行代码,其中有一处 import 路径写错。手动改完能跑。同样的任务用 Fable 5 大约 38 秒,代码一次通过。用 V4-Flash 大约 1 分 40 秒,有两处逻辑 bug。
价格是 Fable 5 的零头,但时间和正确率也是另一回事。便宜不等于好用,这个道理在 AI 上格外明显。
场景三:长文档生成
让它根据一份产品需求文档,直接输出一份 8000 字的技术方案。这是 Pro 真正拉开差距的地方。Flash 输出到一半就停了,Pro 能稳定输出长文本,结构也保持得不错。代价是 token 费确实上去了——一次调用烧了将近 2 块钱。
让我意外的是输出速度。384K 的长输出不是一口气吐完的,中间有明显的"喘气"感,类似于 GPT-4 早期长回复时的分段输出。对实时性要求高的场景不合适,但做离线报告生成完全够用。
一些真实的槽点
1. 思考链会说"山顶洞语"。词汇破碎、语法别扭,但意思还在。我怀疑这是为了压缩 token 消耗做的取舍,写作能力被明显牺牲了。 2. 隐私政策依旧是个刺。企业敏感数据我不敢直接喂,个人项目无所谓。 3. 涨价预告挂在定价页上。"计划在不久的将来上调整体 API 定价,预计涨幅较大"。当前这个价格是窗口期,不是承诺。别为了省几百块就 All-in。 4. 0813 的开源权重还没出。HuggingFace 上还是 4 月的预览版。想本地部署的得再等等。 5. 高峰时段会变慢。DeepSeek 的算力储备跟用户增长速度不完全匹配,晚上八九点调用时,首 token 延迟能从平时的 2 秒飙到 8 秒以上。做异步任务无所谓,实时对话会很难受。
给 Dify 用户的建议
不用二选一,两条供应商同时配置:
供应商 A:deepseek-v4-flash
用途:日常问答、轻量 RAG、高频调用
供应商 B:deepseek-v4-pro
用途:长文档生成、复杂 Agent、代码重构在 Dify Workflow 里用模型切换节点按任务长度和复杂度路由,比死磕一个模型省钱得多。我的做法是:输入 token 超过 50K 或者预期输出超过 4K 的任务走 V4 Pro,其余全部走 Flash。这样 Flash 承担了大约 85% 的调用量,Pro 只用在刀刃上。
如果你现在每个月 API 账单超过 500 块,建议先用 V4-Flash 替换掉 80% 的调用,再用 V4 Pro 替换掉剩下 20% 里真正需要强推理的任务。别为了省 Fable 5 的钱,把自己变成 DeepSeek 的免费测试员。
另外,缓存命中率是省钱的关键。DeepSeek 的缓存折扣是 98%,前提是前后两次请求的输入前缀高度一致。在 Dify 里这意味着 system prompt 和上下文要尽量固定,少做动态拼接。如果你的 Workflow 每次都把不同变量塞在 prompt 最前面,缓存基本命中不了。
这次转正为什么让我多想了一分钟
不是因为跑分,不是因为价格,是因为 Anthropic API 兼容。
这件事意味着 DeepSeek 不再满足于做 OpenAI 的平价替代,它开始直接抢 Claude 的生态位。Claude Code、Cursor、Windsurf、Dify 里那些已经按 Anthropic 格式写好的工具链,理论上可以无缝切过去。对开发者来说,迁移成本几乎为零;对 DeepSeek 来说,用户获取成本也几乎为零。
这不是技术竞争,这是生态竞争。模型本身的差距在缩小,接口和价格的差距在放大。接下来半年,我们可能会看到更多"双兼容"甚至"三兼容"的模型出现。到那时候,Dify 这类平台的价值会进一步凸显——它本来就是模型中立的,谁便宜好用就接谁。
收尾
我把 Dify 里那个用了两个月的 Claude Fable 5 供应商暂时禁用了。不是因为它不好,是它的价格让我每次点"运行"都像在赌场下注。V4 Pro 给了我在自己任务上实测的机会,成本低到可以任性。
但我也不会把 Fable 5 删掉。
就放在那里,等哪天 V4 Pro 在我那十几个真实项目里连续跑通不翻车,再彻底卸载。模型选型这件事,跑分只是参考,自己的账单和血压才是硬指标。
