JOTO
联系我们
← AI 智库
Dify

DeepSeek V4 Pro 突然转正,我在 Dify 里把 Fable 5 换了

2026 年 8 月 13 日

DeepSeek V4 Pro 于 8 月 13 日 quietly GA,模型 ID 为 deepseek-V4-Pro-0813。作者在 Dify 中通过 OpenAI-API-compatible 通道快速接入,实测其支持标准 tool_calls、具备 1M 上下文与 384K 输出能力,价格仅为 Claude Fable 5 的约 1/60。但并发限制(500)、高峰延迟、思考链表达生硬及隐私政策等仍存现实约束。

DeepSeek V4 Pro 突然转正

今天早上刷到 DeepSeek API 文档更新,deepseek-v4-pro 的模型版本号从 preview 切成了 DeepSeek-V4-Pro-0813。没有发布会,没有官方博客,连条推文都没有。就这么 quietly GA 了。

DeepSeek V4 Pro 突然转正,我在 Dify 里把 Fable 5 换了

我第一反应不是激动,是手痒。上个月刚把 Dify 里的 Agent 供应商从 GPT-5.6 Sol 切到 DeepSeek V4-Flash,账单直接腰斩。这次 Pro 转正,我倒要看看它能不能把 Claude Fable 5 也从我的工作流里挤出去。

我先在 Dify 里接了一把

Dify 的模型供应商设置里,DeepSeek 官方接口其实一直在。但 v1.16 之后我更习惯走「OpenAI-API-compatible」这条通用通道,因为模型名不用等 Dify 官方更新,base URL 一填就能跑。Dify 对官方模型的适配往往慢半拍,通用通道反而更稳。

配置出奇地简单:

# Dify Settings -> Model Providers -> OpenAI-API-compatible
model_name: deepseek-v4-pro
base_url: https://api.deepseek.com/v1
api_key: sk-xxxxxxxx

保存,测试连接,绿色对勾。从打开设置到跑通第一条消息,三分钟不到。

DeepSeek V4 Pro 突然转正,我在 Dify 里把 Fable 5 换了 配图 2

顺手跑了个 function calling 测试,让 Agent 调一个天气查询工具。V4 Pro 的 tool_calls 结构跟 OpenAI 格式一致,Dify 原生的 Agent 节点不用改任何模板。这点比某些国产模型的"伪兼容"强多了——表面上是 OpenAI 格式,真到 tool 调用就丢字段。

但这里有个坑。旧版 deepseek-chatdeepseek-reasoner 在 7 月 24 日之后已经指向 V4-Flash 的非思考和思考模式了。如果你跟我一样手里还留着几个月前的供应商配置,现在调 deepseek-v4-pro 才是拿到 0813 正式版的正确姿势。旧名字不是不能用,只是它背后已经不是你以为的那个模型。

另一个细节:Dify 里同一个 base URL 不要重复加。我之前已经有 V4-Flash 的供应商,这次新建 V4 Pro 时发现模型下拉列表里两个名字很容易搞混。建议在模型显示名里直接写清楚:DeepSeek V4-Pro-0813,别偷懒只写 deepseek-v4-pro

这次转正到底转了什么

先列硬参数,不多废话。

项目V4 Pro 0813V4-Flash 0731Claude Fable 5GPT-5.6 Luna
上下文1M tokens1M tokens200K tokens1M tokens
最大输出384K tokens8K tokens64K tokens128K tokens
输入价(未命中)¥3 / MTok¥1 / MTok~¥70 / MTok¥1.4 / MTok
输出价¥6 / MTok¥2 / MTok~¥350 / MTok¥8.4 / MTok
缓存命中¥0.025 / MTok¥0.02 / MTok约 90% 折扣
并发限制5002500未公开未公开
思考模式默认开启默认开启可选默认开启

Pro 和 Flash 的价差正好三倍,定位也清楚:Flash 负责高频轻量任务,Pro 负责长上下文、复杂 Agent 和一次性大输出。跟 Fable 5 一比,V4 Pro 的输出价只有对方的六十分之一。注意是"之一",不是"左右"。这个数字本身就有冲击力。

但便宜不是白送的。Fable 5 的并发和稳定性经过大量生产验证,V4 Pro 的 500 并发意味着你把它塞进高并发的客服系统里,可能会撞上瓶颈。这跟模型能力无关,是基础设施的成熟度问题。

真正让我意外的是 Anthropic API 兼容。Dify 里如果之前接的是 Claude 供应商,现在理论上可以把 base URL 改成 https://api.deepseek.com/anthropic,模型名改成对应 ID,就能让原来的 Claude Code / Claude Desktop 工作流直接跑在 DeepSeek 上。这招对那些被 Fable 5 账单折磨的 Agent 开发者来说,简直是明抢用户。

跑分很猛,但先别急着磕头

DeepSeek 自己放出来的数据确实吓人。

  • • Terminal Bench 2.1:72.1 → 87.9
  • • Cybergym:52.7 → 83.3
  • • DeepSWE:12.8 → 62.7
  • • AutomationBench:12.8 → 31.8

DeepSWE 涨了近五倍。这个数字大到不像同一款模型,更像是换了一套考试大纲。实际上也确实有猫腻:Terminal Bench 从 2.0 升级到了 2.1,不同版本不能直接比;DeepSWE 是 DeepSeek 自己的 Harness 框架,评测权重几乎和模型一样黑盒。

OpenRouter 援引 Artificial Analysis 给 V4 Pro 的综合智能指数是 45.3,"优于 70% 的模型"。这跟"追平 Fable 5"的叙事之间,差着一条马里亚纳海沟。

同一天 Grok 4.6 也发布了,xAI 号称在 Artificial Analysis Intelligence Index 上追平 GPT-5.6 Sol,定价 6。这场面很有意思:DeepSeek 和 xAI 不约而同地选在 8 月 12 日深夜发旗舰,一个打价格战,一个打"数字同事"概念。真正睡不着的可能是 OpenAI 和 Anthropic 的定价团队。

所以我的态度是:价格是真的便宜,跑分先信一半。等第三方复现、等开源权重更新、等 huggingface 上的真实测评出来,再下结论不迟。我自己跑下来的感觉是:编程基准靠谱,Agent 长链任务的稳定性还需要在自己业务里磨。

我实测了三个场景

既然 Dify 里接好了,就顺手跑了几轮日常任务。

场景一:读一个 30 万字的 PDF 会议纪要合集

直接丢进 Dify 知识库,检索模式用多路召回 + Rerank,大模型总结用 V4 Pro。它确实能一次吃完,不用切片。总结出来的要点覆盖度不错,但会漏掉一些边缘但关键的讨论——就是那种"最后五分钟有人小声提了一句"的内容。384K 的输出上限在这里没派上用场,因为输入已经塞满了 1M。

这个场景里,V4 Pro 的真正价值不是"读得多",而是"不用切"。之前用短上下文模型,我得先把 PDF 拆成 20 段,每段跑一轮总结,再拼一轮。现在一次调用搞定,工程复杂度直接降了一个数量级。但代价也明显:一次调用烧掉近 1 块钱,如果每天跑几十份,账单也不秀气。

场景二:让 Agent 重写一个 Python 日志聚合脚本

给了它三个要求:把正则换成结构化解析、加异常重试、输出性能对比。V4 Pro 在 Dify Agent 里跑了 2 分 15 秒,生成了 180 行代码,其中有一处 import 路径写错。手动改完能跑。同样的任务用 Fable 5 大约 38 秒,代码一次通过。用 V4-Flash 大约 1 分 40 秒,有两处逻辑 bug。

价格是 Fable 5 的零头,但时间和正确率也是另一回事。便宜不等于好用,这个道理在 AI 上格外明显。

场景三:长文档生成

让它根据一份产品需求文档,直接输出一份 8000 字的技术方案。这是 Pro 真正拉开差距的地方。Flash 输出到一半就停了,Pro 能稳定输出长文本,结构也保持得不错。代价是 token 费确实上去了——一次调用烧了将近 2 块钱。

让我意外的是输出速度。384K 的长输出不是一口气吐完的,中间有明显的"喘气"感,类似于 GPT-4 早期长回复时的分段输出。对实时性要求高的场景不合适,但做离线报告生成完全够用。

一些真实的槽点

  1. 思考链会说"山顶洞语"。词汇破碎、语法别扭,但意思还在。我怀疑这是为了压缩 token 消耗做的取舍,写作能力被明显牺牲了。
  2. 隐私政策依旧是个刺。企业敏感数据我不敢直接喂,个人项目无所谓。
  3. 涨价预告挂在定价页上。"计划在不久的将来上调整体 API 定价,预计涨幅较大"。当前这个价格是窗口期,不是承诺。别为了省几百块就 All-in。
  4. 0813 的开源权重还没出。HuggingFace 上还是 4 月的预览版。想本地部署的得再等等。
  5. 高峰时段会变慢。DeepSeek 的算力储备跟用户增长速度不完全匹配,晚上八九点调用时,首 token 延迟能从平时的 2 秒飙到 8 秒以上。做异步任务无所谓,实时对话会很难受。

给 Dify 用户的建议

不用二选一,两条供应商同时配置:

供应商 A:deepseek-v4-flash
用途:日常问答、轻量 RAG、高频调用

供应商 B:deepseek-v4-pro
用途:长文档生成、复杂 Agent、代码重构

在 Dify Workflow 里用模型切换节点按任务长度和复杂度路由,比死磕一个模型省钱得多。我的做法是:输入 token 超过 50K 或者预期输出超过 4K 的任务走 V4 Pro,其余全部走 Flash。这样 Flash 承担了大约 85% 的调用量,Pro 只用在刀刃上。

如果你现在每个月 API 账单超过 500 块,建议先用 V4-Flash 替换掉 80% 的调用,再用 V4 Pro 替换掉剩下 20% 里真正需要强推理的任务。别为了省 Fable 5 的钱,把自己变成 DeepSeek 的免费测试员。

另外,缓存命中率是省钱的关键。DeepSeek 的缓存折扣是 98%,前提是前后两次请求的输入前缀高度一致。在 Dify 里这意味着 system prompt 和上下文要尽量固定,少做动态拼接。如果你的 Workflow 每次都把不同变量塞在 prompt 最前面,缓存基本命中不了。

这次转正为什么让我多想了一分钟

不是因为跑分,不是因为价格,是因为 Anthropic API 兼容。

这件事意味着 DeepSeek 不再满足于做 OpenAI 的平价替代,它开始直接抢 Claude 的生态位。Claude Code、Cursor、Windsurf、Dify 里那些已经按 Anthropic 格式写好的工具链,理论上可以无缝切过去。对开发者来说,迁移成本几乎为零;对 DeepSeek 来说,用户获取成本也几乎为零。

这不是技术竞争,这是生态竞争。模型本身的差距在缩小,接口和价格的差距在放大。接下来半年,我们可能会看到更多"双兼容"甚至"三兼容"的模型出现。到那时候,Dify 这类平台的价值会进一步凸显——它本来就是模型中立的,谁便宜好用就接谁。

收尾

我把 Dify 里那个用了两个月的 Claude Fable 5 供应商暂时禁用了。不是因为它不好,是它的价格让我每次点"运行"都像在赌场下注。V4 Pro 给了我在自己任务上实测的机会,成本低到可以任性。

但我也不会把 Fable 5 删掉。

就放在那里,等哪天 V4 Pro 在我那十几个真实项目里连续跑通不翻车,再彻底卸载。模型选型这件事,跑分只是参考,自己的账单和血压才是硬指标。

JOTO 企业落地观察

  • 企业若考虑将 V4 Pro 用于 RAG 知识工程,需重点评估其 1M 上下文虽支持整份长文档加载,但 500 并发限制与高峰延迟可能影响多用户实时检索体验;相比 Fable 5 的稳定服务,该模型更适合离线批量摘要而非高 SLA 要求的在线知识服务。
  • V4 Pro 的 Anthropic API 兼容性为企业智能体工程带来新选项:已基于 Claude 工具链开发的 Agent 可低成本迁移,但需验证其 tool_calls 实际字段完整性与错误处理鲁棒性,避免因‘伪兼容’导致生产环境中的 silent failure。
  • 该模型 384K 输出能力对 FDE 驻场共创中的长文档交付场景有直接价值,如自动生成技术方案或合规报告;但其思考链表达生硬、高峰延迟及隐私政策限制,意味着驻场团队需配套设计缓存策略、异步调度机制与数据脱敏流程,不可直接替换现有稳定链路。
  • V4 Pro 当前未提供开源权重且企业数据隐私条款模糊,这对重视 AI 安全治理的企业构成明确约束——无法本地化部署即无法满足数据不出域要求,也无法进行模型层安全审计,仅适合非敏感场景的 PoC 验证。

立即咨询 JOTO

JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询

想把这些做法用到你的业务里?

留下你的场景和痛点,我们帮你判断从哪一步开始。

联系我们
联系我们

开启企业级 AI 落地

留下你的行业、部门和当前痛点,我们会在 1 个工作日内与你联系,帮你判断适合先做什么、需要准备哪些数据、适合什么平台。

微信咨询
扫码添加,一对一沟通
JOTO 微信咨询二维码
发送邮件
jotoai@jototech.cn

填写需求单

收到你的信息后,我们将在 1 个工作日内与你取得联系。