JOTO
联系我们
← AI 智库
多模态模型

V4-Flash-Vision-Exp 上线,开启多模态 API 服务

2026 年 8 月 21 日

DeepSeek 推出实验性多模态视觉理解模型 V4-Flash-Vision-Exp,通过 API 提供图文混合输入支持。该模型在纯文本能力上与 V4-Flash 持平,在多模态 Agent 基准测试中表现接近 Opus-4.8。支持 Chat Completions 等三种调用格式及 Files API 图片复用,计费按 token 统一标准。

全新多模态视觉理解模型上线

今天,全新的多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp 上线 DeepSeek API 平台,这是一个实验性质的模型,用户可以通过设置 model='deepseek-v4-flash-vision-exp' 访问该模型。

平衡文本与多模态能力

DeepSeek-V4-Flash-Vision-Exp 多模态能力对比图
*

对于公开基准测试集中的 Code Agent 文本任务,DeepSeek 系列模型使用 DeepSeek Harness 极简模式作为框架进行测试,使用 max 档位,temperature=1.0,topp=0.95;

**在 ApexBench 与 Agents' Last Exam 测评中,文本模型 DeepSeek-V4-Flash 会忽略其中的多模态元素。

  • 在纯文本能力(Agent、推理、世界知识等)方面,DeepSeek-V4-Flash-Vision-Exp 与 DeepSeek-V4-Flash 正式版持平;
  • 在需要视觉理解的 Agent Benchmark 上,DeepSeek-V4-Flash-Vision-Exp 相比 DeepSeek-V4-Flash 实现了大幅跃升,多模态 Agent 能力已接近 Opus-4.8。

多模态能力解锁更多 Agent 场景

V4-Flash-Vision-Exp 在各类 Agent 框架内展现出了较好的多模态适配能力,能够有效支持大家借助多样化的 Agent 工具解锁更多实用的工作场景。

示例1:在 Agent 框架下生成商业定制西藏自驾游 PPT

Prompt:帮我做个西藏攻略的ppt,藏南+藏北,一个月,自驾游,我是高端定制游,只做私人服务,和别的旅行团不一样,核心调性:野性、原始、探索感——不是常规打卡路线,是深入无人区级别的体验。视觉风格要大气、粗粝、有力量感,拒绝小清新和网红风。ppt要发送给高净值客户,要足够大气、野性、高端美观且最后给到三种真实定价方案,所有配图使用真实摄影图片风格(实拍质感)

西藏自驾游PPT生成效果示意
上下滑动或点击放大查看 PPT 内页完整内容效果

示例2:对 DeepSeek Harness 官网进行二次创作

DeepSeek Harness官网未来主义风格重构效果
要求模型用黑蓝深海、玻璃 UI 和 ASCII 原子像素等视觉要素,经过长多轮交互后重构得到的未来主义风格开发者网站

示例3:制作黏土怪物风格动态特效的前端 Mini Demo

黏土怪物舞池派对动态特效Demo
提示模型在“一群可爱的 3D 黏土小怪物加入一个跃动的复古舞池派对”的灵感下进行创作

API 支持与 Files API 上线

用户可以通过设置 model='deepseek-v4-flash-vision-exp' 来访问 V4-Flash-Vision-Exp 模型的 API。在 API 服务中,图片会转换成 token 后按 token 计费,一张图片最多占 384 tokens,计费价格与 V4-Flash 模型一致。

多模态 API 支持 Chat Completions、Messages、Responses 三种格式调用,可以方便接入各类 Agent 工具中使用,支持图文混合输入,支持 base64 内联、外部 URL、Files API 三种图片传入方式。使用说明请参考官方 API 文档:API 指南 - 图像理解。

Files API 上线

Files API 现已开放,该 API 不收费,用户可先将图片上传到平台,再在请求中通过 file_id 引用,从而节省请求带宽。同一张图片在多个请求中无需重复上传。

JOTO 企业落地观察

  • 企业若计划将多模态能力嵌入现有 Agent 工作流,需评估图文 token 消耗对成本结构的影响,尤其在高频次、多图请求场景下。
  • Files API 的引入降低了带宽压力,但企业需自行管理 file_id 生命周期与权限策略,这对内部知识工程系统的元数据治理提出新要求。
  • 该模型在多模态 Agent 基准中接近 Opus-4.8,意味着企业在不切换底层模型供应商的前提下,可快速验证视觉理解类业务逻辑的可行性。
  • 实验性质标注提醒企业:当前版本不适用于生产环境中的 SLA 敏感型任务,需预留模型降级与 fallback 机制。

立即咨询 JOTO

JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询

想把这些做法用到你的业务里?

留下你的场景和痛点,我们帮你判断从哪一步开始。

联系我们
联系我们

开启企业级 AI 落地

留下你的行业、部门和当前痛点,我们会在 1 个工作日内与你联系,帮你判断适合先做什么、需要准备哪些数据、适合什么平台。

微信咨询
扫码添加,一对一沟通
JOTO 微信咨询二维码
发送邮件
jotoai@jototech.cn

填写需求单

收到你的信息后,我们将在 1 个工作日内与你取得联系。