发生了什么
8月21日,DeepSeek 官方宣布多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp 正式上线 DeepSeek API 平台。这是一个实验性质模型,开发者将模型名称设置为 deepseek-v4-flash-vision-exp 即可调用。模型支持图文混合输入,可完成图片描述、截图文字识别、图表分析等任务,支持 JPEG、PNG、GIF、WebP 四种格式。
能力与定价
官方介绍显示,在 Agent、推理、世界知识等纯文本能力上,V4-Flash-Vision-Exp 与 DeepSeek-V4-Flash 正式版持平;在需要视觉理解的 Agent Benchmark 上相比 V4-Flash 实现大幅跃升,多模态 Agent 能力已接近 Anthropic Claude Opus-4.8。计费方面,图片会转换为 token 后按 token 计费,单张图片最多折算 384 tokens,整体价格与 V4-Flash 保持一致。
对开发者的意义
- 多模态 API 支持 Chat Completions、Messages、Responses 三种调用格式,可接入 LangChain、AutoGen、CrewAI 等主流 Agent 框架
- 图片支持 Base64 内联、外部 URL、Files API 三种传入方式,适配不同开发场景
- 同步上线的 Files API 免费开放,图片先上传后按 file_id 复用,适合多轮 Agent 工作流,节省带宽开销
- 官方配套的 DeepSeek Harness 0.1.1 已默认支持新模型,开箱即用
企业视角
此前 DeepSeek V4 系列为纯文本模型,在需要视觉的 Agent 任务中常需借助虚构工具或外部 OCR 服务。V4-Flash-Vision-Exp 以接近 V4-Flash 的价格补齐了视觉短板,为商业 PPT 制作、网站视觉重构、前端 Demo 开发、截图分析与图表解读等真实场景提供了低成本多模态路径,也为国产大模型在多模态 Agent 赛道上增添了新的选择。

