模型与实验室 4.0 · 优秀 2026-08-22 · 产品

DeepSeek 官方文档:deepseek-v4-flash-vision-exp 视觉模型使用指南

DeepSeek 官方 API 文档上线 deepseek-v4-flash-vision-exp 视觉模型:支持图文混合输入,可做图像描述截图文字读取与图表分析;JPEG/PNG/GIF/WebP 按文件真实内容探测格式图像走 OpenAI 兼容 Chat Completions 的 content 数组,三种传入方式(base64 data URL 内联 / 外链 URL 最长 8192 字符 / Files API file_id),Responses API 亦可经 input_image 传入;图像按尺寸折算 token与文本合并计费,多图请求中每张独立计算该模型文档在 HN 单帖 447 分141 评论,社区关注度高

打开原文回到归档

DeepSeek 官方文档:deepseek-v4-flash-vision-exp 视觉模型使用指南

指南要点(AAIF 扫描)

deepseek-v4-flash-vision-exp 支持图文混合输入,可做图片描述、截图读字、图表分析。支持 JPEG / PNG / GIF / WebP,格式按文件内容探测(不看文件名和 MIME 声明)。

三种送图方式(均走 OpenAI 兼容 Chat Completions,content 为块数组):

1. Base64 内联:转成 data: URL 直接嵌请求,最简单;计入 48 MiB 请求体上限。 2. 外部 URL:传公网 http(s) 链接由服务端下载;URL ≤8192 字符、单图 ≤32 MiB、下载须 60 秒内完成。 3. Files API file_id:上传一次多处复用;单图上限 64 MiB,不受 32 MiB 检查限制,适合大图和重复引用。

Detail 档位:low(缩到 512×512,更快更省)/ high(等价 original)/ original / auto(当前等价 original)。

Token 计费规则(关键):每张图推理前按比例缩放——小于约 384×384 的放大、更大的缩到约 800×800 总像素,因此单图上限 384 tokens;2000×2000 与 5000×5000 消耗相同。多图各自独立计算。

硬限制速查:

| 限制 | 值 | | --- | --- | | 单请求最多图片数 | 600 | | 总图片体积(无 file_id / 含 file_id) | 64 MiB / 最多 200 MiB | | 单图边长上限 | 8192 px(≥15 张图时降为 4096 px) | | 请求体上限 | 48 MiB |

限制与报错:图片只能放在 user 消息里,放进 system/assistant 返回 400;非视觉模型传图返回 400("This model does not support image");文本里含保留的图片占位符 token 会被拒。

另两条接入路径:Anthropic 兼容 /messages 端点(base_url=https://api.deepseek.com/anthropic,用 image source 块,file source 需 anthropic-beta: files-api-2025-04-14 头);Responses API(input_image 内容块,detail 语义相同,file_id 时忽略 detail)。

为什么值得读

接 DeepSeek 视觉模型前的必读参数表:384 tokens/图 的计费规则和各体积上限直接决定成本估算与架构选型(内联 vs Files API)。

Source: https://api-docs.deepseek.com/guides/vision
Captured: 2026-08-22 (AAIF content-fetcher)