DeepSeek 官方文档:deepseek-v4-flash-vision-exp 视觉模型使用指南
- Source: DeepSeek API Docs(官方指南)
- URL: https://api-docs.deepseek.com/guides/vision
- Captured: 2026-08-22
指南要点(AAIF 扫描)
deepseek-v4-flash-vision-exp 支持图文混合输入,可做图片描述、截图读字、图表分析。支持 JPEG / PNG / GIF / WebP,格式按文件内容探测(不看文件名和 MIME 声明)。
三种送图方式(均走 OpenAI 兼容 Chat Completions,content 为块数组):
1. Base64 内联:转成 data: URL 直接嵌请求,最简单;计入 48 MiB 请求体上限。 2. 外部 URL:传公网 http(s) 链接由服务端下载;URL ≤8192 字符、单图 ≤32 MiB、下载须 60 秒内完成。 3. Files API file_id:上传一次多处复用;单图上限 64 MiB,不受 32 MiB 检查限制,适合大图和重复引用。
Detail 档位:low(缩到 512×512,更快更省)/ high(等价 original)/ original / auto(当前等价 original)。
Token 计费规则(关键):每张图推理前按比例缩放——小于约 384×384 的放大、更大的缩到约 800×800 总像素,因此单图上限 384 tokens;2000×2000 与 5000×5000 消耗相同。多图各自独立计算。
硬限制速查:
| 限制 | 值 | | --- | --- | | 单请求最多图片数 | 600 | | 总图片体积(无 file_id / 含 file_id) | 64 MiB / 最多 200 MiB | | 单图边长上限 | 8192 px(≥15 张图时降为 4096 px) | | 请求体上限 | 48 MiB |
限制与报错:图片只能放在 user 消息里,放进 system/assistant 返回 400;非视觉模型传图返回 400("This model does not support image");文本里含保留的图片占位符 token 会被拒。
另两条接入路径:Anthropic 兼容 /messages 端点(base_url=https://api.deepseek.com/anthropic,用 image source 块,file source 需 anthropic-beta: files-api-2025-04-14 头);Responses API(input_image 内容块,detail 语义相同,file_id 时忽略 detail)。
为什么值得读
接 DeepSeek 视觉模型前的必读参数表:384 tokens/图 的计费规则和各体积上限直接决定成本估算与架构选型(内联 vs Files API)。
Source: https://api-docs.deepseek.com/guides/vision
Captured: 2026-08-22 (AAIF content-fetcher)