概览
DeepSeek V4 首个实验多模态:文本能力对齐 V4-Flash,支持图像输入与多模态 Agent。 DeepSeek-V4-Flash-Vision-Exp 是深度求索 V4 系列首实验多模态模型。官方称文本能力(Agent、推理、世界知识)对齐 DeepSeek-V4-Flash,多模态 Agent 评测大幅领先纯文本 V4-Flash。API 调用 model=deepseek-v4-flash-vision-exp;图片按尺寸算 token(单图最多约 384 tokens)并按 V4-Flash 价计费;支 Chat Completions / Messages / Responses,图片可用 base64、URL Files API。2026-08-31 Hugging Face 源权重(MIT)。上下文 1M,最大输出 384K。官方人民币价(百万 tokens,与 V4-Flash 同档):缓存命中 空闲 0.05 / 高峰 0.10;缓存未命中 空闲 1.5 / 高峰 3.0;输出 空闲 4.5 / 高峰 9.0(高峰为北京时间工作日 9–12、14–18)。来源:DeepSeek API Docs 定价页与 2026-08-21 发布说明。
- 模态
- 多模态
- 许可说明
- 开源 · MIT

