DeepSeek近日在API平台上线实验性多模态视觉理解模型DeepSeek-V4-Flash-Vision-Exp,这是V4系列首款原生支持图片输入的视觉模型,开发者通过设置model参数为deepseek-v4-flash-vision-exp即可调用。
能力层面,该模型在纯文本Agent、推理与知识能力上与V4-Flash正式版基本持平,同时补齐了图像理解能力。官方公布的4项多模态Agent评测中,在Agents' Last Exam和ZeroBench上高于Opus 4.8,在ApexBench与Chartography上略低,综合表现已接近行业旗舰水平。
API调用方面,支持Chat Completions、Messages和Responses三种格式,可接收base64、外部URL与Files API三种图像输入。一张图片最多转换为384个token,计费价格与V4-Flash相同。同步开放的Files API不收取存储费用,同一图片上传后可通过file_id跨请求复用,有效减少重复传输开销。
模型延续100万token超长上下文窗口,支持思考模式,适配Harness智能体框架,可结合图片理解完成调研、数据提取和自动化任务编排等链路工作。官方提醒,该产品属于Exp实验预览版本,不建议直接用于生产环境,正式版上线时间暂未公布。DeepSeekV4视觉模型上线
