2026年8月28日,DeepSeek正式发布V4-Flash-Vision-Exp视觉模型,这是其首个原生多模态模型。
核心亮点
纯文本能力不降级:在Agent、推理、世界知识等纯文本任务上,Vision-Exp与V4-Flash正式版基本持平。
视觉能力大幅跃升:在需要视觉理解的Agent Benchmark上,多模态Agent能力已接近Anthropic的Opus-4.8。具体数据:DeepSWE 59.3 vs 58.0、Agents Last Exam 27.3 vs 25.7。
同价格策略
图片按token折算,一张图最多占384 tokens,价格与V4-Flash完全一致。多模态不溢价,这与DeepSeek一贯的“把溢价点打成地板价”策略一脉相承。
Files API同步上线
图片上传一次后,通过file_id在不同请求里反复引用,无需重复上传。还直接集成进Harness工具,支持原生图片请求。
核心变化
Agent第一次能看见自己的工作。官方演示案例包括:为高净值客户做PPT、制作带黏土怪物动画的前端Mini Demo等。模型需要先看懂图片、页面结构和设计意图,再调用工具产出结果。