DeepSeek开源首个多模态模型:给Agent装上眼睛,识图成本只按文本算
8月31日,DeepSeek将V4家族第一个多模态模型DeepSeek-V4-Flash-Vision-Exp权重挂上HuggingFace,MIT License。总参数约305B,上下文1M、最大输出384K,图片按V4-Flash价格计费,单图最多384 tokens。这是给Agent装的眼睛而非给人看的,强调Multimodal Agent Capabilities。在真实软件工程测试DeepSWE上拿到59.3%反超Opus-4.8登顶。加视觉能力后纯文本能力没有缩水,MIT协议加完整推理参考实现,二次开发门槛压到最低。