DeepSeek开源首个多模态模型:给Agent装上眼睛,识图成本只按文本算

DeepSeek开源首个多模态模型:给Agent装上眼睛,识图成本只按文本算

8月31日,DeepSeek将V4家族第一个多模态模型DeepSeek-V4-Flash-Vision-Exp权重挂上HuggingFace,MIT License。总参数约305B,上下文1M、最大输出384K,图片按V4-Flash价格计费,单图最多384 tokens。这是给Agent装的眼睛而非给人看的,强调Multimodal Agent Capabilities。在真实软件工程测试DeepSWE上拿到59.3%反超Opus-4.8登顶。加视觉能力后纯文本能力没有缩水,MIT协议加完整推理参考实现,二次开发门槛压到最低。

原文链接:https://m.sohu.com/a/1070961167_122971616/

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注