阿里通义发布Qwen3.8-Flash多模态MoE模型,训练成本降至九分之一

阿里通义发布Qwen3.8-Flash多模态MoE模型,训练成本降至九分之一

8月26日晚,阿里通义千问团队发布Qwen3.8-Flash。这是一款多模态MoE模型,主模型参数量125B,每token激活6B参数,并配备51B的N-gram Embedding,支持百万级上下文。相比上一代Qwen3.7-Plus,其训练成本降至约九分之一,在14项基准测试中的8项取得最佳结果。模型同时支持API调用,通义团队同步开源Qwen3.8-Flash-Next模型权重。

原始链接:http://m.toutiao.com/group/7679075004754985515/

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注