腾讯混元最新发布并开源原生多模态生图模型HunyuanImage 3.0,模型参数规模高达80B,是目前参数量最大的开源生图模型,也是首个开源工业级原生多模态生图模型。
三大核心特性
原生多模态Coding基座:从预训练阶段深度融合视觉与文本能力,打破纯文本输入的编程局限,能看懂设计稿、截图、网页界面并生成可运行代码。上下文窗口拓展至200k。
视觉与编程能力兼得:在多模态Coding、GUI Agent等核心基准上表现领先,通过多任务协同RL技术,保证纯文本场景下的编程、推理能力不退化。
深度适配Agent场景:实现看懂环境→规划动作→执行任务的完整闭环,配备全套官方Skills开箱即用。
技术创新
混元3.0采用VAE+ViT联合特征作为图像理解输入,沿袭Transfusion思路将Diffusion建模无缝嵌入LLM架构。引入广义因果注意力机制,兼顾语言因果推理与图像全局建模。拥有原生世界知识推理能力,继承Hunyuan-A13B的世界知识。
数据处理与训练
从超过100亿张原始图像中筛选出近50亿张高质量图像,构建了中英双语分层级描述体系,专门构建了推理数据集以激活思维链能力。采用渐进式四阶段预训练,从256像素逐步提升至1024像素。
其他混元动态
腾讯混元还发布了3D世界模型2.0,支持多模态输入自动生成可编辑3D空间资产;以及具身多模态大模型HY-Embodied-0.5-X,赋能机器人智能交互。