一张照片,生成一个能用的场景。里面的物体可以被单独移动、修改和替换,还能带上碰撞体、质量和摩擦等物理属性,并进入真实的生产工作流。
9月1日,影眸科技Hyper3D正式发布世界生成模型WorldGen。它背后的场景级生成技术CAST拿下了国际图形学顶会SIGGRAPH 2025最佳论文,同届获得最佳论文的商业公司只有三家,谷歌、Meta和影眸Hyper3D。CAST把3D生成从单个物体推进到完整场景,重点解决遮挡下的物体补全、空间对齐和物体之间的物理关系;WorldGen则沿着把这套研究方向,在后续模型、算法与工程系统上进一步演进并完成产品化。
WorldGen的生成从一张普通照片开始。系统先识别其中有哪些物体,再分别补全每件物体看不见的部分,生成独立的3D模型,恢复它们的真实尺寸,以及彼此之间的位置与物理关系,最后重新组成一个完整空间。
这里的“独立”很关键。一张客厅照片进去,得到的不是一个粘在一起、只能转着看的“3D 客厅”。桌子还是桌子,杯子还是杯子,椅子可以被单独选中、移动、替换和编辑。

一张照片只记录了物体在画面里看起来在哪里,却没有把它们在三维空间中的支撑、接触和遮挡关系写出来。WorldGen要做的,是把这些关系重新恢复出来,再把各个独立资产放回一个结构成立的空间。桌子为什么在瓶子下面、椅子为什么落在地面,这些看似理所当然的关系,正是从一张平面照片生成完整世界时需要模型补出来的部分。
一个可编辑、可运行的3D场景,也意味着生成结果可以被真正用起来。具身智能团队可以把整个场景导入仿真环境,让机械臂在里面练习抓取;游戏开发者可以把资产放进Unity等引擎中继续改关卡;影视创作者可以在这个3D空间里固定构图和机位,再交给Seedance2.5等视频模型渲染成片;在Vision Pro等XR设备中,用户还可以进入这个由照片生成的空间。
从生成一个物体,到理解物体之间的关系
影眸科技Hyper3D成立于2020年,核心创始团队来自上海科技大学。此前的核心产品为自研的原生3D大模型 Hyper3D Rodin,解决的是单个3D物体的生成。用户输入一句话或一张图,可以在几分钟内得到高质量、可继续编辑、可导入游戏引擎或设计软件进行生产的3D资产。
据影眸提供的数据,目前 Hyper3D 已服务全球近千万用户,客户与生态伙伴包括 Lowe’ s、字节跳动、拓竹、Unity中国(团结引擎)等;Hyper3D Rodin 也曾出现在黄仁勋 CES 2026 主题演讲展示的工作流和OpenAI首届Codex黑客松的冠军项目中。
影眸Hyper3D是全球最早定义3D生成底层框架的团队之一。当时3D生成行业常见的训练方法是先用图像模型生成一个物体的多视角图片,再恢复成3D,以绕开3D数据稀缺的问题;影眸Hyper3D团队则选择直接使用3D数据训练模型。2024年,其原生3D大模型框架CLAY获得SIGGRAPH最佳论文提名,这项工作定义了原生3D生成的底层技术框架,此后行业的主流技术路径逐步转向原生3D,CLAY也成为Hyper3D Rodin的技术基础。
在单个物体的3D生成技术不断迭代的同时,影眸Hyper3D把下一步技术探索分成两个方向。影眸科技Hyper3D联创兼CTO张启煊把它们称为“向内”和“向外”。向内,是探索一个完整资产能否继续拆分为…