一张照片,生成一个能用的场景。里面的物体可以被单独移动、修改和替换,还能带上碰撞体、质量和摩擦等物理属性,并进入真实的生产工作流。
9月1日,影眸科技Hyper3D正式发布世界生成模型WorldGen。它背后的场景级生成技术CAST拿下了国际图形学顶会SIGGRAPH 2025最佳论文,同届获得最佳论文的商业公司只有三家,谷歌、Meta和影眸Hyper3D。CAST把3D生成从单个物体推进到完整场景,重点解决遮挡下的物体补全、空间对齐和物体之间的物理关系;WorldGen则沿着把这套研究方向,在后续模型、算法与工程系统上进一步演进并完成产品化。
WorldGen的生成从一张普通照片开始。系统先识别其中有哪些物体,再分别补全每件物体看不见的部分,生成独立的3D模型,恢复它们的真实尺寸,以及彼此之间的位置与物理关系,最后重新组成一个完整空间。
这里的“独立”很关键。一张客厅照片进去,得到的不是一个粘在一起、只能转着看的“3D 客厅”。桌子还是桌子,杯子还是杯子,椅子可以被单独选中、移动、替换和编辑。
一张照片只记录了物体在画面里看起来在哪里,却没有把它们在三维空间中的支撑、接触和遮挡关系写出来。WorldGen要做的,是把这些关系重新恢复出来,再把各个独立资产放回一个结构成立的空间。桌子为什么在瓶子下面、椅子为什么落在地面,这些看似理所当然的关系,正是从一张平面照片生成完整世界时需要模型补出来的部分。
一个可编辑、可运行的3D场景,也意味着生成结果可以被真正用起来。具身智能团队可以把整个场景导入仿真环境,让机械臂在里面练习抓取;游戏开发者可以把资产放进Unity等引擎中继续改关卡;影视创作者可以在这个3D空间里固定构图和机位,再交给Seedance2.5等视频模型渲染成片;在Vision Pro等XR设备中,用户还可以进入这个由照片生成的空间。
从生成一个物体,到理解物体之间的关系
影眸科技Hyper3D成立于2020年,核心创始团队来自上海科技大学。此前的核心产品为自研的原生3D大模型 Hyper3D Rodin,解决的是单个3D物体的生成。用户输入一句话或一张图,可以在几分钟内得到高质量、可继续编辑、可导入游戏引擎或设计软件进行生产的3D资产。
据影眸提供的数据,目前 Hyper3D 已服务全球近千万用户,客户与生态伙伴包括 Lowe's、字节跳动、拓竹、Unity中国(团结引擎)等;Hyper3D Rodin 也曾出现在黄仁勋 CES 2026 主题演讲展示的工作流和OpenAI首届Codex黑客松的冠军项目中。
影眸Hyper3D是全球最早定义3D生成底层框架的团队之一。当时3D生成行业常见的训练方法是先用图像模型生成一个物体的多视角图片,再恢复成3D,以绕开3D数据稀缺的问题;影眸Hyper3D团队则选择直接使用3D数据训练模型。2024年,其原生3D大模型框架CLAY获得SIGGRAPH最佳论文提名,这项工作定义了原生3D生成的底层技术框架,此后行业的主流技术路径逐步转向原生3D,CLAY也成为Hyper3D Rodin的技术基础。
在单个物体的3D生成技术不断迭代的同时,影眸Hyper3D把下一步技术探索分成两个方向。影眸科技Hyper3D联创兼CTO张启煊把它们称为“向内”和“向外”。向内,是探索一个完整资产能否继续拆分为独立的部件,例如一辆车还能不能继续拆成车身、车轮、内饰,对应后来Hyper3D独有的递归分件功能BANG;向外,是一个物体能不能扩展成多个物体,并共同组成一个空间,对应2025年获得 SIGGRAPH 最佳论文的 CAST,以及今天的 WorldGen。
数量增加只是表面变化。张启煊用一瓶水解释了更麻烦的问题。
“桌上放着一瓶水,怎么让它们两个的物理关系正确?以及,为什么不是一张桌子放在一瓶水上?”
一个世界里,物体之间存在默认的空间和物理关系。桌子支撑瓶子,灯悬挂在天花板上,椅子落在地面,而不是悬在半空。单张图片又只提供一个视角,椅背被桌子挡住的部分长什么样,柜子到底有多深,两个物体究竟是接触还是只在画面里发生重叠,很多信息都需要模型自己补出来。
这正是CAST这项研究要解决的问题。它的管线会先识别物体和深度,再分析谁支撑谁、谁悬挂于谁,比如书架上斜靠的两本书是否真实接触、由哪本书或书架提供支撑;对被遮挡的物体补全完整3D形态;随后恢复每件物体的位置和朝向,最后根据关系图做物理校正,减少穿模和悬浮。这些能力后来被整合进WorldGen的生成流程。
给生成的世界补上重量、摩擦和碰撞
空间关系成立之后,WorldGen还要补上另一类图片里无法直接读取的信息。一把椅子有多重,椅脚和地面有多大摩擦,两个物体撞到一起后是弹开还是停住,这些都不会直接写在像素里。对于游戏和影视,它们会影响场景中的交互;到了具身智能仿真,这些参数更直接决定训练环境是否可用。
WorldGen会结合物体体积、周围环境和物体关系,用视觉语言模型和传统算法,对质量、摩擦、碰撞体等属性做估计,实际使用前仍需在目标仿真环境中校验。
以刚体能力为基础,WorldGen之后将逐步研究抽屉、柜门等关节体、衣服等柔性体及流体生成,最终实现对各类物理对象的完整原生支持。
视觉上可信、结构上成立、物理上可用,是三个逐层提高的门槛。WorldGen 的价值,很大程度上就在于试着把3D生成继续推向后两层。
研究成果和稳定产品之间还有另一道门槛。CAST 在2025年已经拿到 SIGGRAPH 最佳论文,WorldGen 却又花了一年左右才上线。张启煊用一笔很简单的账解释了原因。假设每个模块成功率都是95%,五个模块连续串起来,整体成功率只有约77%。CAST架构由多个模块组成,模块冗余与误差累积会带来级联问题。
对论文 Demo 来说,可以集中展示跑通的结果;产品面对用户,需要尽量让每一次生成都可用。过去一年,沿着CAST所验证的场景级3D生成方向,影眸Hyper3D团队继续推进后续模型、算法与工程系统的演进,减少了冗余模块、重构底层流程,也不断提高每一环的稳定性。
从 CAST 到 WorldGen,多出来的这一年,很大一部分时间花在了把“可以做到”变成“可以交付”。
WorldGen 在3D表达方式上也做了兼顾实用性的设计。如果所有东西都做成高精度 Mesh,背景里大量不需要交互的细节会消耗额外的生成和渲染成本;全部使用 Gaussian,又很难天然获得物体级的编辑和物理属性。于是它采用混合路线,背景用 Gaussian,需要操作和仿真的物体直接生成独立 Mesh,兼顾了结构可用性和视觉完整性。
以3D Gaussian Splatting 为核心表达的部分模型支持进一步导出 Mesh 和碰撞 Mesh;WorldGen 则从生成阶段就区分背景与可交互对象,需要移动、碰撞和仿真的物体直接生成独立 Mesh,并附加物体级物理属性。
巧合的是,WorldGen 背后的 CAST 是 SIGGRAPH 2025 最佳论文,而 3D Gaussian Splatting正是 SIGGRAPH 2023 最佳论文。
谁需要一个可以使用的世界
结构化的3D世界首先让影眸Hyper3D和具身智能行业发生了更多交集。真实机器人数据昂贵,也很难覆盖足够多的物体和场景。现实里想获得大量不同杯子的抓取数据,需要先准备大量真实杯子;生成式3D则可以快速扩展同一类别的尺寸、形状和材质,再把它们放进仿真环境。
作为NVIDIA Inception的一员,影眸Hyper3D长期深度融入NVIDIA全球仿真生态。此前,Hyper3D Rodin借助NVIDIA Omniverse与Isaac Lab上线了Sim-Ready功能,为3D生成资产赋予物理属性,并推出Isaac Sim官方插件。
如今,这一进程正通过Hyper3D WorldGen进一步深化,将“单个资产用于Isaac Sim”拓展为“整个场景用于Isaac Sim”。从资产生成到仿真验证,影眸Hyper3D已与NVIDIA Isaac Sim生态衔接为完整的上下游通路,覆盖具身智能仿真数据的关键环节。
今年7月,影眸Hyper3D联合地瓜机器人、谋先飞发布了“具身智能可训练仿真闭环联合解决方案”。在这套方案里,WorldGen根据单张照片重建出资产彼此独立、带物理属性、可导入仿真的3D场景,还能通过调整布局和资产状态,造出同一任务下的多种环境变体;谋先飞基于自研物理引擎MotrixSim完成仿真适配和SimReady场景构建,让机器人在其中运动、抓取和交互;地瓜机器人则负责算力和开发工具链,从场景生成、仿真到采数据、训模型,整条链路跑在一个平台上。
影眸Hyper3D与港大、上海交大合作的ManiTwin-100K,则进一步建立了十万级可交互3D资产数据集。每件物体除了几何模型,还带有抓取位姿、功能区域、物理属性等信息,可以直接用于Isaac Sim、SAPIEN等机器人仿真环境。影眸Hyper3D参与的cuNRTO研究,今年也拿到了具身智能顶会RSS的最佳论文提名,探索的正是仿真到真实部署之间的Sim-to-Real问题。
在Physical AI的讨论里,仿真和合成数据也正在变得越来越重要。现实数据采集慢、贵,而且很难覆盖危险和罕见情况。影眸Hyper3D希望在这条链条上扮演的是3D基础设施的角色,用生成的3D资产和场景连接仿真环境,并进一步通过Sim-to-Real走向真实世界。仿真平台、机器人本体和策略模型仍由上下游完成,影眸Hyper3D主要提供其中的3D资产与场景。
游戏反而很快给出了直接的产品反馈。今年8月末,WorldGen 刚向大约三分之一用户做小范围灰度测试,就有游戏公司的员工当天找上门询问 API。
原因不难理解。如果生成的是一整块场景,开发者很难单独换掉一把椅子、修改一个道具。把场景拆成独立资产以后,它们才更容易进入现有3D生产管线。WorldGen生成的独立资产可以继续进入Blender等DCC工具,以及Unity、团结引擎、PlayCanvas、Unreal Engine等实时引擎,进行材质调整、动画绑定、关卡编辑和性能优化,再接回开发者熟悉的制作流程。今年7月,影眸Hyper3D与Unity中国宣布合作,共同构建从3D生成到实时游戏应用的工程闭环,WorldGen也在同期的团结引擎2.0发布会上亮相。
张启煊认为,AI 3D对游戏的价值也不止是降低美术成本。UGC和小团队可能是更值得观察的变化。玩家未来能不能直接参与创造3D世界,小团队能不能在没有完整美术配置的情况下完成以前做不起的项目,都是生成门槛下降之后才会出现的可能性。
影视需要的是另一部分能力,保持世界状态。视频模型已经可以生成很漂亮的单个镜头,但到了连续镜头,同一艘船的船舷可能悄悄改变形状,一个苹果也未必还在原来的位置。3D场景可以把这些状态显式保存下来。
影眸Hyper3D创始人兼CEO吴迪举过一个例子。如果导演想把左边盘子里的苹果挪到右边,依靠单纯的视频生成很难稳定控制,但在3D场景里的控制会很直接。WorldGen生成的场景相当于一个可控白模,目前上线的AI Render模块提供AI渲染和自由运镜,创作者可以在这个空间里调度镜头、调整构图,确定之后再交给Seedance 2.5等视频模型补上材质、光影和风格,把白模转成接近影视级的画面。3D负责空间关系和控制,视频模型负责最终视觉表现。已经有创作者把WorldGen和Seedance 2.5串成一条工作流在做影视内容。据影眸Hyper3D介绍,这套混合流程也已经进入实际影视制作,相关作品仍在制作中。
空间计算顺着同一条路线继续往前。Hyper3D 现有的单体3D资产已经支持导出 USDZ(苹果生态常用的 AR 3D 格式),可以直接在 iPhone 和 Vision Pro 上查看。WorldGen 把生成单位从一件3D物体扩展到完整空间,开放场景的演示里,主要物体只占画面一部分,包括远处天空在内的环境也会被恢复出来。按影眸Hyper3D的规划,这类由一张图片生成的空间可用于室内设计、沉浸式教育、空间展示和XR内容创作,用户可以走进去,从不同位置和视角观察场景里的物体和细节;后续还可以替换场景中的物体、调整陈列,为关键物体增加交互。
机器人要物理关系,游戏要可编辑资产,影视要稳定的世界状态,空间计算需要可以进入的三维环境。它们指向的共同要求是,场景级生成结果不能只在出图的一刻成立,还要能够继续被调用、修改和使用。
3D生成,为什么开始从物体走向场景
“世界”也正在成为 AI 行业越来越拥挤的关键词。李飞飞创办的 World Labs 今年把被统称为 world model 的技术拆成三种角色。Renderer 负责生成用户看到的画面,Simulator 保存世界状态和动力学,Planner 则负责根据世界状态做决策。几条路线最终可能融合,但它们目前解决的问题仍有明显区别。
按这个分类,WorldGen 更接近从3D内容生产这一侧,向 Simulator 所需要的世界结构靠近。它不负责给机器人做决策,也没有完全依赖视频逐帧生成世界,而是把场景保存成显式存在的物体、空间关系和物理属性。
发布前,影眸Hyper3D内部也讨论过这个模型究竟该叫“场景生成”还是“世界生成”。最后选择WorldGen,是因为产品已经开始处理开放场景;但公司仍然刻意和“世界模型公司”这个标签保持距离。吴迪认为,“世界模型”目前仍是一个边界很模糊的概念,如果为了跟风就去追逐宏大的概念没有太大意义。对影眸Hyper3D来说,无论此前生成单个物体的Hyper3D Rodin、今天生成场景的WorldGen,还是之后继续向外扩展,主线仍然是探索3D 生成及其衍生能力如何服务更多用户。
这也和影眸Hyper3D自己的产品变化形成了某种对应。从业内独家的控制生成、自然语言编辑、递归分件等可控性功能到今天的WorldGen,看起来是在不断增加新功能,背后却有一条相对稳定的方向,把3D生成从一次“抽卡”,逐渐变成一个可以控制、修改、拆解、组合并接入后续工作流的生产系统。
吴迪把这种变化类比成大模型从 Chatbot 走向 Agent。单次生成质量依旧重要,决定技术最终能进入多少真实场景的,开始越来越取决于生成之后还能做什么。
未来,WorldGen将围绕关节、柔性体和流体的生成、物理属性的精确度以及仿真能力迁移到真实机器人时的Sim-to-Real落差等方向持续优化,逐步补全能力版图,更好地还原完整的物理世界。
但这次影眸Hyper3D从单个资产走向场景的尝试,已经把3D生成的“可用”范围向前推了一层。Hyper3D Rodin 要解决的是一个3D物体生成之后能不能继续生产,WorldGen 开始回答的是,当越来越多这样的物体被生成出来,它们能不能按照合理的空间和物理关系共同存在,并形成一个可以继续工作的环境。
这一步的意义也不只在于多了一个模型。在3D生成领域里,单体3D生成正在变快、变便宜,业内技术也越来越成熟,新的竞争已经开始延伸到场景理解、状态保存、物理属性和工作流衔接。
沿着3D生成技术的前沿方向,影眸Hyper3D正在做一件更具挑战性的事。WorldGen已经开始尝试让AI生成的3D内容从孤立的资产变成彼此有关联、能够继续被游戏、影视、具身智能和空间计算等多个核心场景使用的环境。相比再把单个模型做得更快、更像,这条路更难,也更接近影眸Hyper3D一直强调的“可用”标准。它同时把这家年轻公司带向了一个更有想象力的命题,AI生成的3D内容,最终能在多大程度上成为一个真正可运行、可交互的世界。




0 条评论
请「登录」后评论