doubao-pc

影眸科技发布Hyper3D WorldGen,一张图生成可编辑3D场景

AIGC行业资讯10小时前发布 zhang
7 0

9月1日,上海3D生成大模型公司影眸科技正式发布世界生成模型Hyper3D WorldGen,标志着3D生成从“单个资产”迈向“完整场景”的新阶段。用户只需上传一张场景图片,模型即可自动识别画面中的主要物体并生成对应的3D资产,也支持手动框选目标生成,最终通过自研的CAST架构重建物体之间的空间与物理关系,输出由多个独立、可编辑、可替换、可交互资产组成的3D场景。

CAST(基于单张RGB图像的组件对齐式3D场景重建)是影眸Hyper3D团队在2025年发布的场景级生成研究成果,其核心能力包括从单张图片中补全被遮挡物体的三维结构、判断物体间的接触、支撑、悬挂等关系,并将多个独立物体放置于统一且物理合理的三维空间中。该研究曾荣获SIGGRAPH 2025最佳论文,为WorldGen提供了坚实的技术底座。

在媒体交流会上,影眸科技联合创始人、CTO张启煊现场演示了WorldGen的生成流程:上传一张办公室盥洗室的图片后,系统自动识别出水龙头、盘子、水果等主要物体,约2-3秒生成单个物体的3D预览,并在2-3分钟内还原出完整场景。这些物体均为可独立选择、移动和替换的资产。开启SimReady功能后,系统还能为资产估计质量、大小和摩擦系数等物理属性,例如水果可在力的作用下滚入水池。用户还可根据物体重要程度选择不同生成精度,先快速搭建场景结构,再对重点资产精修。

影眸科技创始人、CEO吴迪举例说明,传统生成模型将会议室图片转化为3D场景时,桌椅、墙壁等物体往往被合并在一起,难以单独编辑;而WorldGen能够拆分主要物体、生成独立资产,并还原其空间与物理关系。为兼顾场景可用性与视觉完整性,WorldGen采用混合表达:需要编辑交互的物体使用具备完整几何结构的网格模型(Mesh),便于后续调整和添加物理属性;背景则采用侧重外观还原的3D高斯泼溅(3D Gaussian Splatting),保留更多环境细节。

WorldGen并非针对单一行业开发,其应用场景覆盖具身智能、游戏、影视制作和XR四大领域,目前已在不同方向推进落地。在具身智能领域,影眸Hyper3D已与地瓜机器人谋先飞合作推出仿真训练方案:WorldGen负责生成可仿真3D场景,谋先飞进行仿真适配,地瓜机器人提供算力与开发工具链。张启煊表示,生成式3D能快速扩充物体种类和场景布局,但不会完全替代真实数据,机器人训练未来更可能混合使用仿真与真实数据。

在影视领域,WorldGen可解决视频模型在多镜头中难以保持空间和物体位置一致的问题。创作者可先生成空间结构明确的3D场景,调整镜头、移动物体和修改布局,再交由Seedance 2.5视频模型补充人物表现、材质、光影和画面风格。在游戏和专业3D制作领域,WorldGen生成的独立网格资产可进入Blender、Unity、PlayCanvas、Unreal Engine等数字内容创作工具及实时引擎,继续材质调整、动画绑定、关卡编辑和性能优化。今年7月,影眸Hyper3D已与Unity中国宣布合作,尝试打通从3D生成到实时游戏应用的流程。在XR领域,WorldGen可将参考图片还原为可编辑三维空间,用于室内设计、空间展示和沉浸式体验。张启煊透露,上述应用目前主要处于内测或技术验证阶段,团队将根据客户需求确定后续投入重点。

针对技术边界,张启煊表示,系统生成的质量、摩擦系数等物理属性并非对真实物体的精确测量,而是结合资产体积、视觉信息、周围物体关系、传统估计算法及视觉语言模型进行推断,因此不能作为精密工程数据使用。现阶段WorldGen主要支持刚体生成,尚未覆盖关节化资产、柔体和流体。关于与“世界模型”的关系,吴迪指出,世界模型既包括面向决策和行动的行动模型,也包括生成可交互、可训练环境的模型,WorldGen更接近后者;影眸Hyper3D的核心定位仍是3D生成,不会因此定义为世界模型公司。他认为,视频模型擅长最终画面呈现,3D则能明确保存物体、空间结构和物理关系,两条路线并非相互取代,未来更可能以混合方式结合。

从单个资产走向完整场景,WorldGen让生成结果具备更强的可控性、可编辑性和工作流兼容能力。随着3D生成从“看起来好看”走向“真正可用”,场景级生成正在成为连接游戏、影视、具身智能和XR等行业的新基础能力。3D生成的竞争重点正从单个模型的视觉质量,转向场景的可控性、物理合理性和工作流兼容能力。尽管WorldGen仍以刚体生成为主,部分物理属性依赖推断,在多个行业尚处验证与早期落地阶段,但从“生成资产”走向“构建场景”已成为3D生成领域可行性较高的方向。

© 版权声明

相关文章

堆友更新