简短结论
HY-World 2.0 是腾讯混元开源的多模态世界模型,覆盖两条核心路径:从文字或单张图片生成可导航 3D 世界,以及从多视角图片或视频重建现有场景。它输出可长期保留、编辑、实时渲染并导入 3D 引擎的 Gaussian Splatting、Mesh 和点云,而不只是一段固定视频。
重点要点
两条工作流:从文字或单图生成新世界,或从多视角图片和视频重建真实场景。
真正的 3D 输出:生成可持续使用的 Gaussian Splatting、Mesh 和点云,而非播放完即结束的短视频。
四段式系统:HY-Pano 2.0 生成全景,WorldNav 规划路径,WorldStereo 2.0 扩展场景,WorldMirror 2.0 完成三维表示。
完整开源内容:技术报告、推理代码、模型权重、文档以及本地 WorldMirror 2.0 Gradio 查看器均已公开。
HY-World 2.0 流程概览
| 维度 | 输入 | 核心工作 | 输出 |
|---|---|---|---|
| HY-Pano 2.0 | 文字提示或单张参考图。 | 生 成决定世界整体外观的 360° 全景。 | 可用于场景解析与导航规划的全景环境。 |
| WorldNav | 生成的全景与解析后的场景结构。 | 在环境中规划避障相机轨迹。 | 定义世界扩展方向的相机路径与渲染视图。 |
| WorldStereo 2.0 | 规划轨迹、渲染视图与累积场景记忆。 | 生成一致关键帧,并沿路径补全未见区域。 | 覆盖更大环境且对齐的多视角序列。 |
| WorldMirror 2.0 + 3DGS | 生成或拍摄的多视角画面。 | 估计几何与相机,准备 Gaussian 数据并优化场景。 | 持久化 3DGS 世界、Mesh、点云及辅助空间图。 |
HY-World 2.0 能做什么
HY-World 2.0 面向世界生成、重建与仿真。文字提示或单张图片可以创建一个全新的可导航环境;一组照片或随手拍摄的视频则可以重建成数字场景。
关键在于它生成的是空间资产:3D Gaussian Splatting、Mesh、点云、深度、法线和相机参数,因此结果能从新视角反复探索,而不是被锁在固定镜头里。
从提示词或图片生成可导航世界
生成流程由 HY-Pano 2.0 根据文字或图片创建 360° 全景开始。WorldNav 解析场景并规划避障相机路径,WorldStereo 2.0 沿路径生成连贯关键帧,并利用场景记忆扩展未见区域。
随后 WorldMirror 2.0 估计几何与相机信息,3DGS 优化导出最终世界。公开命令行流程依次完成轨迹规划、轨迹渲染、世界扩展、GS 数据准备和 3DGS 训练。

用照片或视频重建 3D 场景
重建流程中,WorldMirror 2.0 接收多视角图片或视频,在一次前向计算中预测稠密点云、深度图、表面法线、相机内外参和 3DGS 属性;已有相机与深度信息时还可作为先验注入。
仓库提供单卡/多卡推理、Python Pipeline、CLI 和 Gradio 应用,可在浏览器查看 3DGS、点云、深度、法线与相机。文档给出的灵活推理分辨率约为 50K 至 500K 像素。

可持续存在的 3D 世界,不是生成视频
视频世界模型会随着相机移动预测画面帧;HY-World 2.0 则构建持久化场景表示,因此生成结束后世界依然存在,不同视角间保持空间一致,也无需每帧重新运行生成模型。
这让结果不止能做演示视频:艺术家可以继续编辑,开发者可以加入玩法逻辑,仿真团队也能在同一个空间中反复导航与测试。
第一人称或角色模式自由探索
官方示例同时展示了第一人称导航和第三人称角色探索。基于物理的碰撞让相机和角色能真正与街道、房间、建筑和地形发生关系,而非播放预录的运镜。
HY-World 2.0 资产面向后续 3D 工作流,可导入 Blender、Unity、Unreal Engine 和 Isaac Sim。Mesh 适合传统编辑与碰撞流程,Gaussian Splatting 则能保留高保真外观并支持新视角渲染。

开源模型、代码与运行条件
腾讯已公开完整世界生成推理链、WorldMirror 2.0 重建、HY-Pano 2.0、WorldStereo 2.0、模型权重与技术文档。模型库列出的规模约为:WorldMirror 2.0 1.2B、HY-Pano 2.0 80B、轻量 HY-Pano 2-Qwen 425M、WorldStereo 2.0 17B。
官方建议使用 CUDA 12.8 与 Python 3.11 或更高版本。重建是更容易上手的路径;完整世界生成还包含大模型、导航组件、多阶段渲染与 3DGS 训练。线上产品在 2026 年 7 月升级为 HY World 2.1,公开技术报告与仓库则对应 HY-World 2.0 开源栈。
常见问题
HY-World 2.0 是腾讯混元的 多模态世界模型,可从文字或单图生成 3D 世界,也可从多视角图片或视频重建 3D 场景。
生成流程支持文字提示和单张图片;重建流程支持多张图片或视频,也可选择注入相机与深度先验。
它可以输出 Gaussian Splatting 场景、Mesh、点云、深度图、表面法线、相机参数及相关编辑、渲染和仿真数据。
视频模型生成固定画面序列;HY-World 2.0 生成持久化三维表示,可从新视角探索、编辑、实时渲染并导入 3D 引擎。
已开源。公开仓库包含技术报告、模型权重、重建代码、全景生成、世界扩展和完整世界生成推理流程,具体使用须遵守仓库许可条款。
官方建议 CUDA 12.8 和 Python 3.11+。WorldMirror 2.0 重建更容易起步;完整生成栈还组合了大模型、导航、多阶段渲染和 3DGS 训练,对资源要求明显更高。
