HY-World 2.0: genera y reconstruye mundos 3D persistentes

Descubre Tencent HY-World 2.0, el modelo multimodal que convierte texto, imágenes y vídeo en mallas, escenas Gaussian Splatting y nubes de puntos navegables.

Muestra oficial de mundos 3D interactivos generados y reconstruidos por HY-World 2.0

Respuesta rápida

HY-World 2.0 es el modelo de mundo multimodal open source de Tencent Hunyuan. Genera un mundo 3D navegable desde texto o una imagen y reconstruye escenas desde varias imágenes o vídeo. Sus resultados persistentes—Gaussian Splatting, mallas y nubes de puntos—se pueden explorar, editar e importar en motores 3D.

Puntos clave

01.

Dos flujos: crear un mundo desde texto o una imagen, o reconstruir un lugar desde varias vistas y vídeo.

02.

Salida 3D real: escenas Gaussian Splatting, mallas y nubes de puntos persistentes, no un vídeo corto.

03.

Stack de cuatro partes: HY-Pano 2.0 crea el panorama, WorldNav planifica el movimiento, WorldStereo 2.0 expande la escena y WorldMirror 2.0 construye la representación 3D.

04.

Lanzamiento open source: informe, código de inferencia, pesos, documentación y visor Gradio local de WorldMirror 2.0.

Pipeline de HY-World 2.0 de un vistazo

TemaEntradaTrabajo principalSalida
HY-Pano 2.0Prompt de texto o imagen de referencia.Crear un panorama 360° que define el aspecto del mundo.Escena panorámica lista para análisis y navegación.
WorldNavPanorama generado y estructura analizada.Planificar trayectorias de cámara evitando obstáculos.Rutas y vistas que definen las zonas a expandir.
WorldStereo 2.0Trayectorias, vistas renderizadas y memoria de escena.Crear fotogramas coherentes y completar zonas no vistas.Secuencia multivista alineada de un entorno mayor.
WorldMirror 2.0 + 3DGSImágenes multivista generadas o capturadas.Estimar geometría y cámaras, preparar datos Gaussian y optimizar.Mundo 3DGS persistente, malla, nube de puntos y mapas espaciales.

Qué hace HY-World 2.0

HY-World 2.0 combina generación, reconstrucción y simulación de mundos. Un prompt o una imagen crea un entorno navegable nuevo; varias fotos o un vídeo reconstruyen un lugar existente.

El sistema produce recursos espaciales—3D Gaussian Splats, mallas, nubes de puntos, profundidad, normales y cámaras—que permanecen disponibles desde nuevos puntos de vista.

De un prompt o imagen a un mundo navegable

HY-Pano 2.0 genera primero un panorama de 360°. WorldNav analiza la escena y planifica rutas de cámara que evitan obstáculos; WorldStereo 2.0 genera fotogramas clave coherentes y amplía las zonas no vistas.

WorldMirror 2.0 estima geometría y cámaras, y la optimización 3DGS exporta el mundo. El CLI público separa planificación, render de trayectorias, expansión, preparación GS y entrenamiento 3DGS.

Arquitectura oficial de HY-World 2.0 desde panorama hasta composición 3D
El stack oficial: HY-Pano 2.0, WorldNav, WorldStereo 2.0 y WorldMirror 2.0 con Gaussian Splatting.

Reconstruye una escena 3D desde fotos o vídeo

WorldMirror 2.0 recibe varias vistas o vídeo y predice en una pasada nubes de puntos densas, profundidad, normales, cámaras y atributos 3DGS. También admite priors de cámara y profundidad.

El repositorio incluye inferencia de una o varias GPU, API Python, CLI y una app Gradio para ver 3DGS, puntos, profundidad, normales y cámaras. La resolución flexible documentada va de unos 50K a 500K píxeles.

Ejemplos oficiales de reconstrucción HY-World 2.0 desde imágenes y vídeo
WorldMirror 2.0 convierte capturas multivista en geometría, cámaras y una escena 3D renderizable.

Mundos 3D persistentes, no vídeo generado

Un modelo de vídeo predice una secuencia de fotogramas. HY-World 2.0 construye una escena persistente que sigue disponible tras la generación, mantiene coherencia entre vistas y se renderiza sin repetir inferencia por fotograma.

Así, los artistas pueden editar, los desarrolladores añadir lógica de juego y los equipos de simulación repetir navegación y pruebas en el mismo espacio.

Explora en primera persona o con un personaje

Las demos oficiales muestran navegación en primera persona y exploración en tercera persona. Las colisiones físicas relacionan cámaras y personajes con calles, habitaciones, edificios y terreno.

Los recursos se integran en Blender, Unity, Unreal Engine e Isaac Sim. Las mallas sirven para edición y colisión; Gaussian Splats preserva la apariencia para renderizar nuevas vistas con fidelidad.

Demo oficial de exploración interactiva de HY-World 2.0
Las escenas generadas se exploran de forma interactiva en lugar de verse como vídeo fijo.

Modelos, código y requisitos open source

Tencent publica la ruta completa de generación, WorldMirror 2.0, HY-Pano 2.0, WorldStereo 2.0, pesos y documentación. El zoo indica unos 1.2B parámetros para WorldMirror 2.0, 80B para HY-Pano 2.0, 425M para HY-Pano 2-Qwen y 17B para WorldStereo 2.0.

Se recomienda CUDA 12.8 y Python 3.11+. La reconstrucción es el inicio más sencillo; la generación completa añade modelos grandes, navegación, render por etapas y entrenamiento 3DGS. El producto alojado pasó a HY World 2.1 en julio de 2026, mientras el repositorio documenta el stack open source 2.0.

Preguntas frecuentes

HY-World 2.0 es el modelo multimodal de Tencent Hunyuan para generar mundos 3D desde texto o una imagen y reconstruir escenas desde varias imágenes o vídeo.

La generación acepta texto o una imagen. La reconstrucción acepta varias imágenes o vídeo, con priors opcionales de cámara y profundidad.

Escenas Gaussian Splatting, mallas, nubes de puntos, mapas de profundidad, normales, parámetros de cámara y datos relacionados.

Un modelo de vídeo genera una secuencia fija. HY-World 2.0 produce una representación 3D persistente, explorable, editable e importable en motores 3D.

Sí. El repositorio incluye informe, pesos, reconstrucción, panorama, expansión y la ruta completa de inferencia, sujeta a sus términos de licencia.

La documentación recomienda CUDA 12.8 y Python 3.11+. WorldMirror 2.0 es el punto de partida más simple; la generación completa requiere muchos más recursos.

Crea el primer recurso 3D de tu mundo

Convierte una imagen de referencia en un modelo 3D con textura desde el navegador y úsalo como objeto, personaje o pieza de escena.

Probar Imagen a 3D