Respuesta rápida
HY-World 2.0 es el modelo de mundo multimodal open source de Tencent Hunyuan. Genera un mundo 3D navegable desde texto o una imagen y reconstruye escenas desde varias imágenes o vídeo. Sus resultados persistentes—Gaussian Splatting, mallas y nubes de puntos—se pueden explorar, editar e importar en motores 3D.
Puntos clave
Dos flujos: crear un mundo desde texto o una imagen, o reconstruir un lugar desde varias vistas y vídeo.
Salida 3D real: escenas Gaussian Splatting, mallas y nubes de puntos persistentes, no un vídeo corto.
Stack de cuatro partes: HY-Pano 2.0 crea el panorama, WorldNav planifica el movimiento, WorldStereo 2.0 expande la escena y WorldMirror 2.0 construye la representación 3D.
Lanzamiento open source: informe, código de inferencia, pesos, documentación y visor Gradio local de WorldMirror 2.0.
Pipeline de HY-World 2.0 de un vistazo
| Tema | Entrada | Trabajo principal | Salida |
|---|---|---|---|
| HY-Pano 2.0 | Prompt de texto o imagen de referencia. | Crear un panorama 360° que define el aspecto del mundo. | Escena panorámica lista para análisis y navegación. |
| WorldNav | Panorama generado y estructura analizada. | Planificar trayectorias de cámara evitando obstáculos. | Rutas y vistas que definen las zonas a expandir. |
| WorldStereo 2.0 | Trayectorias, vistas renderizadas y memoria de escena. | Crear fotogramas coherentes y completar zonas no vistas. | Secuencia multivista alineada de un entorno mayor. |
| WorldMirror 2.0 + 3DGS | Imágenes multivista generadas o capturadas. | Estimar geometría y cámaras, preparar datos Gaussian y optimizar. | Mundo 3DGS persistente, malla, nube de puntos y mapas espaciales. |
Qué hace HY-World 2.0
HY-World 2.0 combina generación, reconstrucción y simulación de mundos. Un prompt o una imagen crea un entorno navegable nuevo; varias fotos o un vídeo reconstruyen un lugar existente.
El sistema produce recursos espaciales—3D Gaussian Splats, mallas, nubes de puntos, profundidad, normales y cámaras—que permanecen disponibles desde nuevos puntos de vista.
De un prompt o imagen a un mundo navegable
HY-Pano 2.0 genera primero un panorama de 360°. WorldNav analiza la escena y planifica rutas de cámara que evitan obstáculos; WorldStereo 2.0 genera fotogramas clave coherentes y amplía las zonas no vistas.
WorldMirror 2.0 estima geometría y cámaras, y la optimización 3DGS exporta el mundo. El CLI público separa planificación, render de trayectorias, expansión, preparación GS y entrenamiento 3DGS.

Reconstruye una escena 3D desde fotos o vídeo
WorldMirror 2.0 recibe varias vistas o vídeo y predice en una pasada nubes de puntos densas, profundidad, normales, cámaras y atributos 3DGS. También admite priors de cámara y profundidad.
El repositorio incluye inferencia de una o varias GPU, API Python, CLI y una app Gradio para ver 3DGS, puntos, profundidad, normales y cámaras. La resolución flexible documentada va de unos 50K a 500K píxeles.

Mundos 3D persistentes, no vídeo generado
Un modelo de vídeo predice una secuencia de fotogramas. HY-World 2.0 construye una escena persistente que sigue disponible tras la generación, mantiene coherencia entre vistas y se renderiza sin repetir inferencia por fotograma.
Así, los artistas pueden editar, los desarrolladores añadir lógica de juego y los equipos de simulación repetir navegación y pruebas en el mismo espacio.
Explora en primera persona o con un personaje
Las demos oficiales muestran navegación en primera persona y exploración en tercera persona. Las colisiones físicas relacionan cámaras y personajes con calles, habitaciones, edificios y terreno.
Los recursos se integran en Blender, Unity, Unreal Engine e Isaac Sim. Las mallas sirven para edición y colisión; Gaussian Splats preserva la apariencia para renderizar nuevas vistas con fidelidad.

Modelos, código y requisitos open source
Tencent publica la ruta completa de generación, WorldMirror 2.0, HY-Pano 2.0, WorldStereo 2.0, pesos y documentación. El zoo indica unos 1.2B parámetros para WorldMirror 2.0, 80B para HY-Pano 2.0, 425M para HY-Pano 2-Qwen y 17B para WorldStereo 2.0.
Se recomienda CUDA 12.8 y Python 3.11+. La reconstrucción es el inicio más sencillo; la generación completa añade modelos grandes, navegación, render por etapas y entrenamiento 3DGS. El producto alojado pasó a HY World 2.1 en julio de 2026, mientras el repositorio documenta el stack open source 2.0.
Preguntas frecuentes
HY-World 2.0 es el modelo multimodal de Tencent Hunyuan para generar mundos 3D desde texto o una imagen y reconstruir escenas desde varias imágenes o vídeo.
La generación acepta texto o una imagen. La reconstrucción acepta varias imágenes o vídeo, con priors opcionales de cámara y profundidad.
Escenas Gaussian Splatting, mallas, nubes de puntos, mapas de profundidad, normales, parámetros de cámara y datos relacionados.
Un modelo de vídeo genera una secuencia fija. HY-World 2.0 produce una representación 3D persistente, explorable, editable e importable en motores 3D.
Sí. El repositorio incluye informe, pesos, reconstrucción, panorama, expansión y la ruta completa de inferencia, sujeta a sus términos de licencia.
La documentación recomienda CUDA 12.8 y Python 3.11+. WorldMirror 2.0 es el punto de partida más simple; la generación completa requiere muchos más recursos.
Crea el primer recurso 3D de tu mundo
Convierte una imagen de referencia en un modelo 3D con textura desde el navegador y úsalo como objeto, personaje o pieza de escena.
Probar Imagen a 3D