HY-World 2.0 : générer et reconstruire des mondes 3D persistants

Découvrez Tencent HY-World 2.0, le modèle multimodal qui transforme texte, images et vidéo en meshes, scènes Gaussian Splatting et nuages de points navigables.

Présentation officielle des mondes 3D interactifs générés et reconstruits par HY-World 2.0

Réponse courte

HY-World 2.0 est le modèle de monde multimodal open source de Tencent Hunyuan. Il génère un monde 3D navigable depuis du texte ou une image, et reconstruit une scène depuis plusieurs images ou une vidéo. Ses sorties persistantes—Gaussian Splatting, meshes et nuages de points—peuvent être explorées, modifiées et intégrées dans des moteurs 3D.

Points clés

01.

Deux workflows : créer un monde depuis du texte ou une image, ou reconstruire un lieu depuis des vues multiples et une vidéo.

02.

Vraie sortie 3D : scènes Gaussian Splatting, meshes et nuages de points persistants plutôt qu'une courte vidéo.

03.

Pile en quatre parties : HY-Pano 2.0 crée le panorama, WorldNav planifie le mouvement, WorldStereo 2.0 étend la scène et WorldMirror 2.0 construit la représentation 3D.

04.

Version open source : rapport, code d'inférence, poids, documentation et visualiseur Gradio WorldMirror 2.0 local.

Pipeline HY-World 2.0 en un coup d'œil

SujetEntréeTravail principalSortie
HY-Pano 2.0Prompt texte ou image de référence.Créer un panorama 360° définissant l'apparence du monde.Scène panoramique prête pour l'analyse et la navigation.
WorldNavPanorama généré et structure de scène analysée.Planifier des trajectoires caméra évitant les obstacles.Trajectoires et vues définissant les zones à étendre.
WorldStereo 2.0Trajectoires, vues rendues et mémoire de scène.Créer des images clés cohérentes et compléter les zones invisibles.Séquence multivue alignée couvrant un environnement plus vaste.
WorldMirror 2.0 + 3DGSImages multivues générées ou capturées.Estimer géométrie et caméras, préparer les données Gaussian et optimiser.Monde 3DGS persistant, mesh, nuage de points et cartes spatiales.

Ce que fait HY-World 2.0

HY-World 2.0 réunit génération, reconstruction et simulation de mondes. Un prompt ou une image peut créer un nouvel environnement navigable ; plusieurs photos ou une vidéo peuvent reconstruire un lieu existant.

Le système produit des actifs spatiaux—3D Gaussian Splats, meshes, nuages de points, profondeur, normales et caméras—qui restent accessibles depuis de nouveaux points de vue.

D'un prompt ou d'une image à un monde navigable

HY-Pano 2.0 crée d'abord un panorama à 360°. WorldNav analyse la scène et planifie des trajectoires évitant les obstacles ; WorldStereo 2.0 génère des images clés cohérentes et étend les zones invisibles.

WorldMirror 2.0 estime ensuite géométrie et caméras, puis l'optimisation 3DGS exporte le monde. Le CLI public sépare planification, rendu de trajectoire, expansion, préparation GS et entraînement 3DGS.

Architecture officielle HY-World 2.0 de la génération panoramique à la composition 3D
La pile officielle : HY-Pano 2.0, WorldNav, WorldStereo 2.0 et WorldMirror 2.0 avec Gaussian Splatting.

Reconstruire une scène 3D depuis des photos ou une vidéo

WorldMirror 2.0 reçoit des vues multiples ou une vidéo et prédit en une passe nuages de points denses, profondeur, normales, caméras et attributs 3DGS. Des priors de caméra et de profondeur peuvent aussi être injectés.

Le dépôt propose inférence mono ou multi-GPU, API Python, CLI et app Gradio pour afficher 3DGS, points, profondeur, normales et caméras. La résolution flexible documentée va d'environ 50K à 500K pixels.

Exemples officiels de reconstruction HY-World 2.0 depuis images et vidéo
WorldMirror 2.0 convertit des captures multivues en géométrie, caméras et scène 3D rendable.

Des mondes 3D persistants, pas une vidéo générée

Un modèle vidéo prédit des images successives. HY-World 2.0 construit une scène persistante qui reste disponible après la génération, conserve sa cohérence entre points de vue et se rend sans relancer le modèle à chaque frame.

Les artistes peuvent donc modifier le résultat, les développeurs ajouter une logique de jeu et les équipes de simulation répéter navigation et tests dans le même espace.

Explorer à la première personne ou avec un personnage

Les démos officielles montrent navigation à la première personne et exploration à la troisième personne. Les collisions physiques relient réellement personnages et caméras aux rues, pièces, bâtiments et terrains.

Les actifs s'intègrent à Blender, Unity, Unreal Engine et Isaac Sim. Les meshes conviennent à l'édition et aux collisions ; les Gaussian Splats préservent l'apparence pour le rendu depuis de nouveaux points de vue.

Démo officielle d'exploration interactive HY-World 2.0
Les scènes générées s'explorent de façon interactive au lieu d'être de simples vidéos fixes.

Modèles, code et prérequis open source

Tencent publie la chaîne complète de génération, WorldMirror 2.0, HY-Pano 2.0, WorldStereo 2.0, les poids et la documentation. Le zoo indique environ 1,2B de paramètres pour WorldMirror 2.0, 80B pour HY-Pano 2.0, 425M pour HY-Pano 2-Qwen et 17B pour WorldStereo 2.0.

L'environnement recommandé est CUDA 12.8 avec Python 3.11+. La reconstruction est le point de départ le plus simple ; la génération complète ajoute grands modèles, navigation, rendu multi-étapes et entraînement 3DGS. Le produit hébergé est passé à HY World 2.1 en juillet 2026, tandis que le dépôt décrit la pile open source 2.0.

Questions fréquentes

HY-World 2.0 est le modèle de monde multimodal de Tencent Hunyuan pour générer un monde 3D depuis du texte ou une image et reconstruire une scène depuis plusieurs images ou une vidéo.

La génération accepte texte ou image unique. La reconstruction accepte plusieurs images ou une vidéo, avec priors caméra et profondeur optionnels.

Des scènes Gaussian Splatting, meshes, nuages de points, cartes de profondeur, normales, paramètres caméra et données associées.

Un modèle vidéo génère une suite fixe d'images. HY-World 2.0 produit une représentation 3D persistante, explorable, modifiable et importable dans un moteur 3D.

Oui. Le dépôt public inclut rapport, poids, reconstruction, panorama, expansion et pipeline complet d'inférence, sous réserve de ses conditions de licence.

La documentation recommande CUDA 12.8 et Python 3.11+. WorldMirror 2.0 est le départ le plus simple ; la génération complète est beaucoup plus lourde.

Créez le premier asset 3D de votre monde

Transformez une image de référence en modèle 3D texturé dans le navigateur, puis utilisez-le comme objet, personnage ou élément de décor.

Essayer Image vers 3D