Réponse courte
HY-World 2.0 est le modèle de monde multimodal open source de Tencent Hunyuan. Il génère un monde 3D navigable depuis du texte ou une image, et reconstruit une scène depuis plusieurs images ou une vidéo. Ses sorties persistantes—Gaussian Splatting, meshes et nuages de points—peuvent être explorées, modifiées et intégrées dans des moteurs 3D.
Points clés
Deux workflows : créer un monde depuis du texte ou une image, ou reconstruire un lieu depuis des vues multiples et une vidéo.
Vraie sortie 3D : scènes Gaussian Splatting, meshes et nuages de points persistants plutôt qu'une courte vidéo.
Pile en quatre parties : HY-Pano 2.0 crée le panorama, WorldNav planifie le mouvement, WorldStereo 2.0 étend la scène et WorldMirror 2.0 construit la représentation 3D.
Version open source : rapport, code d'inférence, poids, documentation et visualiseur Gradio WorldMirror 2.0 local.
Pipeline HY-World 2.0 en un coup d'œil
| Sujet | Entrée | Travail principal | Sortie |
|---|---|---|---|
| HY-Pano 2.0 | Prompt texte ou image de référence. | Créer un panorama 360° définissant l'apparence du monde. | Scène panoramique prête pour l'analyse et la navigation. |
| WorldNav | Panorama généré et structure de scène analysée. | Planifier des trajectoires caméra évitant les obstacles. | Trajectoires et vues définissant les zones à étendre. |
| WorldStereo 2.0 | Trajectoires, vues rendues et mémoire de scène. | Créer des images clés cohérentes et compléter les zones invisibles. | Séquence multivue alignée couvrant un environnement plus vaste. |
| WorldMirror 2.0 + 3DGS | Images multivues générées ou capturées. | Estimer géométrie et caméras, préparer les données Gaussian et optimiser. | Monde 3DGS persistant, mesh, nuage de points et cartes spatiales. |
Ce que fait HY-World 2.0
HY-World 2.0 réunit génération, reconstruction et simulation de mondes. Un prompt ou une image peut créer un nouvel environnement navigable ; plusieurs photos ou une vidéo peuvent reconstruire un lieu existant.
Le système produit des actifs spatiaux—3D Gaussian Splats, meshes, nuages de points, profondeur, normales et caméras—qui restent accessibles depuis de nouveaux points de vue.
D'un prompt ou d'une image à un monde navigable
HY-Pano 2.0 crée d'abord un panorama à 360°. WorldNav analyse la scène et planifie des trajectoires évitant les obstacles ; WorldStereo 2.0 génère des images clés cohérentes et étend les zones invisibles.
WorldMirror 2.0 estime ensuite géométrie et caméras, puis l'optimisation 3DGS exporte le monde. Le CLI public sépare planification, rendu de trajectoire, expansion, préparation GS et entraînement 3DGS.

Reconstruire une scène 3D depuis des photos ou une vidéo
WorldMirror 2.0 reçoit des vues multiples ou une vidéo et prédit en une passe nuages de points denses, profondeur, normales, caméras et attributs 3DGS. Des priors de caméra et de profondeur peuvent aussi être injectés.
Le dépôt propose inférence mono ou multi-GPU, API Python, CLI et app Gradio pour afficher 3DGS, points, profondeur, normales et caméras. La résolution flexible documentée va d'environ 50K à 500K pixels.

Des mondes 3D persistants, pas une vidéo générée
Un modèle vidéo prédit des images successives. HY-World 2.0 construit une scène persistante qui reste disponible après la génération, conserve sa cohérence entre points de vue et se rend sans relancer le modèle à chaque frame.
Les artistes peuvent donc modifier le résultat, les développeurs ajouter une logique de jeu et les équipes de simulation répéter navigation et tests dans le même espace.
Explorer à la première personne ou avec un personnage
Les démos officielles montrent navigation à la première personne et exploration à la troisième personne. Les collisions physiques relient réellement personnages et caméras aux rues, pièces, bâtiments et terrains.
Les actifs s'intègrent à Blender, Unity, Unreal Engine et Isaac Sim. Les meshes conviennent à l'édition et aux collisions ; les Gaussian Splats préservent l'apparence pour le rendu depuis de nouveaux points de vue.

Modèles, code et prérequis open source
Tencent publie la chaîne complète de génération, WorldMirror 2.0, HY-Pano 2.0, WorldStereo 2.0, les poids et la documentation. Le zoo indique environ 1,2B de paramètres pour WorldMirror 2.0, 80B pour HY-Pano 2.0, 425M pour HY-Pano 2-Qwen et 17B pour WorldStereo 2.0.
L'environnement recommandé est CUDA 12.8 avec Python 3.11+. La reconstruction est le point de départ le plus simple ; la génération complète ajoute grands modèles, navigation, rendu multi-étapes et entraînement 3DGS. Le produit hébergé est passé à HY World 2.1 en juillet 2026, tandis que le dépôt décrit la pile open source 2.0.
Questions fréquentes
HY-World 2.0 est le modèle de monde multimodal de Tencent Hunyuan pour générer un monde 3D depuis du texte ou une image et reconstruire une scène depuis plusieurs images ou une vidéo.
La génération accepte texte ou image unique. La reconstruction accepte plusieurs images ou une vidéo, avec priors caméra et profondeur optionnels.
Des scènes Gaussian Splatting, meshes, nuages de points, cartes de profondeur, normales, paramètres caméra et données associées.
Un modèle vidéo génère une suite fixe d'images. HY-World 2.0 produit une représentation 3D persistante, explorable, modifiable et importable dans un moteur 3D.
Oui. Le dépôt public inclut rapport, poids, reconstruction, panorama, expansion et pipeline complet d'inférence, sous réserve de ses conditions de licence.
La documentation recommande CUDA 12.8 et Python 3.11+. WorldMirror 2.0 est le départ le plus simple ; la génération complète est beaucoup plus lourde.
Créez le premier asset 3D de votre monde
Transformez une image de référence en modèle 3D texturé dans le navigateur, puis utilisez-le comme objet, personnage ou élément de décor.
Essayer Image vers 3D