WorldClaw : transformez un prompt en monde 3D modifiable

Découvrez comment Tencent Hunyuan3D WorldClaw transforme du texte en vastes mondes 3D explorables, avec un terrain cohérent, des assets modifiables et un affinement de scène piloté par des agents.

01Prompt libre
02Plan structuré
03Terrain global
04Assets modifiables
Monde 3D estival isométrique généré par Tencent Hunyuan3D WorldClaw

Réponse courte

WorldClaw transforme un prompt libre en un vaste monde 3D explorable. Il planifie la scène complète, construit un terrain régional cohérent, génère des objets texturés détaillés là où ils sont nécessaires et utilise des agents sensibles au rendu pour améliorer la disposition, l'échelle, la pose, les matériaux et le contact au sol.

Points clés

01.

Entrée : un prompt libre décrivant le monde, les régions, les objets, le style et les relations spatiales.

02.

Terrain : une disposition sémantique contrôle les champs de hauteur continus, les matériaux régionaux, la végétation, les rochers et les autres assets environnementaux.

03.

Sortie : un terrain explicite et des maillages d'objets texturés, modifiables séparément, avec leur position, leur échelle et leur orientation.

04.

Configuration indiquée : Claude Opus 4.8, GPT-Image-2, SAM3, SAM3D, Hunyuan3D, Blender 5.1.1 et quatre GPU NVIDIA H20.

Le pipeline WorldClaw en bref

SujetEntréeTraitement principalSortie
01 · PlanificationUne description textuelle libre du monde cible.Extraire l'intention, résoudre les ambiguïtés et définir les régions, le terrain, les objets, l'apparence, la densité et les relations spatiales.Une spécification de scène structurée partagée par les agents en aval.
02 · TerrainLa spécification de la scène et les contraintes régionales.Construire une disposition sémantique, un champ de hauteur continu, des matériaux de surface, une répartition environnementale et des corrections guidées par le rendu.Un terrain global cohérent avec une sémantique régionale explicite.
03 · PeuplementLe plan du monde et le terrain généré.Composer les régions sélectionnées, reconstruire les maillages d'objets, retrouver leur placement et affiner la qualité, la pose, l'échelle et le contact au sol.Des objets texturés modifiables séparément et placés sur le terrain global.

Ce que produit WorldClaw

WorldClaw reçoit un prompt libre et produit un vaste environnement 3D avec un terrain connecté, des régions distinctes et des zones locales peuplées. Le terrain et les objets restent des éléments séparés de la scène au lieu d'être figés dans une seule image ou une trajectoire de caméra.

Chaque objet peut conserver son propre maillage texturé et sa transformation de placement. Cela permet l'exploration en vue libre, le remplacement et la réutilisation des objets, ainsi que l'export vers des workflows 3D classiques.

D'un prompt à un monde structuré

Le premier agent extrait uniquement les exigences formulées dans le prompt, comme le thème, les principales régions, les objets, le style et le placement relatif. Un second agent de planification résout les ambiguïtés et complète les attributs techniques nécessaires à la construction de la scène sans écarter l'intention initiale.

Le résultat est une spécification structurée partagée par les pipelines du terrain et des objets. Ce plan intermédiaire permet au système de préserver les relations à longue distance pendant que différents agents travaillent sur différentes parties du monde.

Pipeline WorldClaw, de la planification de l'intention à une scène 3D modifiable en passant par le terrain global et la génération d'objets régionaux
Pipeline officiel de WorldClaw : la planification définit la structure de la scène avant la génération et l'affinement du terrain et des assets régionaux.

Construire un terrain cohérent avant d'ajouter les détails

WorldClaw convertit le plan en carte de disposition sémantique, puis construit un champ de hauteur continu à partir de l'altitude, du bruit et des opérateurs de relief propres à chaque région. Les matériaux et les assets environnementaux réutilisables suivent les mêmes masques régionaux afin que montagnes, plaines, eau, végétation et autres éléments du terrain restent reliés dans l'espace.

Une boucle de rendu et de vérification dans Blender contrôle les transitions, l'échelle des textures, la répartition des assets, l'éclairage et les artefacts visibles. L'agent de terrain ne modifie que les paramètres défaillants avant de relancer le rendu, ce qui protège la disposition régionale globale tout en améliorant la qualité locale.

Étapes de génération du terrain WorldClaw avec champs de hauteur, répartition des assets, matériaux et affinement guidé par le rendu
Workflow officiel du terrain montrant la disposition sémantique, la construction par région, la répartition environnementale et l'affinement itératif.

Transformer les régions sélectionnées en assets 3D modifiables

WorldClaw ne peuple pas chaque mètre carré avec le niveau de détail maximal. Un planificateur régional sélectionne les zones dont la fonction et le terrain nécessitent un contenu plus riche. Il rend le sol local, crée une image de composition tenant compte du terrain, sépare les instances d'objets, les reconstruit sous forme de maillages texturés et retrouve leur échelle, leur orientation et leur placement sur le terrain.

Des agents guidés par le rendu examinent ensuite la qualité, la pose, la taille et le contact avec la surface. Les assets insuffisants peuvent être affinés avec Hunyuan3D, tandis que le terrain et les transformations d'objets sont ajustés pour réduire les éléments flottants, les pénétrations ou les appuis instables.

Boucles WorldClaw guidées par le rendu pour affiner la qualité, le placement, l'échelle et le contact des objets avec le terrain
Diagramme officiel d'affinement montrant les cycles de rendu, inspection, correction et vérification pour les objets et leur contact avec le terrain.

Ce que contient le monde final

La sortie est une scène 3D explicite et non une vidéo liée à une caméra. Le terrain reste une surface gérable et les objets régionaux demeurent des instances de maillage texturées séparées. Cette représentation permet les points de vue arbitraires, le remplacement au niveau de l'objet, la réutilisation d'assets et le transfert vers des pipelines de création 3D familiers.

Les exemples officiels couvrent des îles, des villages dans des canyons, des vallées enneigées, des champs de bataille désertiques, des villages, des mines et des environnements volcaniques. Leurs vues RGB, masques d'instances, normales et profondeur révèlent à la fois l'apparence visible et la structure sous-jacente de la scène.

Disposition isométrique du monde 3D Frontier Mosaic généré par WorldClaw
Frontier Mosaic, l'un des exemples officiels de WorldClaw, associe plusieurs régions de terrain et des assets de scène placés séparément.

Une pile de génération 3D à l'échelle d'un monde

WorldClaw combine Claude Opus 4.8 pour le raisonnement des agents, GPT-Image-2 pour la génération d'images, SAM3 pour la segmentation, SAM3D pour la reconstruction initiale des objets, Hunyuan3D pour l'affinement des assets et Blender 5.1.1 comme environnement d'exécution de la scène. Les mondes de démonstration présentés ont été générés sur un serveur équipé de quatre GPU NVIDIA H20.

Le pipeline actuel se concentre sur la construction de scènes et l'affinement visuel. La navigation, la physique, l'animation, les hiérarchies d'objets plus riches et une intégration plus poussée aux moteurs d'exécution figurent parmi les travaux futurs.

Questions fréquentes

Non. WorldClaw est un framework agentique qui coordonne la planification, la génération d'images, la segmentation, la reconstruction 3D, l'affinement Hunyuan3D et les outils Blender afin de construire une scène complète.

Il vise une scène 3D explicite avec un terrain global et des maillages d'objets texturés gérables séparément. Les vidéos et les images fixes sont des rendus de cette scène sous-jacente, et non la sortie principale.

L'image-to-3D reconstruit généralement un seul asset. WorldClaw planifie un vaste environnement, construit le terrain, choisit les régions qui nécessitent des détails, puis utilise la reconstruction et les outils Hunyuan3D dans un pipeline plus large de construction de scène.

L'article, la page du projet et le dépôt GitHub sont publics. Au 12 août 2026, le dépôt officiel ne fournit ni code d'inférence exécutable, ni poids de modèle, ni API publique de génération.

WorldClaw génère du contenu de scène 3D modifiable, pas un jeu terminé. La navigation, la physique, l'animation, la logique d'interaction et une intégration plus poussée aux moteurs de production restent des axes de développement futurs.

Les expériences rapportées ont été exécutées sur un serveur équipé de quatre GPU NVIDIA H20 et ont utilisé Blender 5.1.1 pour la construction du terrain, le placement des objets, l'affinement et le rendu.

Créez des assets pour vos propres scènes 3D

Transformez une image de référence en personnage, accessoire, produit ou élément de scène 3D détaillé.

Essayer Image to 3D