Réponse courte
WorldClaw transforme un prompt libre en un vaste monde 3D explorable. Il planifie la scène complète, construit un terrain régional cohérent, génère des objets texturés détaillés là où ils sont nécessaires et utilise des agents sensibles au rendu pour améliorer la disposition, l'échelle, la pose, les matériaux et le contact au sol.
Points clés
Entrée : un prompt libre décrivant le monde, les régions, les objets, le style et les relations spatiales.
Terrain : une disposition sémantique contrôle les champs de hauteur continus, les matériaux régionaux, la végétation, les rochers et les autres assets environnementaux.
Sortie : un terrain explicite et des maillages d'objets texturés, modifiables séparément, avec leur position, leur échelle et leur orientation.
Configuration indiquée : Claude Opus 4.8, GPT-Image-2, SAM3, SAM3D, Hunyuan3D, Blender 5.1.1 et quatre GPU NVIDIA H20.
Le pipeline WorldClaw en bref
| Sujet | Entrée | Traitement principal | Sortie |
|---|---|---|---|
| 01 · Planification | Une description textuelle libre du monde cible. | Extraire l'intention, résoudre les ambiguïtés et définir les régions, le terrain, les objets, l'apparence, la densité et les relations spatiales. | Une spécification de scène structurée partagée par les agents en aval. |
| 02 · Terrain | La spécification de la scène et les contraintes régionales. | Construire une disposition sémantique, un champ de hauteur continu, des matériaux de surface, une répartition environnementale et des corrections guidées par le rendu. | Un terrain global cohérent avec une sémantique régionale explicite. |
| 03 · Peuplement | Le plan du monde et le terrain généré. | Composer les régions sélectionnées, reconstruire les maillages d'objets, retrouver leur placement et affiner la qualité, la pose, l'échelle et le contact au sol. | Des objets texturés modifiables séparément et placés sur le terrain global. |
Ce que produit WorldClaw
WorldClaw reçoit un prompt libre et produit un vaste environnement 3D avec un terrain connecté, des régions distinctes et des zones locales peuplées. Le terrain et les objets restent des éléments séparés de la scène au lieu d'être figés dans une seule image ou une trajectoire de caméra.
Chaque objet peut conserver son propre maillage texturé et sa transformation de placement. Cela permet l'exploration en vue libre, le remplacement et la réutilisation des objets, ainsi que l'export vers des workflows 3D classiques.
D'un prompt à un monde structuré
Le premier agent extrait uniquement les exigences formulées dans le prompt, comme le thème, les principales régions, les objets, le style et le placement relatif. Un second agent de planification résout les ambiguïtés et complète les attributs techniques nécessaires à la construction de la scène sans écarter l'intention initiale.
Le résultat est une spécification structurée partagée par les pipelines du terrain et des objets. Ce plan intermédiaire permet au système de préserver les relations à longue distance pendant que différents agents travaillent sur différentes parties du monde.

Construire un terrain cohérent avant d'ajouter les détails
WorldClaw convertit le plan en carte de disposition sémantique, puis construit un champ de hauteur continu à partir de l'altitude, du bruit et des opérateurs de relief propres à chaque région. Les matériaux et les assets environnementaux réutilisables suivent les mêmes masques régionaux afin que montagnes, plaines, eau, végétation et autres éléments du terrain restent reliés dans l'espace.
Une boucle de rendu et de vérification dans Blender contrôle les transitions, l'échelle des textures, la répartition des assets, l'éclairage et les artefacts visibles. L'agent de terrain ne modifie que les paramètres défaillants avant de relancer le rendu, ce qui protège la disposition régionale globale tout en améliorant la qualité locale.

Transformer les régions sélectionnées en assets 3D modifiables
WorldClaw ne peuple pas chaque mètre carré avec le niveau de détail maximal. Un planificateur régional sélectionne les zones dont la fonction et le terrain nécessitent un contenu plus riche. Il rend le sol local, crée une image de composition tenant compte du terrain, sépare les instances d'objets, les reconstruit sous forme de maillages texturés et retrouve leur échelle, leur orientation et leur placement sur le terrain.
Des agents guidés par le rendu examinent ensuite la qualité, la pose, la taille et le contact avec la surface. Les assets insuffisants peuvent être affinés avec Hunyuan3D, tandis que le terrain et les transformations d'objets sont ajustés pour réduire les éléments flottants, les pénétrations ou les appuis instables.

Ce que contient le monde final
La sortie est une scène 3D explicite et non une vidéo liée à une caméra. Le terrain reste une surface gérable et les objets régionaux demeurent des instances de maillage texturées séparées. Cette représentation permet les points de vue arbitraires, le remplacement au niveau de l'objet, la réutilisation d'assets et le transfert vers des pipelines de création 3D familiers.
Les exemples officiels couvrent des îles, des villages dans des canyons, des vallées enneigées, des champs de bataille désertiques, des villages, des mines et des environnements volcaniques. Leurs vues RGB, masques d'instances, normales et profondeur révèlent à la fois l'apparence visible et la structure sous-jacente de la scène.

Une pile de génération 3D à l'échelle d'un monde
WorldClaw combine Claude Opus 4.8 pour le raisonnement des agents, GPT-Image-2 pour la génération d'images, SAM3 pour la segmentation, SAM3D pour la reconstruction initiale des objets, Hunyuan3D pour l'affinement des assets et Blender 5.1.1 comme environnement d'exécution de la scène. Les mondes de démonstration présentés ont été générés sur un serveur équipé de quatre GPU NVIDIA H20.
Le pipeline actuel se concentre sur la construction de scènes et l'affinement visuel. La navigation, la physique, l'animation, les hiérarchies d'objets plus riches et une intégration plus poussée aux moteurs d'exécution figurent parmi les travaux futurs.
Questions fréquentes
Non. WorldClaw est un framework agentique qui coordonne la planification, la génération d'images, la segmentation, la reconstruction 3D, l'affinement Hunyuan3D et les outils Blender afin de construire une scène complète.
Il vise une scène 3D explicite avec un terrain global et des maillages d'objets texturés gérables séparément. Les vidéos et les images fixes sont des rendus de cette scène sous-jacente, et non la sortie principale.
L'image-to-3D reconstruit généralement un seul asset. WorldClaw planifie un vaste environnement, construit le terrain, choisit les régions qui nécessitent des détails, puis utilise la reconstruction et les outils Hunyuan3D dans un pipeline plus large de construction de scène.
L'article, la page du projet et le dépôt GitHub sont publics. Au 12 août 2026, le dépôt officiel ne fournit ni code d'inférence exécutable, ni poids de modèle, ni API publique de génération.
WorldClaw génère du contenu de scène 3D modifiable, pas un jeu terminé. La navigation, la physique, l'animation, la logique d'interaction et une intégration plus poussée aux moteurs de production restent des axes de développement futurs.
Les expériences rapportées ont été exécutées sur un serveur équipé de quatre GPU NVIDIA H20 et ont utilisé Blender 5.1.1 pour la construction du terrain, le placement des objets, l'affinement et le rendu.
Créez des assets pour vos propres scènes 3D
Transformez une image de référence en personnage, accessoire, produit ou élément de scène 3D détaillé.
Essayer Image to 3D