Respuesta rápida
WorldClaw convierte un prompt de texto libre en un mundo 3D grande y explorable. Planifica la escena completa, crea terreno regional coherente, genera objetos detallados con textura donde hacen falta y usa agentes que revisan los renders para mejorar la distribución, la escala, la pose, los materiales y el contacto con el suelo.
Puntos clave
Entrada: Un prompt de texto abierto que describe el mundo, las regiones, los objetos, el estilo y las relaciones espaciales.
Terreno: Un diseño semántico controla campos de altura continuos, materiales regionales, vegetación, rocas y otros activos ambientales.
Salida: Terreno explícito más mallas de objetos con textura editables de forma independiente, con posición, escala y orientación.
Configuración publicada: Claude Opus 4.8, GPT-Image-2, SAM3, SAM3D, Hunyuan3D, Blender 5.1.1 y cuatro GPU NVIDIA H20.
El pipeline de WorldClaw de un vistazo
| Tema | Entrada | Trabajo principal | Salida |
|---|---|---|---|
| 01 · Plan | Una descripción de texto abierta del mundo deseado. | Extraer la intención, resolver ambigüedades y definir regiones, terreno, objetos, apariencia, densidad y relaciones espaciales. | Una especificación estructurada de la escena compartida por los agentes posteriores. |
| 02 · Terreno | La especificación de la escena y las restricciones regionales. | Crear un diseño semántico, un campo de altura continuo, materiales de superficie, dispersión ambiental y correcciones guiadas por renders. | Un terreno global coherente con semántica regional explícita. |
| 03 · Poblar | El plan del mundo más el terreno generado. | Componer regiones seleccionadas, reconstruir mallas de objetos, recuperar su posición y refinar calidad, pose, escala y contacto con el suelo. | Objetos con textura editables de forma independiente y colocados sobre el terreno global. |
Qué produce WorldClaw
WorldClaw recibe un prompt de texto abierto y produce un gran entorno 3D con terreno conectado, regiones diferenciadas y zonas locales pobladas. El terreno y los objetos se mantienen como elementos separados de la escena, en lugar de quedar fusionados en una sola imagen o trayectoria de cámara.
Cada objeto puede conservar su propia malla con textura y su transformación de posición. Esto permite explorar desde cualquier punto de vista, sustituir objetos, reutilizarlos y exportarlos a flujos de trabajo 3D convencionales.
De un prompt a un mundo estructurado
El primer agente extrae solo los requisitos indicados en el prompt, como el tema, las regiones principales, los objetos, el estilo y la posición relativa. Un segundo agente de planificación resuelve ambigüedades y completa los atributos técnicos necesarios para construir la escena sin perder la intención original.
El resultado es una especificación estructurada que comparten los pipelines de terreno y objetos. Este plan intermedio permite al sistema conservar relaciones a larga distancia mientras distintos agentes trabajan en diferentes partes del mundo.

Crear terreno coherente antes de añadir detalle
WorldClaw convierte el plan en un mapa de diseño semántico y después crea un campo de altura continuo a partir de la elevación, el ruido y los operadores de relieve específicos de cada región. Los materiales y los activos ambientales reutilizables se asignan con las mismas máscaras regionales, de modo que montañas, llanuras, agua, vegetación y otros elementos del terreno permanezcan conectados espacialmente.
Un ciclo de render y revisión dentro de Blender comprueba transiciones, escala de texturas, dispersión de activos, iluminación y artefactos visibles. El agente de terreno edita únicamente los parámetros que fallan y vuelve a renderizar, preservando el diseño regional general mientras mejora la calidad local.

Convertir regiones seleccionadas en activos 3D editables
WorldClaw no llena cada metro cuadrado con el máximo detalle. Un planificador regional selecciona las zonas cuya función y terreno requieren contenido más rico. Renderiza el suelo local, crea una imagen de composición adaptada al terreno, separa las instancias de objetos, las reconstruye como mallas con textura y recupera su escala, orientación y posición sobre el terreno.
Después, agentes guiados por renders revisan la calidad, pose, tamaño y contacto con la superficie de cada objeto. Los activos deficientes pueden refinarse con Hunyuan3D, mientras el terreno y las transformaciones de los objetos se ajustan para reducir elementos flotantes, intersecciones o apoyos inestables.

Qué contiene el mundo final
El resultado es una escena 3D explícita, no un video limitado a una cámara. El terreno permanece como una superficie manejable y los objetos regionales siguen siendo instancias de malla con textura independientes. Esta representación admite puntos de vista arbitrarios, sustitución por objeto, reutilización de activos y entrega a pipelines habituales de contenido 3D.
Los ejemplos oficiales incluyen islas, asentamientos en cañones, valles nevados, campos de batalla desérticos, aldeas, minas y entornos volcánicos. Sus vistas RGB, de máscaras de instancia, normales y profundidad muestran tanto la apariencia visible como la estructura interna de la escena.

Un stack de generación 3D a escala de mundo
WorldClaw combina Claude Opus 4.8 para el razonamiento de agentes, GPT-Image-2 para generar imágenes, SAM3 para segmentación, SAM3D para la reconstrucción inicial de objetos, Hunyuan3D para refinar activos y Blender 5.1.1 como entorno de ejecución de la escena. Los mundos de demostración publicados se generaron en un servidor con cuatro GPU NVIDIA H20.
El pipeline actual se centra en construir y refinar visualmente la escena. La navegación, física, animación, jerarquías de objetos más completas y una integración más profunda con motores en tiempo de ejecución figuran como trabajo futuro.
Preguntas frecuentes
No. WorldClaw es un framework de agentes que coordina planificación, generación de imágenes, segmentación, reconstrucción 3D, refinamiento con Hunyuan3D y herramientas de Blender para construir una escena completa.
Su objetivo es una escena 3D explícita con terreno global y mallas de objetos con textura que pueden gestionarse por separado. Los videos y las imágenes fijas son renders de esa escena subyacente, no el resultado principal.
Image-to-3D suele reconstruir un solo activo. WorldClaw planifica un entorno grande, construye el terreno, decide qué regiones necesitan detalle y después utiliza reconstrucción y herramientas de Hunyuan3D como parte de un pipeline más amplio de creación de escenas.
El paper, la página del proyecto y el repositorio de GitHub son públicos. A fecha del 12 de agosto de 2026, el repositorio oficial no ofrece código de inferencia ejecutable, pesos del modelo ni una API pública de generación.
Genera contenido editable para escenas 3D, no un juego terminado. La navegación, la física, la animación, la lógica de interacción y una integración más profunda con motores de producción son áreas de desarrollo futuro.
Los experimentos publicados se ejecutaron en un servidor con cuatro GPU NVIDIA H20 y utilizaron Blender 5.1.1 para construir el terreno, colocar objetos, refinar y renderizar.
Crea activos para tus propias escenas 3D
Convierte una imagen de referencia en un personaje, objeto, producto o elemento de escena 3D detallado.
Probar Image to 3D