Resposta rápida
WorldClaw transforma um prompt de texto livre em um mundo 3D grande e explorável. Ele planeja a cena completa, cria terreno regional coerente, gera objetos detalhados com textura onde são necessários e usa agentes que analisam renders para melhorar layout, escala, pose, materiais e contato com o solo.
Principais pontos
Entrada: Um prompt de texto aberto descrevendo o mundo, as regiões, os objetos, o estilo e as relações espaciais.
Terreno: Um layout semântico controla campos de altura contínuos, materiais regionais, vegetação, rochas e outros assets ambientais.
Saída: Terreno explícito mais malhas de objetos com textura editáveis de forma independente, com posição, escala e orientação.
Configuração informada: Claude Opus 4.8, GPT-Image-2, SAM3, SAM3D, Hunyuan3D, Blender 5.1.1 e quatro GPUs NVIDIA H20.
O pipeline do WorldClaw em resumo
| Tópico | Entrada | Trabalho principal | Saída |
|---|---|---|---|
| 01 · Plano | Uma descrição de texto aberta do mundo desejado. | Extrair a intenção, resolver ambiguidades e definir regiões, terreno, objetos, aparência, densidade e relações espaciais. | Uma especificação estruturada da cena compartilhada pelos agentes posteriores. |
| 02 · Terreno | A especificação da cena e as restrições regionais. | Criar um layout semântico, um campo de altura contínuo, materiais de superfície, dispersão ambiental e correções orientadas por renders. | Um terreno global coerente com semântica regional explícita. |
| 03 · Povoar | O plano do mundo mais o terreno gerado. | Compor regiões selecionadas, reconstruir malhas de objetos, recuperar o posicionamento e refinar qualidade, pose, escala e contato com o solo. | Objetos com textura editáveis de forma independente e posicionados no terreno global. |
O que o WorldClaw produz
WorldClaw recebe um prompt de texto aberto e produz um grande ambiente 3D com terreno conectado, regiões distintas e áreas locais povoadas. O terreno e os objetos permanecem como elementos separados da cena, em vez de serem incorporados a uma única imagem ou trajetória de câmera.
Cada objeto pode manter sua própria malha com textura e transformação de posicionamento. Isso permite exploração por qualquer ponto de vista, substituição de objetos, reutilização e exportação para workflows 3D convencionais.
De um prompt a um mundo estruturado
O primeiro agente extrai apenas os requisitos indicados no prompt, como tema, regiões principais, objetos, estilo e posicionamento relativo. Um segundo agente de planejamento resolve ambiguidades e completa os atributos técnicos necessários para construir a cena sem perder a intenção original.
O resultado é uma especificação estruturada compartilhada pelos pipelines de terreno e objetos. Esse plano intermediário permite que o sistema preserve relações de longa distância enquanto diferentes agentes trabalham em partes distintas do mundo.

Criar terreno coerente antes de adicionar detalhes
WorldClaw transforma o plano em um mapa de layout semântico e depois cria um campo de altura contínuo a partir de elevação, ruído e operadores de relevo específicos de cada região. Materiais e assets ambientais reutilizáveis são atribuídos com as mesmas máscaras regionais, para que montanhas, planícies, água, vegetação e outros elementos do terreno permaneçam conectados no espaço.
Um ciclo de renderização e revisão dentro do Blender verifica transições, escala de texturas, dispersão de assets, iluminação e artefatos visíveis. O agente de terreno edita apenas os parâmetros com falhas e renderiza novamente, preservando o layout regional mais amplo enquanto melhora a qualidade local.

Transformar regiões selecionadas em assets 3D editáveis
WorldClaw não preenche cada metro quadrado com o máximo de detalhes. Um planejador regional seleciona áreas cuja função e terreno exigem conteúdo mais rico. Ele renderiza o solo local, cria uma imagem de composição adaptada ao terreno, separa as instâncias de objetos, reconstrói cada uma como uma malha com textura e recupera sua escala, orientação e posição no terreno.
Em seguida, agentes orientados por renders verificam qualidade, pose, tamanho e contato com a superfície. Assets fracos podem ser refinados com Hunyuan3D, enquanto o terreno e as transformações dos objetos são ajustados para reduzir elementos flutuantes, interseções ou apoios instáveis.

O que o mundo final contém
O resultado é uma cena 3D explícita, não um vídeo limitado a uma câmera. O terreno continua sendo uma superfície gerenciável, e os objetos regionais permanecem como instâncias de malhas com textura separadas. Essa representação aceita pontos de vista arbitrários, substituição por objeto, reutilização de assets e integração com pipelines conhecidos de conteúdo 3D.
Os exemplos oficiais incluem ilhas, assentamentos em cânions, vales nevados, campos de batalha no deserto, vilas, minas e ambientes vulcânicos. As vistas RGB, de máscaras de instância, normais e profundidade ajudam a revelar tanto a aparência visível quanto a estrutura interna da cena.

Um stack de geração 3D em escala de mundo
WorldClaw combina Claude Opus 4.8 para raciocínio dos agentes, GPT-Image-2 para geração de imagens, SAM3 para segmentação, SAM3D para reconstrução inicial de objetos, Hunyuan3D para refinamento de assets e Blender 5.1.1 como ambiente de execução da cena. Os mundos de demonstração informados foram gerados em um servidor com quatro GPUs NVIDIA H20.
O pipeline atual se concentra na construção e no refinamento visual da cena. Navegação, física, animação, hierarquias de objetos mais completas e integração mais profunda com engines em tempo de execução são apontadas como trabalhos futuros.
Perguntas frequentes
Não. WorldClaw é um framework de agentes que coordena planejamento, geração de imagens, segmentação, reconstrução 3D, refinamento com Hunyuan3D e ferramentas do Blender para construir uma cena completa.
Ele tem como objetivo uma cena 3D explícita com terreno global e malhas de objetos com textura gerenciáveis separadamente. Vídeos e imagens estáticas são renders dessa cena subjacente, não o resultado principal.
Image-to-3D normalmente reconstrói um único asset. WorldClaw planeja um grande ambiente, constrói o terreno, decide quais regiões precisam de detalhes e depois usa reconstrução e ferramentas do Hunyuan3D como partes de um pipeline mais amplo de construção de cenas.
O paper, a página do projeto e o repositório do GitHub são públicos. Em 12 de agosto de 2026, o repositório oficial não oferece código de inferência executável, pesos do modelo nem uma API pública de geração.
Ele gera conteúdo editável para cenas 3D, não um jogo finalizado. Navegação, física, animação, lógica de interação e integração mais profunda com engines de produção são áreas de desenvolvimento futuro.
Os experimentos informados foram executados em um servidor com quatro GPUs NVIDIA H20 e usaram Blender 5.1.1 para construção do terreno, posicionamento de objetos, refinamento e renderização.
Crie assets para suas próprias cenas 3D
Transforme uma imagem de referência em um personagem, objeto, produto ou elemento de cena 3D detalhado.
Testar Image to 3D