HY-World 2.0: gere e reconstrua mundos 3D persistentes

Conheça o Tencent HY-World 2.0, modelo multimodal que transforma texto, imagens e vídeo em malhas, cenas Gaussian Splatting e nuvens de pontos navegáveis.

Mostra oficial de mundos 3D interativos gerados e reconstruídos pelo HY-World 2.0

Resposta rápida

HY-World 2.0 é o modelo de mundo multimodal open source da Tencent Hunyuan. Ele gera um mundo 3D navegável a partir de texto ou uma imagem e reconstrói cenas usando várias imagens ou vídeo. As saídas persistentes—Gaussian Splatting, malhas e nuvens de pontos—podem ser exploradas, editadas e importadas em engines 3D.

Principais pontos

01.

Dois fluxos: criar um mundo de texto ou imagem única, ou reconstruir um lugar de múltiplas vistas e vídeo.

02.

Saída 3D real: cenas Gaussian Splatting, malhas e nuvens de pontos persistentes em vez de um vídeo curto.

03.

Stack em quatro partes: HY-Pano 2.0 cria o panorama, WorldNav planeja o movimento, WorldStereo 2.0 expande a cena e WorldMirror 2.0 cria a representação 3D.

04.

Release open source: relatório, código de inferência, pesos, documentação e visualizador Gradio local do WorldMirror 2.0.

Pipeline do HY-World 2.0 em resumo

TópicoEntradaTrabalho principalSaída
HY-Pano 2.0Prompt de texto ou imagem de referência.Criar panorama 360° que define o visual do mundo.Cena panorâmica pronta para análise e navegação.
WorldNavPanorama gerado e estrutura analisada.Planejar trajetórias de câmera evitando obstáculos.Caminhos e vistas que definem áreas a expandir.
WorldStereo 2.0Trajetórias, vistas renderizadas e memória da cena.Gerar keyframes consistentes e completar áreas não vistas.Sequência multivista alinhada cobrindo ambiente maior.
WorldMirror 2.0 + 3DGSImagens multivista geradas ou capturadas.Estimar geometria e câmeras, preparar dados Gaussian e otimizar.Mundo 3DGS persistente, malha, nuvem de pontos e mapas espaciais.

O que o HY-World 2.0 faz

HY-World 2.0 combina geração, reconstrução e simulação de mundos. Um prompt ou imagem cria um novo ambiente navegável; fotos ou vídeo reconstroem um lugar existente.

O sistema produz assets espaciais—3D Gaussian Splats, malhas, nuvens de pontos, profundidade, normais e câmeras—que continuam disponíveis de novos pontos de vista.

De um prompt ou imagem a um mundo navegável

HY-Pano 2.0 gera primeiro um panorama de 360°. WorldNav analisa a cena e planeja caminhos de câmera que evitam obstáculos; WorldStereo 2.0 gera keyframes consistentes e expande áreas não vistas.

WorldMirror 2.0 estima geometria e câmeras, e a otimização 3DGS exporta o mundo. O CLI público separa planejamento, renderização de trajetória, expansão, preparação GS e treino 3DGS.

Arquitetura oficial do HY-World 2.0 do panorama à composição 3D
O stack oficial: HY-Pano 2.0, WorldNav, WorldStereo 2.0 e WorldMirror 2.0 com Gaussian Splatting.

Reconstrua uma cena 3D com fotos ou vídeo

WorldMirror 2.0 recebe múltiplas vistas ou vídeo e prevê em uma passagem nuvens densas, profundidade, normais, câmeras e atributos 3DGS. Priors de câmera e profundidade também podem ser injetados.

O repositório inclui inferência single e multi-GPU, API Python, CLI e app Gradio para visualizar 3DGS, pontos, profundidade, normais e câmeras. A resolução flexível documentada vai de cerca de 50K a 500K pixels.

Exemplos oficiais de reconstrução HY-World 2.0 com imagens e vídeo
WorldMirror 2.0 transforma capturas multivista em geometria, câmeras e cena 3D renderizável.

Mundos 3D persistentes, não vídeo gerado

Um modelo de vídeo prevê uma sequência de frames. HY-World 2.0 cria uma cena persistente que permanece após a geração, mantém coerência entre vistas e renderiza sem repetir inferência a cada frame.

Assim, artistas podem editar, desenvolvedores adicionar lógica de jogo e equipes de simulação repetir navegação e testes no mesmo espaço.

Explore em primeira pessoa ou com personagem

As demos oficiais mostram navegação em primeira pessoa e exploração em terceira pessoa. Colisões físicas relacionam câmeras e personagens com ruas, salas, edifícios e terreno.

Os assets integram Blender, Unity, Unreal Engine e Isaac Sim. Malhas atendem edição e colisão; Gaussian Splats preservam a aparência para renderização fiel de novas vistas.

Demo oficial de exploração interativa do HY-World 2.0
As cenas geradas podem ser exploradas interativamente em vez de assistidas como vídeo fixo.

Modelos, código e requisitos open source

A Tencent publica a geração completa, WorldMirror 2.0, HY-Pano 2.0, WorldStereo 2.0, pesos e documentação. O zoo lista cerca de 1.2B parâmetros no WorldMirror 2.0, 80B no HY-Pano 2.0, 425M no HY-Pano 2-Qwen e 17B no WorldStereo 2.0.

Recomendam-se CUDA 12.8 e Python 3.11+. Reconstrução é o início mais simples; geração completa adiciona modelos grandes, navegação, render em etapas e treino 3DGS. O produto hospedado recebeu HY World 2.1 em julho de 2026, enquanto o repositório documenta o stack open source 2.0.

Perguntas frequentes

HY-World 2.0 é o modelo multimodal da Tencent Hunyuan para gerar mundos 3D de texto ou uma imagem e reconstruir cenas de várias imagens ou vídeo.

Geração aceita texto ou uma imagem. Reconstrução aceita várias imagens ou vídeo, com priors opcionais de câmera e profundidade.

Cenas Gaussian Splatting, malhas, nuvens de pontos, mapas de profundidade, normais, parâmetros de câmera e dados relacionados.

Um modelo de vídeo gera sequência fixa. HY-World 2.0 produz representação 3D persistente, explorável, editável e importável em engines 3D.

Sim. O repositório inclui relatório, pesos, reconstrução, panorama, expansão e o caminho completo de inferência, sujeito aos termos da licença.

A documentação recomenda CUDA 12.8 e Python 3.11+. WorldMirror 2.0 é o início mais simples; a geração completa exige bem mais recursos.

Crie o primeiro asset 3D do seu mundo

Transforme uma imagem de referência em modelo 3D texturizado no navegador para usar como objeto, personagem ou parte da cena.

Testar Imagem para 3D