WorldClaw: 하나의 프롬프트로 편집 가능한 3D 월드 만들기

Tencent Hunyuan3D WorldClaw가 텍스트를 일관된 지형, 편집 가능한 에셋, 에이전트 기반 장면 보정 기능을 갖춘 대규모 탐색형 3D 월드로 바꾸는 방법을 알아보세요.

01개방형 프롬프트
02구조화된 계획
03글로벌 지형
04편집 가능한 에셋
Tencent Hunyuan3D WorldClaw가 생성한 여름 테마 3D 월드의 아이소메트릭 뷰

짧은 결론

WorldClaw는 자유 형식의 텍스트 프롬프트를 대규모 탐색형 3D 월드로 바꿉니다. 전체 장면을 계획하고, 일관된 지역 지형을 만들고, 필요한 위치에 정교한 텍스처 오브젝트를 생성합니다. 렌더링을 확인하는 에이전트가 배치, 크기, 포즈, 소재, 지면 접촉도 개선합니다.

핵심 요약

01.

입력: 월드, 지역, 오브젝트, 스타일, 공간 관계를 설명하는 하나의 개방형 텍스트 프롬프트.

02.

지형: 시맨틱 레이아웃이 연속 높이 필드, 지역별 소재, 식생, 암석, 기타 환경 에셋을 제어합니다.

03.

출력: 명시적 지형과 위치, 크기, 방향 정보를 가진 개별 편집 가능한 텍스처 오브젝트 메시.

04.

공개 구성: Claude Opus 4.8, GPT-Image-2, SAM3, SAM3D, Hunyuan3D, Blender 5.1.1, NVIDIA H20 GPU 4개.

WorldClaw 파이프라인 한눈에 보기

항목입력핵심 작업출력
01 · 계획목표 월드를 설명하는 개방형 텍스트.의도를 추출하고 모호함을 해소한 뒤 지역, 지형, 오브젝트, 외형, 밀도, 공간 관계를 정의합니다.후속 에이전트가 공유하는 구조화된 장면 명세.
02 · 지형장면 명세와 지역별 제약.시맨틱 레이아웃, 연속 높이 필드, 표면 소재, 환경 에셋 산포, 렌더링 기반 보정을 구축합니다.명확한 지역 의미를 가진 일관된 글로벌 지형.
03 · 배치월드 계획과 생성된 지형.선택 지역의 구도를 만들고, 오브젝트 메시를 재구성하고, 배치를 복원한 뒤 품질, 포즈, 크기, 지면 접촉을 보정합니다.글로벌 지형 위에 배치된 개별 편집 가능한 텍스처 오브젝트.

WorldClaw가 생성하는 것

WorldClaw는 하나의 개방형 텍스트 프롬프트로 연결된 지형, 구분된 지역, 지역별 콘텐츠가 포함된 대규모 3D 환경을 만듭니다. 지형과 오브젝트는 하나의 이미지나 고정된 카메라 경로에 합쳐지지 않고 별도의 장면 요소로 남습니다.

각 오브젝트는 자체 텍스처 메시와 배치 트랜스폼을 유지할 수 있습니다. 따라서 자유 시점 탐색, 오브젝트 교체, 재사용, 일반적인 3D 워크플로로의 내보내기가 가능합니다.

하나의 프롬프트에서 구조화된 월드까지

첫 번째 에이전트는 테마, 주요 지역, 오브젝트, 스타일, 상대적 배치처럼 프롬프트에 명시된 요구 사항만 추출합니다. 두 번째 계획 에이전트는 원래 의도를 유지하면서 모호함을 해소하고 장면 구성에 필요한 기술 속성을 보완합니다.

그 결과 지형과 오브젝트 파이프라인이 함께 사용하는 구조화된 명세가 만들어집니다. 이 중간 계획 덕분에 여러 에이전트가 월드의 각 부분을 따로 작업해도 넓은 범위의 공간 관계를 유지할 수 있습니다.

의도 계획부터 글로벌 지형과 지역 오브젝트 생성을 거쳐 편집 가능한 3D 장면으로 이어지는 WorldClaw 파이프라인
WorldClaw 공식 파이프라인: 계획으로 장면 구조를 먼저 정한 뒤 지형과 지역 에셋을 생성하고 보정합니다.

디테일을 더하기 전에 일관된 지형 구성

WorldClaw는 계획을 시맨틱 레이아웃 맵으로 바꾼 뒤 지역별 고도, 노이즈, 지형 연산자를 이용해 연속 높이 필드를 만듭니다. 소재와 재사용 가능한 환경 에셋에도 동일한 지역 마스크를 적용하므로 산, 평원, 물, 식생 등 지형 요소가 공간적으로 연결됩니다.

Blender 안의 렌더링 및 검토 루프는 지역 전환, 텍스처 크기, 에셋 산포, 조명, 눈에 띄는 결함을 점검합니다. 지형 에이전트는 문제가 있는 매개변수만 수정하고 다시 렌더링해 전체 지역 배치를 보호하면서 국소 품질을 높입니다.

높이 필드, 에셋 산포, 소재, 렌더링 기반 보정을 보여주는 WorldClaw 지형 생성 단계
공식 지형 워크플로는 시맨틱 레이아웃, 지역별 구성, 환경 에셋 산포, 반복 보정 과정을 보여줍니다.

선택한 지역을 편집 가능한 3D 에셋으로 변환

WorldClaw는 모든 공간을 최고 수준의 디테일로 채우지 않습니다. 지역 계획기가 기능과 지형에 따라 더 풍부한 콘텐츠가 필요한 곳을 고릅니다. 해당 지면을 렌더링하고, 지형을 반영한 구도 이미지를 만들고, 오브젝트 인스턴스를 분리해 텍스처 메시로 재구성한 뒤 지형 위 크기, 방향, 위치를 복원합니다.

이후 렌더링 기반 에이전트가 오브젝트 품질, 포즈, 크기, 표면 접촉을 확인합니다. 품질이 낮은 에셋은 Hunyuan3D로 보정하고, 지형과 오브젝트의 트랜스폼을 조정해 떠 있음, 관통, 불안정한 지지를 줄입니다.

오브젝트 품질, 배치, 크기, 지형 접촉을 보정하는 WorldClaw 렌더링 기반 루프
공식 보정 도식은 오브젝트와 지형 접촉에 대한 렌더링, 검사, 수정, 검증의 반복 과정을 보여줍니다.

최종 월드에 포함되는 요소

출력은 고정 카메라 영상이 아니라 명시적 3D 장면입니다. 지형은 관리 가능한 표면으로 남고, 지역 오브젝트는 각각 독립된 텍스처 메시 인스턴스로 유지됩니다. 이 표현 방식은 임의 시점, 오브젝트 단위 교체, 에셋 재사용, 익숙한 3D 콘텐츠 파이프라인으로의 전달을 지원합니다.

공식 예시는 섬, 협곡 정착지, 설원 계곡, 사막 전장, 마을, 광산, 화산 환경을 포함합니다. RGB, 인스턴스 마스크, 노멀, 깊이 뷰를 통해 겉모습뿐 아니라 내부 장면 구조도 확인할 수 있습니다.

WorldClaw가 생성한 Frontier Mosaic 3D 월드의 아이소메트릭 레이아웃
Frontier Mosaic는 WorldClaw 공식 예시 중 하나로, 여러 지형 지역과 개별 배치된 장면 에셋을 결합합니다.

월드 규모의 3D 생성 스택

WorldClaw는 에이전트 추론에 Claude Opus 4.8, 이미지 생성에 GPT-Image-2, 세그멘테이션에 SAM3, 초기 오브젝트 재구성에 SAM3D, 에셋 보정에 Hunyuan3D를 사용하며 Blender 5.1.1을 장면 실행 환경으로 결합합니다. 공개된 쇼케이스 월드는 NVIDIA H20 GPU 4개가 탑재된 서버에서 생성되었습니다.

현재 파이프라인은 장면 구성과 시각적 보정에 집중합니다. 내비게이션, 물리, 애니메이션, 더 풍부한 오브젝트 계층, 런타임 엔진과의 심층 통합은 향후 과제로 제시됩니다.

자주 묻는 질문

아니요. WorldClaw는 계획, 이미지 생성, 세그멘테이션, 3D 재구성, Hunyuan3D 보정, Blender 도구를 조율해 완전한 장면을 구성하는 에이전트 프레임워크입니다.

글로벌 지형과 개별 관리 가능한 텍스처 오브젝트 메시가 포함된 명시적 3D 장면을 생성합니다. 영상과 스틸 이미지는 그 기반 장면을 렌더링한 결과이며 주요 출력은 아닙니다.

이미지-투-3D는 보통 하나의 에셋을 재구성합니다. WorldClaw는 대규모 환경을 계획하고 지형을 만든 뒤 디테일이 필요한 지역을 결정하며, 재구성과 Hunyuan3D를 더 큰 장면 구성 파이프라인의 일부로 사용합니다.

논문, 프로젝트 페이지, GitHub 저장소는 공개되어 있습니다. 2026년 8월 12일 현재 공식 저장소에는 실행 가능한 추론 코드, 모델 가중치, 공개 생성 API가 제공되지 않습니다.

편집 가능한 3D 장면 콘텐츠를 생성하지만 완성된 게임은 아닙니다. 내비게이션, 물리, 애니메이션, 상호작용 로직, 프로덕션 엔진과의 심층 통합은 향후 개발 영역입니다.

공개된 실험은 NVIDIA H20 GPU 4개가 탑재된 서버에서 실행되었으며, 지형 구성, 오브젝트 배치, 보정, 렌더링에 Blender 5.1.1을 사용했습니다.

나만의 3D 장면을 위한 에셋 만들기

참조 이미지를 정교한 3D 캐릭터, 프롭, 제품 또는 장면 요소로 바꿔보세요.

이미지-투-3D 사용하기