짧은 결론
HY-World 2.0은 Tencent Hunyuan의 오픈소스 멀티모달 월드 모델입니다. 텍스트나 한 장의 이미지로 탐색 가능한 3D 월드를 생성하고, 여러 이미지나 영상으로 장면을 복원합니다. 결과물인 Gaussian Splatting, 메시, 포인트 클라우드는 계속 유지되며 탐색, 편집, 3D 엔진 연동이 가능합니다.
핵심 요약
두 가지 워크플로: 텍스트나 단일 이미지로 새 월드를 만들거나, 다중 시점 이미지와 영상으로 실제 장소를 복원합니다.
실제 3D 출력: 짧은 영상이 아니라 지속 가능한 Gaussian Splatting 장면, 메시, 포인트 클라우드를 생성합니다.
4단계 스택: HY-Pano 2.0이 파노라마를 만들고, WorldNav가 경로를 계획하며, WorldStereo 2.0이 장면을 확장하고, WorldMirror 2.0이 3D 표현을 구성합니다.
오픈소스 공개: 기술 보고서, 추론 코드, 가중치, 문서, 로컬 WorldMirror 2.0 Gradio 뷰어를 제공합니다.
HY-World 2.0 파이프라인 요약
| 항목 | 입력 | 핵심 작업 | 출력 |
|---|---|---|---|
| HY-Pano 2.0 | 텍스트 프롬프트 또는 단일 참조 이미지. | 월드 외관을 정의하는 360° 파노라마 생성. | 장면 분석과 경로 계획을 위한 파노라마. |
| WorldNav | 생성된 파노라마와 분석된 장면 구조. | 장애물을 고려한 카메라 경로 계획. | 확장할 영역을 정의하는 경로와 렌더 뷰. |
| WorldStereo 2.0 | 경로, 렌더 뷰, 누적 장면 메모리. | 일관된 키프레임 생성과 미관측 영역 보완. | 더 넓은 환경을 덮는 정렬된 다중 시점 시퀀스. |
| WorldMirror 2.0 + 3DGS | 생성 또는 촬영한 다중 시점 이미지. | 지오메트리와 카메라 추정, Gaussian 데이터 준비와 최적화. | 지속 가능한 3DGS 월드, 메시, 포인트 클라우드, 공간 맵. |
HY-World 2.0이 하는 일
HY-World 2.0은 월드 생성, 복원, 시뮬레이션을 하나로 묶습니다. 프롬프트나 한 장의 이미지로 새 탐색 환경을 만들고, 여러 사진이나 영상으로 기존 장소를 복원합니다.
출력은 3D Gaussian Splats, 메시, 포인트 클라우드, 깊이, 노멀, 카메라 같은 공간 에셋입니다. 고정된 카메라 영상과 달리 새로운 시점에서도 장면이 유지됩니다.
프롬프트나 이미지에서 탐색 가능한 월드까지
HY-Pano 2.0이 먼저 360° 파노라마를 만듭니다. WorldNav는 장면을 분석하고 장애물을 고려한 카메라 경로를 계획하며, WorldStereo 2.0은 일관된 키프레임을 생성하고 보이지 않던 영역을 확장합니다.
WorldMirror 2.0이 지오메트리와 카메라를 추정한 뒤 3DGS 최적화로 최종 월드를 내보냅니다. 공개 CLI는 경로 계획, 경로 렌더링, 월드 확장, GS 데이터 준비, 3DGS 학습 단계로 구성됩니다.

사진이나 영상으로 3D 장면 복원
WorldMirror 2.0은 다중 시점 이미지나 영상을 받아 한 번의 순전파로 고밀도 포인트 클라우드, 깊이, 노멀, 카메라, 3DGS 속성을 예측합니다. 카메라와 깊이 prior도 주입할 수 있습니다.
저장소에는 단일/다중 GPU 추론, Python API, CLI, 그리고 3DGS·포인트·깊이·노멀·카메라를 보는 Gradio 앱 이 포함됩니다. 문서상 가변 해상도는 약 50K~500K 픽셀입니다.

생성 영상이 아닌 지속 가능한 3D 월드
영상 월드 모델은 프레임 시퀀스를 예측합니다. HY-World 2.0은 생성 후에도 남고, 시점 간 공간 일관성을 유지하며, 프레임마다 모델을 다시 실행하지 않아도 렌더링되는 지속적 장면을 만듭니다.
아티스트는 결과를 편집하고, 개발자는 게임 로직을 추가하며, 시뮬레이션 팀은 같은 공간에서 반복 탐색과 테스트를 할 수 있습니다.
1인칭 또는 캐릭터로 탐색
공식 데모는 1인칭 이동과 3인칭 캐릭터 탐색을 모두 보여줍니다. 물리 기반 충돌 덕분에 카메라와 캐릭터가 거리, 방, 건물, 지형과 실제로 상호작용합니다.
에셋은 Blender, Unity, Unreal Engine, Isaac Sim으로 가져갈 수 있습니다. 메시는 편집과 충돌에 적합하고 Gaussian Splats는 고품질 새 시점 렌더링을 위해 외관을 보존합니다.

오픈소스 모델, 코드, 실행 조건
Tencent는 전체 월드 생성 경로, WorldMirror 2.0, HY-Pano 2.0, WorldStereo 2.0, 가중치와 문서를 공개했습니다. 모델 규모는 WorldMirror 2.0 약 1.2B, HY-Pano 2.0 약 80B, HY-Pano 2-Qwen 약 425M, WorldStereo 2.0 약 17B입니다.
권장 환경은 CUDA 12.8과 Python 3.11+입니다. 복원이 더 쉬운 시작점이며 전체 생성은 대형 모델, 내비게이션, 다단계 렌더링, 3DGS 학습을 추가합니다. 호스팅 제품은 2026년 7월 HY World 2.1로 업데이트됐고 공개 보고서와 저장소는 2.0 오픈소스 스택을 다룹니다.
자주 묻는 질문
텍스트나 한 장의 이미지로 3D 월드를 생성하고 다중 이미지나 영상으로 장면을 복원하는 Tencent Hunyuan의 멀티모달 월드 모델입니다.
생성은 텍스트나 단일 이미지를, 복원은 여러 이미지나 영상을 받으며 선택적으로 카메라와 깊이 prior를 사용할 수 있습니다.
Gaussian Splatting 장면, 메시, 포인트 클라우드, 깊이 맵, 노멀, 카메라 파라미터와 관련 데이터를 출력합니다.
영상 모델은 고정된 프레임 시퀀스를 생성합니다. HY-World 2.0은 탐색, 편집, 실시간 렌더링, 엔진 연동이 가능한 지속적 3D 표현을 만듭니다.
네. 공개 저장소에 보고서, 가중치, 복원, 파노라마 생성, 월드 확장, 전체 추론 경로가 있으며 저장소 라이선스 조건이 적용됩니다.
CUDA 12.8과 Python 3.11+를 권장합니다. WorldMirror 2.0 복원이 가장 쉬운 시작점이며 전체 생성 스택은 훨씬 많은 자원이 필요합니다.
