HY-World 2.0:永続的な 3D ワールドの生成と再構築

Tencent HY-World 2.0 がテキスト、画像、動画をナビゲーション可能なメッシュ、Gaussian Splatting シーン、点群に変換する仕組みを解説します。

HY-World 2.0 が生成・再構築したインタラクティブ 3D ワールドの公式ショーケース

短い結論

HY-World 2.0 は Tencent Hunyuan のオープンソース・マルチモーダルワールドモデルです。テキストまたは1枚の画像からナビゲーション可能な 3D ワールドを生成し、複数画像や動画からシーンを再構築します。Gaussian Splatting、メッシュ、点群として永続化され、探索、編集、3D エンジンへの取り込みが可能です。

要点

01.

2つの流れ:テキストや1枚の画像から新しいワールドを生成、または複数画像と動画から実在シーンを再構築します。

02.

実体のある 3D 出力:短い動画ではなく、永続的な Gaussian Splatting、メッシュ、点群を生成します。

03.

4段階スタック:HY-Pano 2.0 がパノラマを生成し、WorldNav が経路を計画、WorldStereo 2.0 がシーンを拡張し、WorldMirror 2.0 が 3D 表現を構築します。

04.

オープンソース公開:技術レポート、推論コード、重み、ドキュメント、ローカル WorldMirror 2.0 Gradio ビューアを提供します。

HY-World 2.0 パイプライン概要

項目入力主な処理出力
HY-Pano 2.0テキストプロンプトまたは1枚の参照画像。ワールドの外観を決める 360° パノラマを生成。解析とナビゲーション計画に使うパノラマ。
WorldNav生成パノラマと解析済みシーン構造。障害物を考慮したカメラ経路を計画。拡張領域を定義する経路とレンダービュー。
WorldStereo 2.0経路、レンダービュー、蓄積したシーン記憶。一貫したキーフレームを生成し未観測領域を補完。より広い環境を覆う整列済み複数視点列。
WorldMirror 2.0 + 3DGS生成または撮影した複数視点画像。ジオメトリとカメラを推定し Gaussian データを最適化。永続的な 3DGS、メッシュ、点群、空間マップ。

HY-World 2.0 でできること

HY-World 2.0 はワールド生成、再構築、シミュレーションを統合します。プロンプトや1枚の画像から新しい探索環境を作り、複数写真や動画から既存の場所を再構築します。

出力は 3D Gaussian Splats、メッシュ、点群、深度、法線、カメラといった空間アセットです。固定カメラの動画ではなく、新しい視点からもシーンが維持されます。

プロンプトや画像からナビゲーション可能なワールドへ

まず HY-Pano 2.0 が 360° パノラマを作成します。WorldNav がシーンを解析して障害物を考慮したカメラ経路を計画し、WorldStereo 2.0 が一貫したキーフレームを生成して未観測領域を拡張します。

WorldMirror 2.0 がジオメトリとカメラを推定し、3DGS 最適化で最終ワールドを出力します。公開 CLI は経路計画、経路レンダリング、拡張、GS データ準備、3DGS 学習に分かれます。

パノラマ生成から 3D 構成までの HY-World 2.0 公式アーキテクチャ
公式スタック:HY-Pano 2.0、WorldNav、WorldStereo 2.0、WorldMirror 2.0 と Gaussian Splatting。

写真や動画から 3D シーンを再構築

WorldMirror 2.0 は複数視点画像や動画を受け取り、1回の推論で高密度点群、深度、法線、カメラ、3DGS 属性を予測します。カメラと深度の事前情報も注入できます。

リポジトリには単一/複数 GPU 推論、Python API、CLI、3DGS・点群・深度・法線・カメラを表示する Gradio アプリがあります。柔軟な解像度は約 50K〜500K ピクセルです。

画像と動画から再構築する HY-World 2.0 公式例
WorldMirror 2.0 は複数視点の素材をジオメトリ、カメラ、レンダリング可能な 3D シーンへ変換します。

生成動画ではなく永続的な 3D ワールド

動画ワールドモデルはフレーム列を予測します。HY-World 2.0 は生成後も残り、視点間の空間整合性を保ち、フレームごとの再推論なしに描画できる永続的なシーンを構築します。

アーティストは編集し、開発者はゲームロジックを追加し、シミュレーションチームは同じ空間でナビゲーションとテストを繰り返せます。

一人称またはキャラクターで探索

公式デモは一人称移動と三人称キャラクター探索の両方を示します。物理ベースの衝突により、カメラやキャラクターが道路、部屋、建物、地形と実際に関わります。

アセットは Blender、Unity、Unreal Engine、Isaac Sim に取り込めます。メッシュは編集と衝突処理に、Gaussian Splats は高品質な新規視点レンダリングに向きます。

HY-World 2.0 公式インタラクティブ探索デモ
生成シーンは固定動画ではなくインタラクティブに探索できます。

オープンソースモデル、コード、動作条件

Tencent はワールド生成全体、WorldMirror 2.0、HY-Pano 2.0、WorldStereo 2.0、重み、文書を公開しています。規模は WorldMirror 2.0 約1.2B、HY-Pano 2.0 約80B、HY-Pano 2-Qwen 約425M、WorldStereo 2.0 約17Bです。

推奨環境は CUDA 12.8 と Python 3.11+ です。再構築が最も始めやすく、完全な生成では大規模モデル、ナビゲーション、多段レンダリング、3DGS 学習が加わります。ホスト版は2026年7月に HY World 2.1 へ更新され、公開レポートとリポジトリは 2.0 のオープンソーススタックを扱います。

よくある質問

テキストや1枚の画像から 3D ワールドを生成し、複数画像や動画からシーンを再構築する Tencent Hunyuan のマルチモーダルワールドモデルです。

生成はテキストまたは1枚の画像、再構築は複数画像または動画に対応し、カメラと深度の事前情報も利用できます。

Gaussian Splatting シーン、メッシュ、点群、深度マップ、法線、カメラパラメータと関連データです。

動画モデルは固定されたフレーム列を生成します。HY-World 2.0 は探索、編集、リアルタイム描画、エンジン連携が可能な永続的 3D 表現を生成します。

はい。公開リポジトリにはレポート、重み、再構築、パノラマ生成、ワールド拡張、完全な推論経路が含まれ、リポジトリのライセンス条件が適用されます。

CUDA 12.8 と Python 3.11+ が推奨です。WorldMirror 2.0 再構築が簡単な入口で、完全な生成スタックはより多くの計算資源を必要とします。

ワールド用の最初の 3D アセットを作成

参照画像をブラウザでテクスチャ付き 3D モデルに変換し、小物、キャラクター、シーン素材として使えます。

画像から 3D を試す