短い結論
HY-World 2.0 は Tencent Hunyuan のオープンソース・マルチモーダルワールドモデルです。テキストまたは1枚の画像からナビゲーション可能な 3D ワールドを生成し、複数画像や動画からシーンを再構築します。Gaussian Splatting、メッシュ、点群として永続化され、探索、編集、3D エンジンへの取り込みが可能です。
要点
2つの流れ:テキストや1枚の画像から新しいワールドを生成、または複数画像と動画から実在シーンを再構築します。
実体のある 3D 出力:短い動画ではなく、永続的な Gaussian Splatting、メッシュ、点群を生成します。
4段階スタック:HY-Pano 2.0 がパノラマを生成し、WorldNav が経路を計画、WorldStereo 2.0 がシーンを拡張し、WorldMirror 2.0 が 3D 表現を構築します。
オープンソース公開:技術レポート、推論コード、重み、ドキュメント、ローカル WorldMirror 2.0 Gradio ビューアを提供します。
HY-World 2.0 パイプライン概要
| 項目 | 入力 | 主な処理 | 出力 |
|---|---|---|---|
| HY-Pano 2.0 | テキストプロンプトまたは1枚の参照画像。 | ワールドの外観を決める 360° パノラマを生成。 | 解析とナビゲーション計画に使うパノラマ。 |
| WorldNav | 生成パノラマと解析済みシーン構造。 | 障害物を考慮したカメラ経路を計画。 | 拡張領域を定義する経路とレンダービュー。 |
| WorldStereo 2.0 | 経路、レンダービュー、蓄積したシーン記憶。 | 一貫したキーフレームを生成し未観測領域を補完。 | より広い環境を覆う整列済み複数視点列。 |
| WorldMirror 2.0 + 3DGS | 生成または撮影した複数視点画像。 | ジオメトリとカメラを推定し Gaussian データを最適化。 | 永続的な 3DGS、メッシュ、点群、空間マップ。 |
HY-World 2.0 でできること
HY-World 2.0 はワールド生成、再構築、シミュレーションを統合します。プロンプトや1枚の画像から新しい探索環境を作り、複数写真や動画から既存の場所を再構築します。
出力は 3D Gaussian Splats、メッシュ、点群、深度、法線、カメラといった空間アセットです。固定カメラの動画ではなく、新しい視点からもシーンが維持されます。
プロンプトや画像からナビゲーション可能なワールドへ
まず HY-Pano 2.0 が 360° パノラマを作成します。WorldNav がシーンを解析して障害物を考慮したカメラ経路を計画し、WorldStereo 2.0 が一貫したキーフレームを生成して未観測領域を拡張します。
WorldMirror 2.0 がジオメトリとカメラを推定し、3DGS 最適化で最終ワールドを出力します。公開 CLI は経路計画、経路レンダリング、拡張、GS データ準備、3DGS 学習に分かれます。

写真や動画から 3D シーンを再構築
WorldMirror 2.0 は複数視点画像や動画を受け取り、1回の推論で高密度点群、深度、法線、カメラ、3DGS 属性を予測します。カメラと深度の事前情報も注入できます。
リポジトリには単一/複数 GPU 推論、Python API、CLI、3DGS・点群・深度・法線・カメラを表示する Gradio アプリがあります。柔軟な解像度は約 50K〜500K ピク セルです。

生成動画ではなく永続的な 3D ワールド
動画ワールドモデルはフレーム列を予測します。HY-World 2.0 は生成後も残り、視点間の空間整合性を保ち、フレームごとの再推論なしに描画できる永続的なシーンを構築します。
アーティストは編集し、開発者はゲームロジックを追加し、シミュレーションチームは同じ空間でナビゲーションとテストを繰り返せます。
一人称またはキャラクターで探索
公式デモは一人称移動と三人称キャラクター探索の両方を示します。物理ベースの衝突により、カメラやキャラクターが道路、部屋、建物、地形と実際に関わります。
アセッ トは Blender、Unity、Unreal Engine、Isaac Sim に取り込めます。メッシュは編集と衝突処理に、Gaussian Splats は高品質な新規視点レンダリングに向きます。

オープンソースモデル、コード、動作条件
Tencent はワールド生成全体、WorldMirror 2.0、HY-Pano 2.0、WorldStereo 2.0、重み、文書を公開しています。規模は WorldMirror 2.0 約1.2B、HY-Pano 2.0 約80B、HY-Pano 2-Qwen 約425M、WorldStereo 2.0 約17Bです。
推奨環境は CUDA 12.8 と Python 3.11+ です。再構築が最も始めやすく、完全な生成では大規模モデル、ナビゲーション、多段レンダリング、3DGS 学習が加わります。ホスト版は2026年7月に HY World 2.1 へ更新され、公開レポートとリポジトリは 2.0 のオープンソーススタックを扱います。
よくある質問
テキストや1枚の画像から 3D ワールドを生成し、複数画像や動画からシーンを再構築する Tencent Hunyuan のマルチモーダルワールドモデルです。
生成はテキストまたは1枚の画像、再構築は複数画像または動画に対応し、カメラと深度の事前情報も利用できます。
Gaussian Splatting シーン、メッシュ、点群、深度マップ、法線、カメラパラメータと関連データです。
動画モデルは固定されたフレーム列を生成します。HY-World 2.0 は探索、編集、リアルタイム描画、エンジン連携が可能な永続的 3D 表現を生成します。
はい。公開リポジトリにはレポート、重み、再構築、パノラマ生成、ワールド拡張、完全な推論経路が含まれ、リポジトリのライセンス条件が適用されます。
CUDA 12.8 と Python 3.11+ が推奨です。WorldMirror 2.0 再構築が簡単な入口で、完全な生成スタックはより多くの計算資源を必要とします。
