简短结论
WorldClaw 可以把一段自由文本提示转成大型、可探索的 3D 世界。它会规划完整场景,构建连贯的区域地形,在需要的位置生成带纹理的精细对象,并通过感知渲染结果的智能体改进布局、比例、姿态、材质和接地效果。
重点要点
输入:一段描述世界、区域、对象、风格和空间关系的开放式文本提示。
地形:语义布局控制连续高度场、区域材质、植被、岩石和其他环境资产。
输出:显式地形,以及带位置、比例和朝向信息、可单独编辑的纹理对象网格。
公开配置:Claude Opus 4.8、GPT-Image-2、SAM3、SAM3D、Hunyuan3D、Blender 5.1.1,以及 4 块 NVIDIA H20 GPU。
WorldClaw 管线一览
| 维度 | 输入 | 核心工作 | 输出 |
|---|---|---|---|
| 01 · 规划 | 一段描述目标世界的开放式文本。 | 提取意图、消除歧义,并定义区域、地形、对象、外观、密度和空间关系。 | 供下游智能体共同使用的结构化场景规范。 |
| 02 · 地形 | 场景规范和区域约束。 | 构建语义布局、连续高度场、表面材质、环境资产散布,并根据渲染结果修正。 | 具有明确区域语义的连贯全局地形。 |
| 03 · 填充 | 世界规划和已生成的地形。 | 为选定区域构图,重建对象网格,恢复放置参数,并优化质量、姿态、比例和接地效果。 | 放置在全局地形上、可独立编辑的纹理对象。 |
WorldClaw 会生成什么
WorldClaw 接收一段开放式文本提示,生成包含连通地形、不同区域和局部场景内容的大型 3D 环境。地形和对象会保留为独立场景元素,而不是被固化成一张图片或一条固定镜头路径。
每个对象都可以保留自己的纹理网格和放置变换。因此,用户能够自由探索视角、替换对象、复用资产,并把结果导入常规 3D 工作流。
从一句提示词到结构化世界
第一个智能体只提取提示词明确提出的要求,例如主题、主要区域、对象、风格和相对位置。第二个 规划智能体负责消除歧义,并补齐搭建场景所需的技术属性,同时保留用户原本的意图。
最终会形成一份供地形管线和对象管线共同使用的结构化规范。正是这份中间规划,让不同智能体分别处理世界各部分时,仍能维持大范围空间关系。

先构建连贯地形,再增加细节
WorldClaw 先把规划转成语义布局图,再根据各区域的高度、噪声和地貌算子生成连续高度场。材质和可复用环境资产使用同一套区域蒙版分配,因此山地、平原、水体、植被和其他地形特征可以保持空间连贯。
Blender 内的渲染与审查循环会检查区域过渡、纹理比例、资产散布、光照和可见瑕疵。地形智能体只调整出问题的参数,然后再次渲染,在改善局部质量的同时保护整体区域布局。

把选定区域变成可编辑的 3D 资产
WorldClaw 不会把每平方米都填满最高细节。区域规划器会挑选需要更丰富内容的区域,渲染局部地面,创建适配地形的构图图像,分离对象实例,将它们重建为纹理网格,并恢复其比例、朝向和地形上的位置。
随后,渲染引导智能体会检查对象质量、姿态、尺寸和表面接触。质量较弱的资产可用 Hunyuan3D 优化,同时调整地形和对象变换,减少悬空、穿插或支撑不稳。

最终世界包含什么
输出是显式 3D 场景,而不是受固定镜头限制的视频。地形保持为易于管理的表面,区域对象则保留为独立纹理网格实例。这种表达方式支持任意视角、对象级替换、资产复用,也方便交接到熟悉的 3D 内容制作管线。
官方示例涵盖岛屿、峡谷聚落、雪谷、沙漠战场、村庄、矿区和火山环境。RGB、实例蒙版、法线和深度视图既能展示最终外观,也能帮助理解底层场景结构。

面向世界级场景的 3D 生成技术栈
WorldClaw 使用 Claude Opus 4.8 进行智能体推理,GPT-Image-2 生成图像,SAM3 完成分割,SAM3D 负责初始对象重建,Hunyuan3D 优化资产,并以 Blender 5.1.1 作为场景执行环境。公开展示的世界由配备 4 块 NVIDIA H20 GPU 的服务器生成。
当前管线主要聚焦场景构建和视觉优化。导航、物理、动画、更丰富的对象层级,以及更深入的运行时引擎集成仍属于未来工作。
常见问题
不是。WorldClaw 是一个智能体框架,它协调规划、图像生成、分割、3D 重建、Hunyuan3D 优化和 Blender 工具来搭建完整场景。
它的目标是生成显式 3D 场景,包含全局地形和可单独管理的纹理对象网格。视频和静态图只是底层场景的渲染结果,并非主要输出。
图片转 3D 通常重建单个资产。WorldClaw 会规划大型环境、构建地形、判断哪些区域需要更多细节,再把重建和 Hunyuan3D 工具作为大型场景搭建管线的一部分。
论文、项目页面和 GitHub 仓库均已公开。截至 2026 年 8 月 12 日,官方仓库尚未提供可运行的推理代码、模型权重或公开生成 API。
它生成的是可编辑的 3D 场景内容,不是完整游戏。导航、物理、动画、交互逻辑,以及与生产引擎的深入集成仍属于未来开发方向。
公开实验运行在配备 4 块 NVIDIA H20 GPU 的服务器上,并使用 Blender 5.1.1 完成地形构建、对象放置、优化和渲染。
