
一句话生成一个可以行走、探索和编辑的 3D 开放世界,这件事长期卡在一个核心矛盾上:全局地形要连续,局部内容要丰富,最终产物还得是可拆解的独立 3D 资产,方便游戏引擎和动画工具直接接手。腾讯混元 3D 团队发布的 WorldClaw(arXiv: 2608.05248)用一套从粗到细的 Agent 框架回应了这个挑战——它不试图一步到位生成整个世界,而是先把全局地形和空间语义定下来,再在需要细节的区域逐个填充实例级内容。
核心设计:全局先于局部
WorldClaw 的架构围绕一个中心原则展开:一个全局连贯的世界不需要在每个位置同时生成。场景语义、空间组织和地形基础可以先全局确立,而区分不同区域的物体和局部关系可以按需渐进实现。
整个流程用三个公式概括:
P = F_plan(q) # 意图分析 + 规划
T = F_terrain(P) # 全局地形生成
O = F_region(P, T) # 区域物体生成与放置
S = Compose(T, O) # 最终世界合成其中 q 是用户输入的开放式文本提示,P 是结构化场景规格,T 是全局地形表示,O 是生成的区域物体实例集合。三个阶段由专门的 Agent 顺序执行,通过共享的结构化中间表示通信,使局部生成和细化保持全局场景组织不被破坏。
这套设计明确区分了 WorldClaw 与其他 3D 世界生成方法的不同。论文将现有方案分为四类:
| 方法类别 | 代表项目 | 主要局限 |
|---|---|---|
| 程序化生成 (PCG) | Infinigen | 受硬编码规则表达力限制 |
| 图像/视频提升 | Marble (World Labs) | 缺乏全局一致性,几何保真度低 |
| 原生 3D 扩散 | BlockFusion, XCube | 受大规模 3D 场景数据集稀缺限制 |
| 多模态 LLM Agent | Holodeck, SceneWeaver | 缺乏精确 3D 空间控制能力 |
WorldClaw 选择以 Agent 编排为核心,但它通过分层生成和显式中间表示,解决了此前 Agent 方案的空间精度问题。
三阶段架构
第一阶段:意图分析与规划
用户通常用一句话描述目标场景,但构建完整的 3D 户外场景需要地形结构、区域组织、物体构成、材质风格、环境氛围和空间关系等大量细节。直接把原始提示传给下游生成模块会引入两个问题:用户通常只指定少数关键概念而省略空间、几何和外观属性;类别引用和定性空间关系可能在不同生成阶段被不一致地解释。
WorldClaw 用两个 Agent 解决这个问题。意图分析 Agent 负责提取和规范化用户提示中明确表达的约束——场景类型、主题、视觉风格、关键区域和物体、空间关系、用户偏好。这个阶段只总结提示中已有的信息,不引入新内容或填充未指定的属性。场景规划 Agent 则在保留用户需求的前提下解析模糊描述,并按预定义的场景规格模式补全下游模块所需信息。
最终产出的结构化场景规格 P = (R, C_terrain, C_object) 包含三个部分:R 描述主要场景区域及其属性和空间关系;C_terrain 描述每个区域所需的地形类型、地貌特征、表面外观和地形关联资产;C_object 指定所需物体类别、外观属性、大致密度和区域级空间关系。
第二阶段:全局地形生成
这是 WorldClaw 与大多数场景生成管线的关键差异点。许多现有管线将地面简化为平面或弱变化的支撑体,在上面放置物体来组织内容。这种平面假设无法充分表达山脉、峡谷、沙丘和阶地等几何表达力强的地貌。
地形生成模块进一步分解为三步:
地形规划将高层语义约束转化为可执行的地形规格,包含区域布局参数、地形资产参数、材质参数和数值参数(世界尺度、区域基础高度、噪声频率与振幅、地貌算子及权重、边界混合宽度)。当场景规格中包含需要外部知识的概念时,Agent 调用搜索工具检索参考;当文本约束不足以表达复杂空间关系或视觉风格时,额外生成场景概念图作为视觉条件。
地形资产生成产出四类中间资产:语义布局图 I_layout 用不同颜色编码预定义地形类别的 2D 空间分区;3D 资产原型集提供岩石、植被簇、地貌附属物等可复用原型;表面材质集包含生成式纹理(反照率、法线、粗糙度贴图)和程序化 Blender 节点材质。布局图和代表性资产图像由 GPT-Image-2 生成,3D 资产由 Hunyuan3D 的图生 3D 能力转换。
地形生成与细化构建最终的地形表示。全局高度场公式是地形构建的数学核心:
H(x) = Σ_r m_r̃(x) [ h_r + Σ_k w_{r,k} N_{r,k}(x) + Σ_j α_{r,j} G_{r,j}(x) ]其中 x 是地形域中的 2D 位置,m_r̃ 是归一化的软区域权重,h_r 是区域 r 的基础高度,N_{r,k} 是特定空间频率的噪声分量,G_{r,j} 是峰、沙丘、阶地、侵蚀等地貌算子。区域特定的组合使不同地貌形成具有不规则边界的连续复合高度场,而显式的尺度参数使同一构建逻辑能适应不同的空间范围。同一组区域权重随后用于在相应表面上分配和混合材质。
地形细化阶段基于 BlenderMCP 实现,Agent 从预定义视点重新渲染场景,检查几何、材质、散布结果和渲染配置,执行局部修正。可编辑变量包括区域特定地形参数、边界混合、材质纹理尺度、资产密度和变换,必要时还包括环境光照和渲染设置。循环持续到没有检测到重大问题或达到预定义迭代预算。
第三阶段:区域物体生成与放置
全局地形确定后,WorldClaw 选择性地填充需要实例级内容的区域。对于每个选定的区域 r,产出物体集:
O_r = { (M_i, U_i, T_place^i) }_{i=1}^{n_r}每个物体保留独立的网格几何 M_i、外观属性 U_i 和放置变换 T_place^i。
这个阶段拆解为三个顺序执行的技能:
区域合成先渲染现有地形并记录相机参数,产出地形图像。随后用图像编辑模型基于地形渲染、区域规格和可选概念图生成区域合成图。这张图不被当作最终 3D 几何,而是作为显式 2D 布局先验,约束后续重建和放置阶段的物体外观和空间组织。
物体生成用文本引导的 SAM3 从区域合成图中提取单个 2D 物体实例。除了全图推理,还采用重叠滑动窗口推理提高不同尺度物体的召回率,局部预测映射回区域合成图坐标系后按语义标签和空间重叠去重合并。对每个分割出的实例,构造物体中心图像和掩码,记录从区域坐标到物体中心坐标的仿射变换 A_i。SAM3D 随后预测物体网格、外观属性和局部到相机变换。由于单视图重建可能引入尺度偏差,系统执行图像空间尺度校准:通过迭代调整缩放因子,使重建网格的投影包围盒面积比与参考图像一致。
物体放置用物体重建相机和区域地形相机的一对对应射线恢复 3D 放置。先从物体中心像素投射射线与相机空间网格求交,得到物体参考点和深度值;再通过逆映射将焦点中心映射回区域合成图,从地形相机通过映射像素投射第二条射线,与地形网格的最近正交点定义目标地形锚点。等效焦距使高分物体重建不牺牲后续放置精度。初始 3D 缩放公式为:
s_i = (Z_t / Z_o) × (f_i^o / f̂_i)其中 Z_t 和 Z_o 分别是地形锚点和物体参考点的深度,f_i^o 是物体重建相机焦距,f̂_i 从等效内参直接获取。
场景细化:渲染引导的闭环修正
前三步产出的独立物体网格和初始地形对齐放置仍然可能存在问题:物体尺度或朝向不一致、局部几何或外观质量不足、物体与地形接触缺陷(悬浮、过度穿透、不稳定支撑)。WorldClaw 引入通过 MCP 连接 3D 引擎(Blender)的场景细化 Agent。
物体细化对每个待处理物体评估姿态、网格质量和尺度。对几何或外观质量不足的 SAM3D 重建,将 Hunyuan3D 同时条件化于尺度校准后的粗网格和物体中心图像。粗网格提供结构约束,图像提供形状和外观线索,使 Hunyuan3D 能在限制物体身份意外变化的前提下改善局部表面几何并生成更高质量纹理或 PBR 材质。细化的资产继承现有放置变换,替换粗重建时无需重复放置计算。
地形细化评估地形表面质量以及物体与地形的碰撞和接触,检测悬浮、过度穿透和不稳定支撑。发现缺陷时,Agent 在局部支撑区域内执行物体-地形协同形变:根据物体类别和接触状态,物体可被垂直重定位或部分嵌入,而支撑地形被局部位移、压平或平滑以适应物体足迹。所有修改限制在支撑区域内,以保持全局地貌和邻近地形结构。
两个细化循环在每次编辑后重新渲染场景,确保在图像而非场景图上捕获失败案例。
与现有方法的对比
论文与 SynCity、Marble、MajutsuCity、WorldGen 和 GPT-5.6 Sol 做了定性比较。
地形与区域组织方面,SynCity 通过块级 3D 潜空间支持场景级合成,但生成的区域长程组织较弱,地形类型间过渡不清晰。Marble 在单个视图中实现高视觉丰富度,但展示的地形缺乏显式区域级组织。MajutsuCity 产出结构化建筑和资产布局,但面向城市的设计强调实例排列而非大规模地貌构建。WorldGen 产出连贯可通行的村庄环境,但地形相对平坦同质。GPT-5.6 Sol 证明配备结构化规划和领域特定技能的编码 Agent 能构建完整的地形和物体布局,但地形使用简单几何形式实现,地貌表达力有限。WorldClaw 用语义布局图构建连续全局地形,产生显著高度变化和语义明确但空间相连的区域。
内容丰富度和提示对齐方面,WorldClaw 在需要时保留开放地形,并有选择地向不同区域引入聚落、植被、动物和环境物体,使内容变化更丰富,请求的场景元素与其区域功能更紧密对齐。
自由视点外观和场景表示方面,WorldClaw 将显式全局地形与独立重建和放置的物体网格结合,展示视图同时保留大规模地形结构和填充的局部内容,同时保持实例级可编辑性。
实现细节
WorldClaw 使用 Claude Opus 4.8 作为底层 Agent 模型,开发了一套任务特定的 Agent 技能,扩展了预训练基础模型(GPT-Image-2、SAM3、SAM3D、Hunyuan3D)和场景生成所需的可执行 3D 工具。基于 Hunyuan3D 的物体质量细化阶段,大型物体提供 2048×2048 PBR 纹理贴图,小型物体提供 1024×1024 贴图。所有实验在配备 4 块 NVIDIA H20 GPU 的服务器上运行。地形生成、物体生成与放置、场景细化和图像渲染均在 Blender 5.1.1 中进行。
局限与方向
WorldClaw 当前的实现主要依赖 Blender,它提供了对几何、材质和渲染的便捷脚本访问,但大规模游戏世界构建还需要运行时系统支持程序化生成、导航、物理和交互。论文指出与 Unreal Engine 等游戏引擎的程序化内容生成工具集成是重要方向。
另一个已识别的局限是,生成式 3D 骨干网络很少恢复显式零件层级、参数结构、关节或交互逻辑。WorldClaw 已经将地形材质制作为可执行的 Blender 节点图和着色器脚本,将这一能力扩展到物体生成会使组合、材质逻辑、可调参数和运动约束显式可编辑。
论文的展望部分将这一方向概括为:当 Agent 接管资产搜索、材质图和着色器工作,3D 内容创作的核心问题不再是如何构建每个底层组件,而是创作者想表达什么样的世界。