# WorldClaw Agentic 3D open-world generation at scale

> 来源：[HackerNews](https://tencent-hunyuan.github.io/Hunyuan3D-WorldClaw/)

## WorldClaw：基于 Agentic AI 的大规模 3D 开放世界生成技术解析

### 背景与概述

在游戏开发、虚拟现实和元宇宙应用高速发展的今天，3D 内容创作始终是制约行业效率的关键瓶颈。传统的人工建模方式不仅成本高昂，且难以满足开放世界游戏对海量多样化场景的需求。近年来，随着多模态大模型的突破，3D 生成技术迎来了革命性进展，但在实际落地中仍面临**语义一致性差、生成规模受限、细节控制困难**等挑战。

腾讯混元（Hunyuan）团队最新开源的 **WorldClaw** 项目，首次将 Agentic AI（智能体驱动）架构引入 3D 开放世界生成领域。该技术通过模拟人类设计师的工作流程，将复杂的场景生成任务分解为规划、生成、验证、优化等多个子任务，实现了从文本/图像输入到可交互 3D 开放世界的端到端自动化生产。这不仅代表了 3D AIGC 技术的重要里程碑，更为独立开发者和中小型工作室提供了 previously impossible 的内容生产能力。

### 核心内容

**1. Agentic 工作流：从被动生成到主动规划**

WorldClaw 最大的创新在于引入了自主智能体架构。不同于传统 3D 生成模型直接"盲生"几何结构，WorldClaw 的 Agent 会先进行**场景语义解析**和**空间布局规划**。系统能够理解"一个带有中世纪城堡的峡谷地形，北侧有瀑布，东侧是松树林"这样的复杂描述，并制定分步执行策略：先生成地形基础网格，再放置水体系统，最后细化植被分布。

**2. 可扩展的分层生成管线**

针对开放世界"大场景"需求，WorldClaw 采用了**分块生成（Chunk-based Generation）与流式加载（Streaming）**相结合的策略。每个地形块（Chunk）由独立 Agent 负责，通过全局坐标系统确保边界无缝衔接。这种架构支持理论上无限扩展的地图生成，且显存占用仅与当前视野内的区块数量相关，而非整个地图大小。

**3. 物理感知的细节合成**

项目引入了物理引擎反馈机制，在生成过程中实时验证物体的物理合理性。例如，当 Agent 生成一座桥梁时，系统会检查结构支撑点的力学分布，自动调整桥墩位置或厚度；对于植被系统，会模拟光照条件决定树木的朝向和密度分布，确保生态合理性。

**4. 多模态条件控制**

支持文本描述、草图手绘、参考图像甚至视频输入作为生成条件。特别值得注意的是其**视频到 3D 场景**的转换能力，能够从无人机航拍或游戏录屏中自动提取深度信息和语义标签，重建可编辑的 3D 环境。

### 技术分析

WorldClaw 的技术架构可概括为"**大脑-小脑-手脚**"三层结构：

在**认知层（大脑）**，基于 Hunyuan 多模态大模型构建的 Scene Planner 负责高层语义理解，将用户意图转化为结构化的场景图（Scene Graph），定义物体类别、空间关系和风格约束。

**生成层（小脑）**采用混合表示方案：地形使用高度图（Heightfield）结合程序化噪声；建筑等刚性物体采用 NeRF 或 3D Gaussian Splatting 生成；植被等实例化资产则通过优化的扩散模型快速实例化。这种异构表示在保证质量的同时大幅降低了存储开销。

**执行层（手脚）**集成了 Unreal Engine 5 的 Nanite 虚拟几何系统和 Lumen 光照系统，生成结果可直接导出为 `.uproject` 或 `.fbx` 格式。关键技术亮点在于其**迭代细化（Iterative Refinement）**机制，Agent 会通过视觉语言模型（VLM）自检生成结果，如发现"悬崖上的树木漂浮"等瑕疵，自动触发重生成或物理模拟修正。

```python
# 伪代码示例：WorldClaw Agent 的核心循环
class WorldClawAgent:
    def generate(self, prompt: str, bounds: BoundingBox):
        # 1. 语义规划
        scene_graph = self.planner.parse(prompt)
        
        # 2. 分块生成
        chunks = []
        for coord in bounds.iter_chunks():
            chunk = self.generator.create_chunk(
                scene_graph.get_local_context(coord),
                lod=self.calculate_lod(coord)  # 根据距离计算细节层级
            )
            # 3. 物理验证与修复
            chunk = self.physics_validator.fix(chunk)
            chunks.append(chunk)
            
        # 4. 全局一致性优化
        return self.stitcher.merge(chunks)
```

### 实践建议

对于希望尝试 WorldClaw 的开发者，建议遵循以下路径：

**环境准备**：项目推荐至少 24GB 显存的 GPU（如 RTX 4090 或 A100）用于本地推理。对于轻量级应用，可使用官方提供的 API 服务，通过调整 `chunk_size` 参数（建议 128m×128m）在质量与速度间取得平衡。

**提示词工程**：采用"**宏观-中观-微观**"三级描述结构。先定义整体风格（如"赛博朋克风格的海滨城市"），再指定区域功能（"港口区有集装箱起重机和货运飞船"），最后补充细节约束（"地面有积水反射霓虹灯光"）。避免使用抽象形容词，多用空间方位词。

**工作流集成**：生成的场景建议先导入 Blender 进行人工微调，特别是游戏玩法相关的碰撞体（Collider）设置。WorldClaw 生成的材质默认采用 PBR 工作流，与 Unity URP 和 Unreal Engine 的导入管线兼容良好，但需注意法线贴图的 Y 轴方向转换。

**性能优化**：对于移动端应用，建议开启 `adaptive_lod` 模式，利用生成的语义标签自动简化远景几何（如将远距离树木简化为 Billboard 贴图），可将渲染负载降低 60% 以上。

### 总结

WorldClaw 代表了 3D 生成技术从"工具"向"协作者"演进的重要方向。通过 Agentic 架构引入的自主规划与验证能力，有效解决了 AIGC 在复杂场景生成中的可控性难题。这项技术不仅将显著降低开放世界游戏的开发门槛，更有望在数字孪生、影视预演、虚拟现实等领域催生新的创作范式。随着多智能体协作机制的进一步完善，未来我们或许只需提供简单的创意描述，就能在数小时内获得可玩的 3D 世界原型，这将重新定义内容创作的边界。