🎮 3D生成 · 框架发布

WorldClaw:一句话生成3D开放世界,支持自由探索与逐物编辑

腾讯混元3D团队推出开放世界生成框架 WorldClaw,8月5日论文公开。用户输入一句开放式文本描述,即可获得一个可自由探索、可继续编辑的大规模3D世界——建筑、车辆、植被都是独立资产,可单独替换与复用。

来源:综合公开信息 2026-08-13 全文约 4 分钟读完
#腾讯混元 #WorldClaw #3D世界生成 #多Agent协作 #AIGC
4 个阶段 从文本规划到场景精修的完整流水线
4 类 Agent 意图分析 · 场景规划 · 地形优化 · 场景精修
5 个基准 与主流开放世界生成方法定性对比
⚡ 30 秒速览
  • 一句话启动:输入开放式文本描述,WorldClaw 直接输出可自由探索的大规模3D世界。
  • 四步流水线:先规划意图与场景,再建全局地形、逐区填充内容,最后自动精修。
  • 对象级资产:建筑、车辆、植被全部转为独立3D网格,可单独编辑、替换、复用。
  • 自动纠错闭环:基于多视角渲染检查尺度、姿态、悬浮与穿模问题,无需人工介入。
  • 全量公开:8月5日论文上线,项目主页与代码仓库同步开放,可复现。

01从「生成3D资产」到「构建3D世界」

生成式模型已经能根据文本画出图像、视频与单个3D对象。但生成一段"看起来像世界"的画面,和构建一个可以走进去、能继续编辑的3D世界,是两件完全不同的事——后者需要连续一致的空间结构,还需要建筑、道路、植被以独立资产的形式存在,可以被选中、替换、复用。

WorldClaw 的思路,是让多个 AI Agent 像一支小型生产团队那样分工协作。

单次 3D 生成

  • 输出单个资产或静态画面
  • 场景元素彼此独立、难以衔接
  • 生成即终点,不支持持续编辑

WorldClaw

  • 先规划全局、再逐区填充
  • 真实地形 + 独立3D资产组合
  • 生成后可继续编辑、替换、扩展

整条流水线分为四个阶段,每一步的输出都是下一步的输入。

01 规划

将文本描述整理为统一的场景规范

02 地形

构建区域布局与连续地形

03 内容

逐区生成建筑、车辆、植被

04 精修

多视角检查并自动修正

流程自上而下单向推进;任何一步的产物都可以在后续阶段被重新调用和修正,而不是一次性出图就结束。

02多 Agent 分工,自己生成自己检查

这套系统的关键,在于每个环节都有 Agent 把关。一句话文本通常只能描述世界的大致样貌。WorldClaw 先由两个 Agent 把需求转成可执行的场景规划——意图分析 Agent 只提取用户明确给出的信息,不主动补充用户没提的内容;场景规划 Agent 在此基础上补全区域、地形与物体的统一规范。

别小看"不做脑补"这四个字。它决定了一次生成是可控的,还是失控的。

地形阶段,系统先用一张语义布局图划出山地、森林、沙漠的分布,再通过程序化内容生成(PCG)构建3D高度场:山地自然起伏,沙漠生成连续沙丘,平原保持舒缓。地形优化 Agent 随后重新渲染场景,检查形态、材质尺度与区域过渡——

程序化生成渲染检查Agent 修正

填充内容时,WorldClaw 将对应地形渲染成二维图像,让图像生成模型在图中画出建筑、车辆与植被,再用 SAM3 分割对象、SAM3D 重建为独立3D网格,并校准每个对象的尺度、位置与朝向。最后,场景精修 Agent 通过 MCP 接口连接 Blender,基于多视角渲染结果检查物体尺度、姿态与几何质量;发现悬浮或穿模,就调整对象位置,或在局部抬升、平滑地形,让物体与地面稳定接触。

整个流程构成"生成—检查—修正"的闭环。这正是 WorldClaw 与一次性生成方法的本质差异。

03它实际生成了什么样的世界

规划、地形、内容、精修,四步走完,WorldClaw 输出的是什么?

官方展示了四季村落、热带海盗岛屿与沙漠战场三组案例。其中两组最能体现"可自由探索、可继续编辑"意味着什么。

🏝️ 热带海盗岛屿对象级可编辑

  • 连续地形与明确语义分区:海岸线、腹地与码头区域自然衔接
  • 建筑、植被、船只、码头均以独立3D资产放置
  • 岛屿整体可自由探索,单个物件可选中、替换与复用
亮点:不是一张"俯视示意图",而是一个有地形高差、可进入的完整场景

🏜️ 沙漠战场可自由探索

  • 起伏沙丘由 PCG 高度场构建,不同地貌连续过渡
  • 建筑、载具与环境设施按区域规则分布
  • 完整战场可进入漫游,支持持续补充内容
与 SynCity、Marble、MajutsuCity、WorldGen 及 GPT-5.6 Sol 对比,WorldClaw 在复杂地形高差、连续边界与语义分区上表现更完整。

案例均来自官方公开演示与论文定性对比;对比结果以官方展示为准,未给出标准化量化指标。每个物件从生成起就是独立网格,而不是整张贴图——这是"可编辑"成立的前提。

04为什么能做到:三层技术地基

拆开来看,WorldClaw 的工程架构由三层支撑。

🧭
全局先行

地形决定内容布局,先建全局、再逐区填充,避免各区域各自为政。

🔁
渲染闭环

程序化生成后立即渲染检查,Agent 基于真实视角修正问题。

🧩
对象级资产

SAM3 分割 + SAM3D 重建,让每个对象都是可编辑的独立网格。

把三层放在一起看,WorldClaw 的本质不是"一个更大的生成模型",而是一套由 Agent 驱动的可迭代3D生产流水线。模型负责单点能力,框架负责流程与校验。

一个诚实的注脚:目前对比以定性为主,缺乏标准化量化指标;生成规模上限与耗时未公开;"可编辑"的精细度取决于 SAM3D 重建质量,面对复杂机械与精细角色时,独立资产可能仍需人工修整。

编辑核心判断

3D 生成的竞争,正在从"模型生成资产"转向"Agent 编程构建世界"。

当框架能自主规划、生成并修正一个完整场景时,最终壁垒不再是单次生成精度,而是把规划、生成、校验串成闭环的系统工程能力。

现在就能拿到

论文、项目主页与代码仓库均已公开;检索「Hunyuan3D-WorldClaw」即可获取完整实现与生成案例。

🔍 检索「Hunyuan3D-WorldClaw」→