WorldClaw:一句话生成3D开放世界,支持自由探索与逐物编辑
腾讯混元3D团队推出开放世界生成框架 WorldClaw,8月5日论文公开。用户输入一句开放式文本描述,即可获得一个可自由探索、可继续编辑的大规模3D世界——建筑、车辆、植被都是独立资产,可单独替换与复用。
腾讯混元3D团队推出开放世界生成框架 WorldClaw,8月5日论文公开。用户输入一句开放式文本描述,即可获得一个可自由探索、可继续编辑的大规模3D世界——建筑、车辆、植被都是独立资产,可单独替换与复用。
生成式模型已经能根据文本画出图像、视频与单个3D对象。但生成一段"看起来像世界"的画面,和构建一个可以走进去、能继续编辑的3D世界,是两件完全不同的事——后者需要连续一致的空间结构,还需要建筑、道路、植被以独立资产的形式存在,可以被选中、替换、复用。
WorldClaw 的思路,是让多个 AI Agent 像一支小型生产团队那样分工协作。
整条流水线分为四个阶段,每一步的输出都是下一步的输入。
将文本描述整理为统一的场景规范
构建区域布局与连续地形
逐区生成建筑、车辆、植被
多视角检查并自动修正
流程自上而下单向推进;任何一步的产物都可以在后续阶段被重新调用和修正,而不是一次性出图就结束。
这套系统的关键,在于每个环节都有 Agent 把关。一句话文本通常只能描述世界的大致样貌。WorldClaw 先由两个 Agent 把需求转成可执行的场景规划——意图分析 Agent 只提取用户明确给出的信息,不主动补充用户没提的内容;场景规划 Agent 在此基础上补全区域、地形与物体的统一规范。
别小看"不做脑补"这四个字。它决定了一次生成是可控的,还是失控的。
地形阶段,系统先用一张语义布局图划出山地、森林、沙漠的分布,再通过程序化内容生成(PCG)构建3D高度场:山地自然起伏,沙漠生成连续沙丘,平原保持舒缓。地形优化 Agent 随后重新渲染场景,检查形态、材质尺度与区域过渡——
填充内容时,WorldClaw 将对应地形渲染成二维图像,让图像生成模型在图中画出建筑、车辆与植被,再用 SAM3 分割对象、SAM3D 重建为独立3D网格,并校准每个对象的尺度、位置与朝向。最后,场景精修 Agent 通过 MCP 接口连接 Blender,基于多视角渲染结果检查物体尺度、姿态与几何质量;发现悬浮或穿模,就调整对象位置,或在局部抬升、平滑地形,让物体与地面稳定接触。
整个流程构成"生成—检查—修正"的闭环。这正是 WorldClaw 与一次性生成方法的本质差异。
规划、地形、内容、精修,四步走完,WorldClaw 输出的是什么?
官方展示了四季村落、热带海盗岛屿与沙漠战场三组案例。其中两组最能体现"可自由探索、可继续编辑"意味着什么。
案例均来自官方公开演示与论文定性对比;对比结果以官方展示为准,未给出标准化量化指标。每个物件从生成起就是独立网格,而不是整张贴图——这是"可编辑"成立的前提。
拆开来看,WorldClaw 的工程架构由三层支撑。
地形决定内容布局,先建全局、再逐区填充,避免各区域各自为政。
程序化生成后立即渲染检查,Agent 基于真实视角修正问题。
SAM3 分割 + SAM3D 重建,让每个对象都是可编辑的独立网格。
把三层放在一起看,WorldClaw 的本质不是"一个更大的生成模型",而是一套由 Agent 驱动的可迭代3D生产流水线。模型负责单点能力,框架负责流程与校验。
一个诚实的注脚:目前对比以定性为主,缺乏标准化量化指标;生成规模上限与耗时未公开;"可编辑"的精细度取决于 SAM3D 重建质量,面对复杂机械与精细角色时,独立资产可能仍需人工修整。
3D 生成的竞争,正在从"模型生成资产"转向"Agent 编程构建世界"。
论文、项目主页与代码仓库均已公开;检索「Hunyuan3D-WorldClaw」即可获取完整实现与生成案例。
🔍 检索「Hunyuan3D-WorldClaw」→