🎬 模型实验 · 长程任务

两小时、5500行代码、10美元成本:Claude Opus 5把《指环王》开篇变成可运行的3D世界

8月3日,OpenAI联合创始人、现Anthropic预训练团队成员安德烈·卡帕西(Andrej Karpathy)在X平台展示了一种全新的模型测试方式:让Claude Opus 5把《指环王》开篇第一段文字,用Three.js渲染成一个可运行的3D动画。最终,模型连续工作约2小时,产出约5500行代码,任务总成本约10美元(约合人民币68元)。卡帕西的评价耐人寻味:“有些粗糙,但很有趣。”

综合公开信息整理 2026-08-03 全文约 4 分钟读完
#Claude Opus 5 #Andrej Karpathy #AI 长程任务 #3D 生成
💵 10 美元 任务总成本 · 约合人民币 68 元
2 小时 单次连续运行时长 · 全程无人介入
5500 行 成片代码量 · 可直接在浏览器运行

⚡ 30 秒速览

  • 一次“长跑”测试:从“用SVG画一只骑自行车的鹈鹕”这类单图测试,扩展到持续约2小时的完整3D制作流程。
  • 完整任务链路:读原文 → 拆场景 → 建几何资产 → 摆放三维坐标 → 写镜头与动画 → 运行中自查 → 交付可运行程序。
  • 成本信号:10美元让“一次性定制项目”第一次从经济学上算得过账,按需生成世界不再只是设想。
  • 诚实的短板:Claude Opus 5还不能看连续视频、不能进场景试玩,只能逐张截取画面检查,过程中数次出错。
  • 下一步思路:程序化代码负责分镜与控制,视频模型负责纹理与最终视觉效果——Seedance 等视频模型被点名。
  • 全部公开:项目源码与浏览器版本已释出,任何人都可以自己运行,或继续修改这个“霍比屯”。

01发生了什么?一次持续 2 小时的“制作流程”

卡帕西输入的不是一句提示词,而是《指环王》开篇第一段文字,外加 100 万 token 的预算上限。任务目标只有一个:用 Three.js 把这段文字渲染成一个可运行的 3D 动画。

整个过程中,模型需要独立完成一条完整链路:

理解原文 拆解场景 创建多边形资产 摆放 x/y/z 坐标 编写镜头与动画 运行中自查修正 交付可运行程序

约2小时后,Claude Opus 5生成了约5500行代码,把“袋底洞、霍比屯、甘道夫到来的那个下午”变成了一个用户能打开浏览器、旋转视角、继续修改的3D场景。卡帕西最意外的,是模型能在三维坐标中摆放并组织多种多边形资产,写出动画与时间线代码,并最终生成可以运行的内容。

注:这不是视频模型合成的画面——最终交付物是一个 Three.js 程序,在浏览器中可交互、可运行、可继续二次开发。

02它面对的,不是一个“画图题”

过去测试大模型的视觉编程能力,最常用的一招是“用SVG画一只骑自行车的鹈鹕”。结果直观、生成快、一次调用就能完成。但卡帕西这次把任务从“一次代码生成”,拉长成了一段持续约2小时的完整制作流程

静态画图题(SVG 鹈鹕)

单次生成 · 秒级完成
只看静态结果
难以暴露长程规划与纠错能力

长程 3D 项目(指环王)

持续约 2 小时 · 5500 行代码
多层任务互相依赖
要求模型自检、试错、回来修改

难点在于每一步都有依赖关系:场景没拆对,后面的资产就白建;坐标摆错,镜头就穿帮;代码报错,模型得自己回去改。这不是“会不会写代码”的问题,而是能不能把一件复杂的事做完的问题。

注:两者好比“画一幅画”与“拍一部短片”的差别——后者要求持续规划、运行、检查、修复,衡量的维度完全不同。

03一组值得注意的数字

这次实验真正让行业侧目的,是成本。

10美元,让“一次性定制世界”第一次算得过账来。

100万token 任务预算上限
1569次初版场景独立渲染调用
4次优化后的渲染调用次数
1154个可合并的草地野花等同类物体

注:100万 token 是卡帕西给的预算上限,并非模型最终输出量。渲染优化数据来自 Three.js 官方的专业建议——模型自查后,将初版的 1569 次独立渲染调用压缩为 4 次批量调用。

Three.js 官方账号建议模型使用“实例化网格”优化性能后,卡帕西把这条意见转交给 Claude Opus 5。模型检查场景代码后给出统计:原版霍比屯场景包含 1569 次独立渲染调用;若对重复物体使用实例化网格,只需 4 次调用即可渲染 1154 个同类物体。
卡帕西的清醒:成片“有些粗糙,但很有趣”。他还调侃道:可以期待“《侠盗猎车手》霍比屯版”——它说不定会赶在《侠盗猎车手6》之前问世。

04硬币的另一面:它还没学会“玩”自己的作品

一个诚实的注脚:

模型的生成能力,已经跑在审查能力前面。

🔧 它能做到的 生成与编排

  • 在 x/y/z 三维坐标中摆放并组织多种多边形资产
  • 编写镜头、动作与时间线代码,形成完整叙事
  • 接受外部反馈后自查场景,把 1569 次渲染调用优化为 4 次

⚠️ 它还做不到的 审查与反馈

  • 无法观看连续视频——只能缓慢截取不同时点的画面,逐张检查
  • 无法进入场景试玩——动作与镜头之间的连贯信息会丢失
  • 检查修改过程中数次出错,无法确认画面、空间、时间线是否全部正确
卡帕西的判断:Claude Opus 5 的视觉审查和错误修复能力,仍未跟上代码生成能力。

卡帕西与芬兰手游公司 Supercell 创意 AI 主管鲁普·雷尼斯托(Roope Rainisto)的讨论,也指向同一个方向:代码负责分镜与控制,视频到视频模型负责纹理和最终视觉效果。程序化生成 + 视频增强,可能是通往“可玩世界”的一条现实路径。

编辑核心判断

长程任务正在把大模型竞争的主战场,从“生成能力”推向“反馈闭环”。能写 5500 行代码的模型会越来越多,能在 2 小时内持续规划、自查、修复并交付可运行程序的模型才是稀缺品。当模型能自己“看”自己写的东西、自己“玩”自己做的世界时,按需生成的定制化世界才会真正到来。

动手试试

卡帕西已公开项目源码与浏览器版本,任何人都可以运行、拆解或继续修改这个“霍比屯”。下一次,或许你只需要给它一个主题。

前往 X 平台 @AndrejKarpathy 即可找到项目入口