两小时、5500行代码、10美元成本:Claude Opus 5把《指环王》开篇变成可运行的3D世界
8月3日,OpenAI联合创始人、现Anthropic预训练团队成员安德烈·卡帕西(Andrej Karpathy)在X平台展示了一种全新的模型测试方式:让Claude Opus 5把《指环王》开篇第一段文字,用Three.js渲染成一个可运行的3D动画。最终,模型连续工作约2小时,产出约5500行代码,任务总成本约10美元(约合人民币68元)。卡帕西的评价耐人寻味:“有些粗糙,但很有趣。”
8月3日,OpenAI联合创始人、现Anthropic预训练团队成员安德烈·卡帕西(Andrej Karpathy)在X平台展示了一种全新的模型测试方式:让Claude Opus 5把《指环王》开篇第一段文字,用Three.js渲染成一个可运行的3D动画。最终,模型连续工作约2小时,产出约5500行代码,任务总成本约10美元(约合人民币68元)。卡帕西的评价耐人寻味:“有些粗糙,但很有趣。”
卡帕西输入的不是一句提示词,而是《指环王》开篇第一段文字,外加 100 万 token 的预算上限。任务目标只有一个:用 Three.js 把这段文字渲染成一个可运行的 3D 动画。
整个过程中,模型需要独立完成一条完整链路:
约2小时后,Claude Opus 5生成了约5500行代码,把“袋底洞、霍比屯、甘道夫到来的那个下午”变成了一个用户能打开浏览器、旋转视角、继续修改的3D场景。卡帕西最意外的,是模型能在三维坐标中摆放并组织多种多边形资产,写出动画与时间线代码,并最终生成可以运行的内容。
注:这不是视频模型合成的画面——最终交付物是一个 Three.js 程序,在浏览器中可交互、可运行、可继续二次开发。
过去测试大模型的视觉编程能力,最常用的一招是“用SVG画一只骑自行车的鹈鹕”。结果直观、生成快、一次调用就能完成。但卡帕西这次把任务从“一次代码生成”,拉长成了一段持续约2小时的完整制作流程。
单次生成 · 秒级完成
只看静态结果
难以暴露长程规划与纠错能力
持续约 2 小时 · 5500 行代码
多层任务互相依赖
要求模型自检、试错、回来修改
难点在于每一步都有依赖关系:场景没拆对,后面的资产就白建;坐标摆错,镜头就穿帮;代码报错,模型得自己回去改。这不是“会不会写代码”的问题,而是能不能把一件复杂的事做完的问题。
注:两者好比“画一幅画”与“拍一部短片”的差别——后者要求持续规划、运行、检查、修复,衡量的维度完全不同。
这次实验真正让行业侧目的,是成本。
10美元,让“一次性定制世界”第一次算得过账来。
注:100万 token 是卡帕西给的预算上限,并非模型最终输出量。渲染优化数据来自 Three.js 官方的专业建议——模型自查后,将初版的 1569 次独立渲染调用压缩为 4 次批量调用。
一个诚实的注脚:
模型的生成能力,已经跑在审查能力前面。
卡帕西与芬兰手游公司 Supercell 创意 AI 主管鲁普·雷尼斯托(Roope Rainisto)的讨论,也指向同一个方向:代码负责分镜与控制,视频到视频模型负责纹理和最终视觉效果。程序化生成 + 视频增强,可能是通往“可玩世界”的一条现实路径。
长程任务正在把大模型竞争的主战场,从“生成能力”推向“反馈闭环”。能写 5500 行代码的模型会越来越多,能在 2 小时内持续规划、自查、修复并交付可运行程序的模型才是稀缺品。当模型能自己“看”自己写的东西、自己“玩”自己做的世界时,按需生成的定制化世界才会真正到来。
卡帕西已公开项目源码与浏览器版本,任何人都可以运行、拆解或继续修改这个“霍比屯”。下一次,或许你只需要给它一个主题。
前往 X 平台 @AndrejKarpathy 即可找到项目入口