🔬 模型实验 · 边界探索

Karpathy 亲测 Opus 5 新边界:两小时 5500 行代码,却连自己写的游戏都玩不了

8 月 2 日,Andrej Karpathy 将《指环王》第一章文字交给 Claude Opus 5,预算 100 万 Token(约合 10 美元),模型运行两小时写出 5500 行 Three.js 代码,构建出一个可运行的 3D 场景。成品粗糙,但背后逻辑值得深思:模型生成内容的能力,正在快于它验证内容的能力。

综合公开信息整理 2026-08-05 全文约 4 分钟读完
#Claude Opus 5 #Karpathy #3D 生成 #代码世界 #验证鸿沟
2 小时 模型连续运行时长
5,500 生成的 Three.js 代码
~10 美元 100 万 Token 推理预算

⚡ 30 秒速览

  • 实验内容:Karpathy 让 Opus 5 将一段小说文字渲染成 3D 场景,模型自行决定角色、房屋、道路、植被,编写动画与镜头逻辑。
  • 关键发现:模型生成的代码可以运行,但成品粗糙——因为它无法像人类一样“玩”自己生成的游戏,只能通过截取静态画面调试。
  • 经济性变化:以前因“太麻烦、太小众”而不存在的个性化内容,现在只需一句描述和约 10 美元推理成本即可生成。
  • 开发者跟进:Opus 5 发布后,社区用它生成 FPS 游戏、滑雪模拟、Minecraft 风格世界——代码生成 3D 成为非正式压力测试。
  • 深层矛盾:模型生成内容的能力快于验证内容的能力,视频理解与连续状态感知仍是明显短板。

01一场把小说变成 3D 世界的实验

Karpathy 将《指环王》第一章开头的一段文字交给 Claude Opus 5,给出 100 万 Token 的推理预算,要求模型用 Three.js 把这段故事渲染成一个三维场景。

模型运行了约两小时,写出 5500 行代码。最终生成一个能在浏览器中运行的 3D 叙事:场景中有角色、房屋、道路、植被,镜头跟随故事发展移动,字幕在指定时间出现。

Karpathy 形容它“有些粗糙,但很好玩”。真正让他感到不可思议的是:模型必须自行决定场景中应该出现哪些元素,把各种多边形资产放进三维坐标系,再编写动画、镜头和时间轴逻辑——这不是简单地把文本交给图像或视频生成模型,而是通过代码创建几何体、材质、灯光、摄像机和动画,搭建一个显式存在的三维场景。

在这样的系统中,一棵树不只是画面中的一团绿色像素,而是场景树中的一个对象;道路、房屋和角色都有对应坐标;镜头何时靠近、角色从哪里走到哪里、字幕在什么时间出现,也需要被写进程序。

注:Karpathy 的实验并非官方基准测试,但被社区视为当前模型“长时间、多步骤、创造性任务”能力的非正式标杆。推理成本为其个人估算,实际使用中可能因环境而异。

02“按需生成的临时版 GTA”

Karpathy 尤其关注的,并不是这段《指环王》动画本身,而是它背后的经济性变化。

按照传统流程,为一段小说开头单独制作一个 3D 动画,需要编剧拆分场景、美术制作资产、程序员搭建交互与动画。即便最终只供一个人观看,这套成本也不会明显降低。由于需求过于定制,绝大多数类似想法根本不会进入制作阶段。

LLM 改变的首先不是作品质量,而是“是否值得开始”。

模型不在乎任务是否琐碎,也不在乎 5500 行代码最终只被播放一次。只要推理成本足够低,过去因为过于个性化、投入产出比太低而无人制作的内容,都可能被临时生成出来。

Karpathy 将其描述为一种“按需生成的临时版 GTA”:用户可以指定任何小说、历史事件或虚构设定,让模型临时搭出一个世界;玩家既可以作为旁观 NPC 进入故事,也可以成为其中一个角色,甚至改变原本的叙事走向。

100 万 Token 预算(约 10 美元)
5500 行 代码,创造了一个叙事世界

注:成本仅包含模型推理,不包含人工设计、运行环境、验收、修改和正式制作费用。实际商业化尚需考虑更多因素。

03开发者用游戏“拷问”Opus 5

Karpathy 的实验并非孤例。Opus 5 发布后,X 上的开发者迅速把三维游戏和物理模拟变成一种非正式压力测试。

🔫 Claude of Duty:第一人称射击游戏纯代码生成

  • 开发者 Matt Shumer 展示了一款由 Opus 5 生成的第一人称射击游戏,场景与贴图均由代码生成,没有使用任何外部美术资产。
  • 模型自动处理了摄像机控制、碰撞检测、敌人 AI 和武器系统,实现了基本可玩的 FPS 体验。
社区评价:这是“AI 生成完整游戏”方向上的一个早期里程碑,但距离商业产品仍有距离。

⛷️ 滑雪板模拟:物理反馈自然视觉流畅

  • Alex Ermolov 让 Opus 5 制作了一段滑雪板体验。他评价称,在自己测试过的模型中,Opus 5 处于领先位置。
  • 第一次生成的版本就没有明显视觉故障,滑行的物理反馈也相对自然,地形和雪景的渲染也较为细致。
对比:一年前的 Claude 4 Opus 生成的泥路汽车场景主要由简单色块组成,而 Opus 5 已自动加入车辙、植被、阴影和分层光照。

🌍 重建《我的世界》:15 种生物群系规模最大

  • Pankaj Kumar 让 Opus 5 重建 Minecraft,最终得到一个包含 15 种生物群系、创造与生存模式的程序化世界,图形、纹理和声音都在运行时生成。
  • 不过,这次任务使用了约 2500 万 Token,说明随着世界规模扩大,成本和代码复杂度仍会快速增长。
社区结论:模型具备了“建造临时世界”的耐力,但成本随规模非线性上升。

注:这些演示没有统一的提示词控制、运行次数和评分标准,更适合被视为开发者实验,而不是严格的模型基准。

04代码生成世界 vs 神经世界模型

尽管看起来像一个生成式世界,Karpathy 的实验与谷歌 DeepMind 的 Genie 等世界模型仍有明显区别。

代码生成世界(Opus 5 路线)

模型生成显式程序,场景中的对象、坐标和行为由 Three.js 代码决定,开发者可阅读、修改和复用。优势是结构清晰、控制性强,但视觉上容易粗糙,且只能生成模型能够用程序表达出来的对象和规则。

神经世界模型(Genie 路线)

根据文本实时生成 720p、每秒 24 帧的可交互环境,并在几分钟内保持视觉一致性。不需要显式创建每一个三维模型,而是直接根据玩家操作预测下一帧画面。画面可能更丰富,但缺少传统游戏引擎中明确的对象、状态和规则。

两条路线解决的是不同问题。代码生成世界更像“AI 自动编写一个小型游戏引擎和关卡”,结果可编辑、可调试;神经世界模型更像“实时生成一个可以进入的视频”。未来的产品也可能融合两者:LLM 负责规划任务、设计规则和生成代码,世界模型负责画面、物理直觉与环境反馈。

05生成能力快于验证能力

这次实验最值得注意的部分,是 Opus 5 检查这些代码的方式。

Karpathy 指出,模型不能高效、原生地观看连续视频,也不能像真人测试员一样进入游戏,持续移动、碰撞、回头观察,再判断哪里出现问题。

它只能运行程序,在若干时间节点截取静态画面,然后根据截图修改代码。这个循环既缓慢,又很容易漏掉只在运动过程中出现的问题。例如,角色可能在某一帧看起来位置正确,却在几秒后穿过地面;摄像机在单张截图中没有问题,运动时却可能突然转向;碰撞、速度和操作手感更难通过几张图片判断。

因此,画面中仍然留下了不少错位和粗糙之处。

Karpathy 由此认为,视频理解、连续状态感知以及真正“玩游戏”的能力,仍是当前大模型明显不足的原始能力。

这暴露出一个正在变得越来越重要的矛盾:模型生成内容的能力,正在快于它验证内容的能力。

对于普通代码,模型可以运行单元测试、查看错误日志、比较文本输出;但面对动画、游戏、机器人和复杂用户界面,正确性不再只存在于文字和数值中,而是分布在连续时间、视觉状态和交互反馈里。如果模型无法亲自体验自己生成的系统,就很难形成完整的“生成—执行—观察—修正”闭环。

生成能力验证能力视频理解连续状态交互反馈闭环缺失
编辑核心判断

模型已经具备建造临时世界的耐力,但缺少“走进自己创造的世界”的能力。下一个关键突破不是生成更多代码,而是让模型学会观察、体验和修正自己生成的动态系统——这可能是通往真正自主智能体的最后一道门槛。