🔥 模型 · 玩法速递

一段提示词让 AI 24 小时肝出 3A 游戏,百万网友在线抄作业

本周,一段名为「挑战循环」的提示词在开发者社区爆火。通过给 Opus 5 配备主 Agent + 制作 Agent + 独立评委 Agent 的多智能体架构,网友在 24 小时内从零跑出可玩的太空探索游戏,全程贴图、动画、声音均由 AI 生成,无任何外部素材。

来源:公开报道 2026-07-29 全文约 3 分钟读完
#Opus 5 #多智能体 #挑战循环 #AI 游戏开发
24 小时 从零到可玩版,全程无人值守
100 万+ 在线围观人数
17 AI 自造的强制校验流程

⚡ 30 秒速览

  • 核心玩法:「挑战循环」提示词要求 AI 对标最新《使命召唤》做 3A 游戏,不达标就自动打回重做,直到用户喊停。
  • 架构拆解:主 Agent 拆任务,专业制作 Agent 干活,独立评委 Agent 负责盲测并排对比、无情打回。
  • 硬核产出:网友 Anshu 用此法 24 小时肝出太空探索游戏《The Long Silence》,已开网页试玩。
  • 集体抄作业:卡丁车游戏、《Claudepunk 2077》接连诞生;指令迁移至 GPT-5.6 Sol 效果仅略逊一筹。
  • 深层信号:评委 Agent 的存在放大了模型作用,长程迭代与自主规划能力正被提示词工程「逼」出极限。

01什么是「挑战循环」?给 AI 配一个 PUA 监工

这套全网爆火的提示词由 AI 创业者、投资人 Matt Shumer 发布。核心逻辑非常直接:给 Opus 5 配上多智能体架构,并引入一个极其严苛的验收环节。

主 Agent 拆解任务专业制作 Agent 干活独立评委 Agent 盲测对比不达标自动打回重做

指令明确要求:系统需采用盲测并排对比的方式,将生成结果与真实 3A 游戏分辨优劣。一旦画面不如同类大作,就持续返工优化。作者提醒,此时 AI 并不能真的完全对标 3A 大作,用户需及时喊停——该提示词本质是极限施压手段,用于逼出模型的自主规划与长程迭代能力。

常规多 Agent 开发

主 Agent 拆任务,子 Agent 分别执行,交付即结束。缺乏对最终交付物的质量把控。

挑战循环架构

新增独立评委 Agent,强制与真实参照物逐项对比,不达标自动打回,形成闭环迭代。

02它到底能做到什么程度?三个实跑案例

🚀 太空探索:《The Long Silence》24 小时全流程

  • Step 1:要求 Opus 5 用 Three.js 做太空探索游戏,仅给基础目标(走动、驾驶飞船、视觉不塑料、浏览器 60 帧),世界观与架构全由 AI 定。Claude Code 安装 Blender MCP 后自行建模。
  • Step 2:下达持续 24 小时的视觉提升目标。多个子 Agent 并行工作,评委 Agent 将游戏截图与《星空》等 3A 太空游戏逐项对比,期间不允许偷偷降低评判标准
  • Step 3:手动优化优先级(如星球场景耗时过多则调整),停止后用其它 Claude 修复渲染、清理代码、完成部署,最后将经验汇总成 skill 放进 GitHub。
AI 自造验收工具:审核过程中,Opus 5 自己造了套验收工具,内置 17 项强制校验流程,自动截取不同场景对比、帧率统计与曝光数据分析。

🔫 第一人称射击:Opus 5 版《使命召唤》零外部素材

  • 原作者 Matt Shumer 直接手搓,所有贴图、动画、声音全部由 AI 生成,没有使用任何外部素材。

🏎️ 集体抄作业:卡丁车与赛博朋克跨类型验证

  • 网友 Ryan Campbell 用该方法迭代出卡丁车游戏,Opus 5 连续改进局部渲染、移动端性能、操作和镜头,可直接在浏览器试玩。
  • 网友 Yogi Suria 直接造出了《Claudepunk 2077》。
  • 同样的指令迁移给 GPT-5.6 Sol,效果也很不错,仅略逊 Opus 5 一筹。

03为什么是 Opus 5 跑出来了?

这恰好对应了 Anthropic 在发布 Opus 5 时强调的能力:模型更适合长时间、多步骤工作,也更愿意检查结果、发现错误并持续迭代。

从这个角度看,「挑战循环」提示词更像是给 Opus 5 现有能力套上了更严格的校正机制。评委 Agent 的存在,放大了模型本身的长程迭代优势——不同开发者都能用它做出各种类型的游戏原型。

至于发明这套玩法的 Matt Shumer,今年 2 月曾因长文《Something Big Is Happening》刷屏科技圈,累计浏览量突破 8000 万。文章核心观点是:大众对前沿模型能力的认知,已严重落后于 AI 从业者的实际体验。这次的 Opus 5 游戏潮,恰好给这个判断补上了样本。

04编辑视角

诚实的阅读提示

本篇原始报道主要汇总自社交媒体上的开发者个人展示与企业通稿性质的产品宣传,未见独立第三方对「24 小时」耗时与最终代码质量进行复测。所谓「3A 标准」实为提示词中的极限施压话术,目前 AI 生成结果仍需人工介入修复渲染与清理代码,并非一键生成成品。

读者不妨带着「提示词工程的上限在哪」来读:当模型具备长程迭代能力后,一个独立评委 Agent 就能把原本依赖人类 QA 的闭环跑通——这比游戏本身更值得警惕。

多智能体闭环校验正在把大模型从「单次生成工具」逼成「自驱动的数字员工」,软件工程的劳动力定价体系将被迫重估。

现在就能玩

24 小时肝出的太空探索游戏《The Long Silence》已开放网页试玩,可亲自上手体验 AI 生成效果。

longsilence.anshu.dev → 浏览器直接开玩