看似最愚蠢的AI提示竟击败了数月的精心游戏设计提示工程

By: rootdata|2026/07/28 18:04:00

就在Claude Opus 5发布两天后,AI投资者和前HyperWrite首席执行官Matt Shumer发布了一段视频,展示了该模型完全独立构建的可玩第一人称射击游戏。

“Claude Opus 5一击即中这个游戏,”他写道,并补充说没有任何外部资产被纳入构建中。

现在,你可能会认为如此高质量的输出需要一个长而详细、精心设计的提示来引导AI模型应对构建一个精致第一人称射击游戏的复杂性。

再想想吧。

其背后的提示仅有三段简短的文字,已在GitHub上完整发布。它告诉Opus 5构建一个与最新的《使命召唤》游戏水平相当的射击游戏,分派子代理——每个子代理都有自己的独立记忆和狭窄的任务——单独处理各个部分,并在每个部分上不断循环,直到它在盲测中与真实的《使命召唤》画面并排对比时表现出色。根据提示,结果应该是“完全完美的”。

这与提示工程师教人们工作的方式正好相反。在流行的编码热潮中,建议是指定标准而不是形容词:说明“好”的含义,而不仅仅是要求它。代码应该考虑什么,而不是简单地说“AAA”。

Shumer的版本几乎是相反的,要求其子代理“完全惊艳”,并将实际定义留给Opus 5为自己构建的批评者。

两个Claude Code特性承载了这个循环。子代理在隔离的上下文窗口中启动,拥有自己的指令和工具访问权限,因此评估武器模型的批评者不会继承构建者对其外观的借口。Ultracode是Claude Code的一个设置,推动模型达到其最高推理能力,并允许它编写自己的编排计划,将工作分配给多达16个代理,同时每次运行限制在1000个。

Anthropic内置的/loop技能,旨在进行重复的修正-测试-调整周期,确保运行不会在游戏看起来不错的那一刻停止。Shumer从未指定轮数。他让批评者不断指出新的差距,并让构建者追逐这些差距,直到他自己结束会话。

最终构建在Three.js和普通WebGL2上运行,代码大约有55,000行,分布在11个子系统中。每个纹理、网格、动画和声音都在加载时在浏览器内部生成——没有下载的模型、HDRI、图像文件或音频文件。Shumer自己发布的批评日志显示,分数从10分中的3.59上升到略高于5,仍然在每一轮中落后于真实游戏。

怀疑论者认为隐藏了数小时的手动编码,因此Shumer发布了整个提示和代码库。于是,模仿者开始出现。

前对冲基金经理和播客主持人James Altucher运行了相同的提示,并报告称在Opus 5上花费了“十个多小时”和大约130万个标记。他的构建,Operation Blackout,可以在浏览器中免费玩,并且看起来很棒。

Prompt Silo的开发者将相同的请求指向OpenAI的竞争对手旗舰,发布了“Sol 5.6 Ultra with same prompt”——Sol是OpenAI于7月9日普遍发布的三模型GPT-5.6系列的顶级版本,伴随更便宜的Terra和Luna版本。

开发者Leon Lin则采取了相反的做法,使用通常的详细提示。与其复制Shumer的简短版本,他着手“逆向工程这个游戏的提示”,生成了一份约20个部分的文档,详细说明了从布娃娃物理到级联阴影图的一切。他将其输入Cursor,使用普通的Opus 5进行高强度工作,没有子代理和Ultracode,结果是一个名为Dust Corridor的市场街射击游戏,也可以在浏览器中玩,并且看起来也很棒。

没有任何后续构建经历过Shumer在自己项目上进行的盲测。他的批评日志仍然显示真实的《使命召唤》在他记录的每一轮中获胜——这是Altucher和Atom Tan Studio用他确切的三段提示所追逐的目标,而Leon Lin则追逐着他自己大约20个部分的提示。

这其中有多少实际上是新的?

像Claude Code这样的代理编码工具以一种受监督的初级工程师可能的方式编写软件:它们读取文件,运行代码,查看生成的截图,并将工作的部分交给子代理和批评者,后者检查结果是否符合既定目标。这个循环是真实的,而Shumer的Gauntlet Loop是构建它的真实方式。单凭这一点并不能证明模型是凭空设计了一个游戏,而不是重新组合它已经吸收的代码模式。

这并不意味着《使命召唤》是假的,但它使得“从零开始构建”这一说法更难以完全认可,因此对这些结果要持谨慎态度。

研究代码生成模型的研究人员对更广泛的问题有一个名称:数据污染,当一个模型在某个任务上表现良好,主要是因为几乎相同的示例已经存在于其训练数据中,而不是因为它推理出了新的东西。

没有任何第一人称射击游戏的构建发布了对此类污染的检查。Shumer自己的代码库确实包含Claude的创造力,如果这样称呼是公平的话。这是一个理由,让“击中了一款AAA游戏”被解读为一个在编程中最详细记录的类型中工作的能力代理,而不是作为证明一个AI在没有先前艺术支持的情况下设计了一个射击游戏的证据。

-- 价格

--

本内容仅供参考,不构成任何金融、投资、法律或税务建议。文中提及的任何活动、奖励、线上活动或相关信息,不应被视为对购买、出售或交易任何加密资产的推荐、招揽或邀请。加密资产具有高波动性,存在价值损失风险。WEEX服务、产品及相关活动的可用性可能因地区而异。用户在参与前有责任确保符合当地适用法律法规。

猜你喜欢

iconiconiconiconiconicon
客户服务:@weikecs
商务合作:@weikecs
量化做市商合作:[email protected]