Claude Opus 5 以簡單三段式提示打造可遊玩的 FPS 遊戲

Key Takeaways
  • Claude Opus 5 於 7 月 25 日,根據一段三段落的提示詞,打造了一款可完全遊玩的第一人稱射擊遊戲。
  • 該遊戲以 Three.js 與 WebGL2 運行,整體程式碼約有 55,000 行,涵蓋 11 個子系統。
  • 多位開發者使用相同或修改後的提示詞復現了結果,包括 James Altucher 與 Leon Lin,並打造了可在瀏覽器中遊玩的版本。

AI 投資人、也是前 HyperWrite 執行長 Matt Shumer 在模型上線兩天後,發布了一支影片:展示一款完全可遊玩的第一人稱射擊(FPS)遊戲,該遊戲是由 Claude Opus 5 全部建構完成;影片使用了發布於 GitHub 的三段式提示詞(prompt)。Shumer 表示這款遊戲「不靠外部素材一把就做好了(one-shotted)」,但因成品質量與提示詞的簡單性,立刻引發了懷疑。面對批評者認為背後有隱藏的人工手動編碼,Shumer 發布了完整提示詞與程式碼庫,促使多位開發者用他所稱的 Gauntlet Loop(競技場循環)相同方法復現結果。

Claude Opus 5 用三段式提示詞打造第一人稱射擊遊戲

Matt Shumer 在 7 月 25 日發文表示,Claude Opus 5 透過運行三段短提示詞,打造出一款第一人稱射擊遊戲。該提示詞已在 GitHub 全文釋出,指示 Opus 5 以近期《使命召喚》(Call of Duty)遊戲水準建造一款射擊遊戲,部署用於各項個別任務的子代理(subagents),並讓每一個部分都經由一位獨立的評審(critic)反覆迴圈,直到在盲測的並排對照比較中,能與真實的《使命召喚》影像相匹配。完成的成品運行於 Three.js 與 WebGL2,11 個子系統合計約 55,000 行程式碼。所有紋理、模型網格(mesh)、動畫與聲音,都在載入時於瀏覽器內生成,沒有下載模型或外部檔案。
Shumer 從未指定渲染器(renderer)、列出遊戲系統,或定義 AAA 品質需求。提示詞告訴子代理要「完全被震撼(utterly wowed)」,並把實際定義交給 Opus 5 自行打造的評審(critic)。Shumer 發布的評審紀錄顯示分數從 10 分中 3.59 往上攀升,直到略高於 5;而真實的《使命召喚》在每一個被記錄的回合都勝出。

開發者用相同且修改過的提示詞復現結果

James Altucher(前對沖基金經理與播客主持人)跑了相同的提示詞,並回報在 Opus 5 上花了超過 10 小時、約 130 萬(1.3 million)tokens。他的成品 Operation Blackout 可在瀏覽器中免費遊玩。Prompt Silo 的開發者把同一項請求丟給 OpenAI 的 Sol 5.6 Ultra——屬於 OpenAI 三模型 GPT-5.6 家族的頂級版本;OpenAI 於 7 月 9 日普遍提供該版本。開發者 Leon Lin 逆向工程出一份深入 20 個章節的詳細提示詞,從布娃娃物理(ragdoll physics)到級聯陰影貼圖(cascaded shadow maps)都被明確指定,接著用不含子代理、也不使用 Ultracode 的方式,改用 Cursor 丟進「純」Opus 5 並以高努力(high effort)執行。其結果 Dust Corridor 也同樣可在瀏覽器中遊玩。
沒有任何後續復現版本經歷 Shumer 對其專案所做的盲測。Shumer 的評審紀錄顯示:真實的《使命召喚》在他記錄的每一輪都勝出。

Gauntlet Loop 方法顛覆傳統提示工程做法

Shumer 將他的做法稱為 Gauntlet Loop:把一個真實、可檢視的標準交給代理,而不是模糊的指令;讓它把任務拆成小部分,並把每個部分都送進一個永遠看不到製作者(builder)推理的評審。這個循環由兩個 Claude Code 功能支撐:子代理會在彼此隔離的情境視窗(context windows)中啟動,並各自帶著自己的指示與工具存取權限,因此評審若是在打分武器模型(weapon model),就不會繼承製作者的藉口(excuses)。Ultracode 是一個 Claude Code 設定,它會把模型推到最高推理努力,並讓它撰寫自己的協作(orchestration)計畫;它能同時把工作分散給最多 16 個代理,且每次執行上限為 1,000。
Anthropic 內建的 /loop 技能(skill)是為反覆的「修正-測試-調整」循環打造的,讓整個流程不會在遊戲看起來不錯時就停止。Shumer 從未指定回合數,並讓評審在他結束會話前,能持續數小時不斷命名新的缺口(gaps)。

研究者提出資料污染(data contamination)疑慮

Three.js 內建了自己的指標鎖定(pointer-lock)相機控制項,並把它作為官方範例。基本模式——鼠標視角(mouse-look)、WASD 移動(WASD movement)、以及用射線投射(raycasting)來判定槍擊——早在十多年前就已被大量改造、並在 GitHub、gists 與開發者論壇中被教學化(tutorialized)。在閱讀 Shumer 的提示詞之前,由公開程式碼庫訓練的編碼模型,極可能已經看過數百甚至數千個幾乎相同的射擊遊戲。研究代碼生成(code-generating)模型的人稱這個問題為資料污染(data contamination):當模型主要是因為訓練資料中早已有幾乎相同的例子而在任務上表現得很好,而不是因為它推理出了全新的內容。
在公開的第一人稱射擊遊戲建構版本中,沒有任何一個做了資料污染檢查。Shumer 的 repo 確實包含該模型生成的程式碼,但這並不能證明「一把就(one-shotted)做出 AAA 遊戲」是「在程式設計中資料最嚴密、且被大量記錄的類型之一」裡、能勝任工作的能手代理(capable agent);而是因為該類型有先前大量可依循的既有作品,所以更像是在既有資料語境中運作,而不是證明 AI 在完全沒有既有作品(prior art)可倚靠的情況下就能自己打造射擊遊戲。

常見問題

Matt Shumer 的 Claude Opus 5 提示詞(prompt)內容實際包含了什麼?
該提示詞包含三段短篇幅,已在 GitHub 發布。它指示 Opus 5 以近期《使命召喚》(Call of Duty)遊戲水準建造射擊遊戲,部署用於各項個別任務的子代理,並讓每一個部分都經由一位獨立的評審反覆迴圈,直到在盲測的並排對照比較中能與真實的《使命召喚》影像相匹配。Shumer 從未指定渲染器、列出遊戲系統,或定義 AAA 品質需求。
其他開發者如何復現 Claude Opus 5 的遊戲建構結果?
James Altucher 跑了相同的提示詞,並在 Opus 5 上花了超過 10 小時、約 130 萬(1.3 million)tokens 來打造 Operation Blackout。Prompt Silo 的開發者使用 OpenAI 的 Sol 5.6 Ultra 搭配相同提示詞。開發者 Leon Lin 逆向工程了一份詳細的 20 段式提示詞,並以不含子代理、且不使用 ultracode 的方式,透過 Cursor 丟入純 Opus 5,最終產生 Dust Corridor。

免責聲明:本頁面資訊可能來自第三方來源,僅供參考,不代表 Gate 的立場或觀點,亦不構成任何財務、投資或法律建議。虛擬資產交易具有高風險,請勿僅依賴本頁資訊作出決策。詳情請參閱 免責聲明
回覆
0/400
暫無回覆