Коротко

  • Claude Opus 5 «одним пострілом» створив шутер від першої особи з таким простим запитом, і результати настільки вражаючі, що люди не можуть у це повірити.
  • Інші повторили запит, і результати підтвердилися.
  • Метт Шумер, творець гри за допомогою Claude, називає цей метод Gauntlet Loop: дайте агенту реальну планку, яку треба перевершити, розподіліть роботу між свіжими критиками і ніколи не дозволяйте будівельнику оцінювати власну роботу.

Лише через два дні після виходу Claude Opus 5, AI-інвестор і колишній генеральний директор HyperWrite Метт Шумер опублікував відео повністю грабельного шутера від першої особи, який модель створила повністю самостійно.

«Claude Opus 5 одним пострілом створив цю гру», — написав він, додавши, що жоден зовнішній ресурс не був використаний у збірці.

Тепер ви можете подумати, що такий якісний результат вимагав довгого, детального та ретельного запиту, щоб провести AI-моделі через складнощі створення полірованого шутера від першої особи.

Подумайте ще раз.

Запит, що стояв за цим, складався з трьох коротких абзаців, опублікованих повністю на GitHub. Він наказав Opus 5 створити шутер на рівні останніх ігор Call of Duty, розподілити субагентів — працівників, кожен з яких має власну окрему пам'ять і вузьке завдання — для вирішення частин окремо, і продовжувати циклічно опрацьовувати кожну частину з окремим суворим критиком, поки вона не витримає порівняння з реальними кадрами Call of Duty у сліпому порівнянні. Результат, згідно із запитом, має бути «абсолютно досконалим».


Це розворот того, як інженери промптів навчали людей працювати. Порада під час буму віб-кодингу полягала в тому, щоб вказувати критерії замість прикметників: говорити, що означає «добре», замість того, щоб просто просити про це. Що код має враховувати, замість того, щоб казати «AAA».

Версія Шумера робить майже протилежне: вона просить своїх підагентів бути «абсолютно враженими», залишаючи фактичне визначення критику Opus 5, який він створив для себе.

Це було майже все завдання. Шумер пізніше написав, що він ніколи не вказував рендерер, не перелічував системи гри або не визначав, що має включати «якість рівня AAA». Він почав називати цей підхід Gauntlet Loop: передати агенту реальну, перевірювану планку замість розпливчастої інструкції, дозволити йому розділити завдання на дрібні частини та направити кожну частину через критика, який ніколи не бачить власних міркувань будівельника щодо його вибору.

Дві функції Claude Code несуть цей цикл. Субагенти запускаються в ізольованих контекстних вікнах з власними інструкціями та доступом до інструментів, тому критик, який оцінює модель зброї, не успадковує виправдання будівельника, чому вона виглядає саме так. Ultracode — це налаштування Claude Code, яке підштовхує модель до максимальних розумових зусиль і дозволяє їй писати власний план оркестрації, розподіляючи роботу між до 16 агентами одночасно, з обмеженням у 1000 на запуск.

Вбудований навик /loop від Anthropic, створений для повторюваних циклів виправлення-тестування-налаштування, саме він не давав процесу зупинитися, щойно гра починала виглядати пристойно. Шумер ніколи не вказував кількість раундів. Він дозволяв критику щоразу називати нову прогалину, а будівельник годинами гнався за нею, поки Шумер сам не закрив сесію.

Готова збірка працює на Three.js та звичайному WebGL2, приблизно 55 000 рядків коду, розподілених між 11 підсистемами. Кожна текстура, сітка, анімація та звук генеруються в браузері під час завантаження — без завантажених моделей, HDRI, файлів зображень або аудіофайлів. Опублікований журнал критика самого Шумера показує, як оцінка зростає з 3,59 з 10 до трохи вище 5, все ще відстаючи від реальної гри в кожному раунді.

Скептики припускали години прихованого ручного кодування, тому Шумер опублікував весь промпт і кодову базу. Саме тоді почали з'являтися наслідувачі.

Той самий трюк, три різні будівельники

Джеймс Альтучер, колишній менеджер хедж-фонду та подкастер, запустив ідентичний промпт і повідомив, що витратив «трохи більше десяти годин» і приблизно 1,3 мільйона токенів на Opus 5, щоб досягти результату. Його збірка, Operation Blackout, безкоштовно грається в браузері і виглядає приголомшливо.

Ви можете зіграти в цю гру тут.

Розробник Prompt Silo надіслав той самий запит флагманській моделі конкурента OpenAI, написавши: «Sol 5.6 Ultra з тим самим промптом» — Sol є топовим рівнем сімейства з трьох моделей GPT-5.6, які OpenAI зробила загальнодоступними 9 липня разом із дешевшими версіями Terra та Luna.

Розробник Леон Лін спробував протилежний підхід, використавши звичайний детальний промпт. Замість того, щоб копіювати коротку версію Шумера, він вирішив «зворотно розробити промпт для цієї гри», створивши документ із приблизно 20 розділів, у якому детально описано все: від фізики ганчіркової ляльки до каскадних карт тіней. Він подав його в Cursor, використовуючи звичайний Opus 5 на високому рівні зусиль, без підагентів і без ультракоду, і результат — шутер на вуличному ринку під назвою Dust Corridor — також працює в браузері та виглядає чудово.

Жодна з наступних збірок не пройшла сліпий тест, який Шумер провів на власному проєкті. Його журнал критика досі показує, що справжня Call of Duty виграє кожен раунд, який він записував — це планка, яку Алтучер і Atom Tan Studio переслідують з його точним триабзацним промптом, і та, яку Леон Лін переслідує приблизно з 20 власними розділами.

Скільки з цього насправді нового?

Агентні інструменти кодування, такі як Claude Code, пишуть програмне забезпечення так, як це міг би робити молодший інженер під наглядом: вони читають файли, запускають код, переглядають згенеровані скріншоти та передають частини роботи субагентам і критикам, які перевіряють результат на відповідність поставленій меті. Цей цикл є реальним, і Gauntlet Loop Шумера — це справжній спосіб його структурувати. Саме по собі це не доводить, що модель розробила гру з уяви, а не скомбінувала патерни коду, які вона вже засвоїла.

Three.js постачає власні елементи керування камерою з блокуванням вказівника як офіційний приклад, і цей базовий патерн — огляд мишею, рух WASD, рейкастинг для стрільби — був форкнутий і описаний у підручниках на GitHub, gists та форумах розробників понад десятиліття. Модель кодування, навчена на публічних репозиторіях, майже напевно бачила сотні, якщо не тисячі майже ідентичних шутерів, перш ніж прочитала промпт Шумера.

Це не робить Claude of Duty фейком, але робить заяву «створено з нуля» складнішою для повної довіри, тому сприймайте ці результати з часткою скептицизму.

Дослідники, які вивчають моделі генерації коду, мають назву для цієї ширшої проблеми: забруднення даних, коли модель добре виконує завдання головним чином тому, що майже ідентичні приклади вже були в її навчальних даних, а не тому, що вона зробила новий висновок.

Жодна зі збірок шутерів від першої особи не опублікувала перевірку на такий тип забруднення. Власний репозиторій Шумера дійсно містить творчість Клода, якщо це можна так назвати. Це причина читати «one-shotted a AAA game» як здатного агента, що працює в одному з найбільш задокументованих жанрів у програмуванні, а не як доказ того, що ШІ спроєктував шутер без попереднього досвіду, на який можна спертися.