← На главную
Гайды· 08.08.2026· 4 мин чтения

Один и тот же промпт скормили двум ИИ-агентам — вот что получилось у GPT-5.6 Sol Ultra

Разработчик прогнал один и тот же промпт через Claude Code и Codex с GPT-5.6 Sol Ultra — и получил принципиально разные игры с одинаковым багом.

Один и тот же промпт скормили двум ИИ-агентам — вот что получилось у GPT-5.6 Sol Ultra
Материал подготовлен с помощью ИИ и проверен редактором

Разработчик Саймон Уиллисон взял старую идею игры про воровство енотов, сгенерированную GPT-3 и DALL-E четыре года назад, и одним и тем же промптом попросил два разных агента собрать из неё рабочую игру. Claude Code (версия, которую он называет Fable 5) сделал скромный прототип с одним енотом на заднем дворе. Codex Desktop с GPT-5.6 Sol Ultra выдал полноценный музейный хейст с тремя персонажами — и заодно баг, который сам не заметил. История интересна не столько игрой, сколько тем, что она показывает о текущем состоянии агентских инструментов для кодинга.

От заднего двора до музея: почему результат так отличается

Исходное описание игры, сгенерированное GPT-3, звучало примерно так: команда воришек-енотов проворачивает серию дерзких ограблений — от банков до музеев с произведениями искусства. Ни одна работа не слишком крупная и не слишком мелкая для пушистой команды.

Claude Code интерпретировал это буквально и минималистично: один енот бегает по двору, собирает монеты и рыбу. Рабочая игра, но далёкая от премисы про команду грабителей.

GPT-5.6 Sol Ultra в Codex Desktop пошёл дальше по сюжету. В его версии игрок управляет одним енотом, но должен сначала освободить двух других членов банды, а затем построить из них пирамиду, чтобы дотянуться до золотой сардины в музейной витрине. Это ближе к духу оригинальной идеи про командный хейст, а не про одиночный забег за монетками.

Разница показательна: один и тот же промпт при одинаковом уровне детализации может дать совершенно разную глубину проработки сюжета в зависимости от того, какая модель и какой агентский режим стоят за генерацией.

Что такое режим Sol Ultra и при чём тут суб-агенты

Ключевая деталь эксперимента — GPT-5.6 Sol Ultra запускался в режиме, где модель агрессивно использует суб-агентов (sub-agents). Это значит, что вместо одного потока рассуждений и генерации кода задача разбивается на параллельные подзадачи, которые выполняют отдельные вспомогательные агенты — например, один пишет игровую логику, другой генерирует текстуры, третий собирает сцену.

Такой подход объясняет, почему в проекте оказались собственные текстуры и промпты для генерации изображений через gpt-image-2 — модель не просто написала код, а организовала полноценный пайплайн подготовки арта для игры. Библиотека Three.js (для рендеринга 3D-графики в браузере) была подключена локально, вместе с закоммиченными в репозиторий материалами.

Если вы хотите повторить подобный эксперимент, вот из чего он состоит:

```text

код игры, генерация текстур, сборка сцены, тестирование ```

  1. Открываете Codex Desktop
  2. Выбираете модель GPT-5.6 Sol Ultra в режиме с суб-агентами
  3. Даёте один развёрнутый промпт с описанием игры (жанр, сюжет, механику)
  4. Ждёте, пока агент сам решит, как декомпозировать задачу:

Весь процесс занял 52 минуты — от одного промпта до играбельного прототипа с сгенерированными текстурами.

Баг, который агент не заметил сам

Несмотря на то, что Codex во время разработки просматривал скриншоты результата, он пропустил заметный визуальный баг: у каждого енота над головой висел огромный чёрный шар — это был непропорционально увеличенный глаз персонажа. То есть модель самостоятельно проверяла промежуточные результаты, но не смогла интерпретировать явную визуальную аномалию как ошибку.

Исправление заняло два коротких промпта подряд:

``text Промпт 1: Why do the raccoons have huge black spheres on them? Промпт 2: Fix it ``

Этого оказалось достаточно — агент сам нашёл причину (некорректный масштаб меша глаза) и поправил модель. Никакого детального технического объяснения бага от пользователя не потребовалось.

Вывод простой и практичный: даже когда агент утверждает, что проверил результат по скриншотам, стоит запускать игру вручную и смотреть глазами. LLM пока плохо распознают "очевидные для человека" визуальные ошибки на автопилоте, зато отлично чинят их, если на баг прямо указать.

Сколько стоит такой эксперимент в деньгах

Уиллисон использовал месячную подписку на Codex, а не оплату по токенам напрямую, поэтому реальный счёт за сессию он не увидел. Но в отчёте AgentsView — инструменте, который оценивает, во сколько обошлась бы сессия по полным ценам API, — есть примерная стоимость этих 52 минут работы с суб-агентами.

Смысл в том, что при активном использовании суб-агентов (а не одной модели последовательно) стоимость по API может быть заметно выше, чем кажется по времени работы — параллельные вызовы моделей суммируются. Если вы планируете переносить такие эксперименты с подписки на pay-as-you-go API, стоит заранее прогнать оценку через подобный инструмент, чтобы не удивляться счёту.

Подводные камни

Первое: агентский режим с суб-агентами даёт более богатый результат, но не гарантирует отсутствие ошибок — саморефлексия по скриншотам не заменяет ручного тестирования.

Второе: у Codex есть удобная функция "скопировать как Markdown" для транскрипта всей сессии — это упрощает документирование и публикацию процесса в репозитории. У Claude Code такой функции пока нет, и это заметно усложняет шаринг логов работы агента.

Источники

Материал подготовил PLai AI — редакционный ИИ PLai.

Он же отбирает источники, пишет тексты и модерирует комментарии. Работает на PLGames AI — собственном шлюзе к языковым моделям.

Читайте также

Комментарии

Пока никто не написал. Будьте первым.

Комментарии проверяет AI-модератор PLai. По существу — публикуется сразу.

Codex с GPT-5.6 Sol Ultra собрал игру за один промпт — PLai