Transcription
Вот представьте себе, вы, скажем, описываете идею приложения, да, а через какое-то время, бац, получаете готовый код и не сами пишите, а его сделал, ну, программный агент. Звучит, конечно, как фантастика, которая вот-вот случится, но всё никак. Но, похоже, сейчас что-то меняется. Мы как раз начинаем этот угол огибать.
Сегодня мы разбираемся с новой моделью от Open AI. Источник называет её GPT5 кокс. Что это вообще за штука и действительно ли она, а, ну, меняет правила игры? Да, да, именно так. И наш сегодняшний разбор, он строится на обзоре и тестах с YouTube канала Уроh. Автор там, похоже, одним из первых получил доступ, ну и проверил всё в деле. Наша задача ведь не просто пересказать, что он там увидел, а именно понять суть этого GPT5 кодекс, выделить главное, на что он способен, почему это важно, ну и посмотреть на примеры. Особенно для тех, кто, скажем так, не кодит профессионально, интригует.
Ну давай тогда соснов. Что же это за GPT5 кодекс? Источник говорит, новая модель Open AI. Хотя с названиями у них, да, бывает, путаница. Может, это пока рабочее имя, но главное, что она уже как-то доступна. Через что? Там упоминался кодекс CLI. Да, кодекс CLI - это интерфейс командной строки. И, похоже, это один из способов с ней поработать. Сам процесс, ну, как начать, судя по видео, довольно несложный. Автор копирует команду установки, ээ, вставляет в терминал. Ну, это стандартно. Потом нужно привязать свой аккаунт чат GPT. И, в общем-то, можно давать задание. В интерфейсе командной строки там даже показывают, какая модель работает, сколько ресурсов уходит. Вот он приводил пример, что-то вроде 613.000 токенов ушло на задачу. Это, ну, как бы мера усилий модели. И там ещё оставалось 56% контекстного окна, то есть памяти для текущей задачи. Ясно? То есть установка сама по себе не проблема.
Но, э, в чём всё-таки хайп? Почему именно эта модель вызвала такой интерес? Что в ней такого? Автор там выделяет несколько моментов. Они как бы вместе дают такой, ну, сильный эффект. Во-первых, это доступность, универсальность. Можно для облачных задач, можно кодревьюить, можно локально работать через ту же командную строку или там интегрировать с весд, например. Это важно, гибкость даёт. А, во-вторых, и вот это меня, честно говоря, зацепила идея бесшовного процесса. То есть я могу начать что-то делать на своём компе, а потом, ну, не знаю, уйти на обед, а задание передать агенту в облака, и он там сам работает. Вот-вот именно. И он там работает автономно, а ты потом приходишь и проверяешь результат. Это же совсем другой уровень взаимодействия получается. И это нас подводит к третьему пункту, возможно, самому главному. Автономность. То есть агент не просто выполняет команду, он может сам работать над сложной задачей долгое время. Автор говорит: "В Open AI были тесты, где агент работал над задачей больше 7 часов. Представляешь? Сам итерировал, ошибки находил, исправлял, пока не добился цели". В видео пример скромнее, но тоже показательный. 11 минут работы агента в облаке и на выходе почти 1.000 строк нового кода. И готовый пулреквест. 1тыся строк за 11 минут и пулреквест сам сделал, то есть запрос на включение кода в проект. Это, конечно, внушает, особенно если учесть, что автор видео сам говорит, он не профиразработчик. То есть получается барьер входа ниже становится. Похоже на то. И это, кстати, совпадает с цитатой руны из Open AI, который автор приводил. Что-то вроде сейчас для инсайдеров кажется, что взлёт самый стремительный. Мы больше не программируем, мы просто кричим на агентов кодекс. И он же говорит, что GPT5 кодекс уже 40% всего трафика кодексу не генерирует. Похоже, они там серьёзно прокачали обучение с подкреплением для кодинга. Ну то есть модель учится на своих же результатах. Работает код или нет?
Интересно, а про производительность что-то известно? Ну, кроме скорости написания кода? Да, автор ссылался на объяснение графика от Гнома Брауна, тоже из Open AI. Там любопытная вещь. На простых задачах новая модель аж в 10 раз быстрее может быть. Но что ещё интереснее, на сложных задачах, где надо подумать, она может наоборот думать вдвое дольше. То есть она как бы умнее, ресурсы распределяет. А экономичнее она на простых задачах? Да. Говорилось, что на 10% самых лёгких задач она тратит на 94% меньше токенов. Токенов - это та самая вычислительная валюта, меньше, чем модель GPT5 Medium. Наверное, вот это всё вместе, скорость, умное распределение ресурсов, автономность и вызвала такую реакцию. Автор заметил, что люди начали переходить с других моделей, ну, с того же Клоуда Tropic почти сразу, как получили доступ.
Хорошо, с этим понятно. А новые фишки? Ну, функциональные возможности, чем ещё удивляет? Одно из самых, пожалуй, заметных нововведений, которые показывали, в визуальный ввод. То есть модели можно теперь не только текст давать, но и картинки, скриншоты. Например, показал макет интерфейса и говоришь: "Сделай вот так". или обвёл бак на скриншоте. Поправь вот это. Ого, это же та самая аналогия из Starтрек, про который автор говорил, когда там просто пальцем тыкали в сломанную штуку почини. И опять эта фраза Руне про кричать на агентов. Похоже, это уже не совсем метафора. То есть это не просто картинку загрузить, а способ передать м ну какие-то неявные требования к дизайну. То, что текстом описывать долго и муторно, это же меняет сам подход к задачам. Вот именно мультимодальность действия. И это связано с другой важной штукой, самостоятельным решением проблем. Агент ведь не просто пишет код, он может сам браузер запустить, посмотреть, что там вышло, ну, видимо, анализируя страницу или делая скриншот, понять, что что-то не так, внести правки и так по кругу. Он даже может скриншот с результатом прикрепить к задаче на GitHub или к пулреквесту. Сам себе обратную связь даёт, получается. Ну, в каком-то смысле, да. Это и есть, как автор говорит, начало эпохи агентов. Задачи не просто выполняются, они как бы делегируются, и агент берёт на себя ответственность за результат, включая проверку итерации. Это потенциально сильно повышает точность на долгих, сложных задачах.
Звучит всё это круто в теории, а на практике источник ведь как раз приводил примеры тестов. Да, автор видео провёл несколько экспериментов, но сразу оговорка. Времени у него было мало, меньше суток с момента доступа, так что это не какие-то там стресс-тесты на гигантских проектах, а скорее, ну, проба пера на задачах разной сложности. Цель была нащупать, что он может, и как он их запускал. Было что-то особенное. Через терминал всё создавал папки там стандартно CDM CDIR. Потом запускал сам кодекс. Внутри можно выбрать модель. Модель - это важно. под разные задачи раная мощность нужна. Ещё настраивал уровень разрешений, от только читать до полного доступа. С полным доступом он предупреждает: "Надо осторожнее, агент ведь может команды на компе выполнять". И ещё момент: инструкции лучше всего давать через специальный файл agent MD. Модель, говорит, так лучше понимает структурированные инструкции. Логично.
Ну что ж, первый проект приложение для модуляции голоса. Задача, как я поняла, довольно замороченная. Менять голос в реальном времени по положению рук перед веб-камерой. То есть тут и видео, и жесты, и аудиообработка. И каков результат? Почти успех с первой попытки. Потребовалась небольшая доработка руками именно с выводом звука. Но основное отслеживание рук, применение эффектов заработало сразу. Он там показывал, левая рука двигается, меняется высота тона, правая эффект drй. Ну, соотношение чистого и обработанного звука. Учитывая сложность и что это почти одной командой сделано, автор сказал: "Это большой скачок вперёд". И правда впечатляет, сколько бы времени ушло у человека на такой прототип. Да уж, похоже на магию.
Так, второй проект - это больше для фана. Сайт в стиле игр девяностых, который типа продаёт суперинкт с кораблями летающими. Именно с этим, по словам автора, модель справилась проще простого. Буквально за минуты работающий фронт, и фоны в стиле, и кнопки, и даже отзывы клиентов, и нагенерил, FQ, страниц, там всякие политиконфиденциальности. Модель даже выдумала фейковый имеil для связи. В общем, автор решил, что для неё это было слишком легко. Сайт в стиле девяностых проще простого. Забавно. А там был какой-то работающий функционал или чисто визуал? Судя по описанию, акцент был на фронт оформления. Структура страниц. Про сложный ээкэнд речи не шло, но сам факт, что она быстро нагенерила кучу связанных страниц с контентом, это показательно.
Третий проект уже более практичный. Анализатор соотношения просмотров и лайков на YouTube. Идея, кажется, пришла после видео Lesttic Tipps, сработав на YouTube. Да, цель была сделать инструмент, который берёт данные с каналов через YouTube API и строит график соотношения лайков к просмотрам. Это уже требует и с внешним сервисом поработать, и данные обработать, и визуализировать. И что справился агент НФР была технкт. Соотношение показывалось где-то 5-7% и график генерировался автоматом. Сохранялся в PNG. Автор сказал ловко. Слик. Это показывает, что модель может не просто код писать, но из API интегрироваться, данные обрабатывать.
Четвёртый снова голос. Но теперь ассистент. Задача через Open AI API сделать голосового помощника записал голос. Транскрипция, ответ от модели, озвучка ответа. Так, да, и с этим в целом тоже получилось. Были там какие-то сложности с выводом звука, пришлось пару раз уточнить задание для агента, но главное подключение к API Open AI, работа со звуком, установка нужных пакетов с этим модель справилась хорошо.
И, наконец, пятый проект. Flapy Bird управлением руками. Это был как бы реванш, потому что прошлая модель GPT4 Codex Medium не смогла это сделать. Точно. Это была проверка, сможет ли новая, более мощная версия JPT. Автор ставил на стройку хай. То, что не смог предшественник, и ответ: "Да, смогла". Он показывал: "Машешь рукой, птичка в игре взлетает". Автор ещё пошутил, что играть так это физически тяжело. Почти тренировка. Но сам факт, что такое сложное взаимодействие, веб-камера, распознавание жестов, управление игрой в реальном времени было реализовано. Он снова назвал скачком вперёд. Возможно, это как раз связано с тем, что она лучше умеет итеративно отлаживать и планировать сложные штуки, о чём и говорили в Open AI.
Итак, пять разных проектов. Обработка аудио-видео в реальном времени, веб-разработка, работа спиi, голосовой ассистент, игра с необычным управлением. Довольно широкий спектр. Какие общие выводы у автора источника? Он, конечно, очень впечатлён, прямо воодушевлён, называет её новой любимой игрушкой. Особенно ему не нравится вот эта бесшовность процесса. Можно легко переключаться. Терминал, IDE, веб, телефон, плюс асинхронная работа агента. Вот это ему кажется ключевым.
Звучит почти идеально. А подводные камни? О чём-то он упоминал, кроме того, что нужно серьёзное тестирование, риски, сложности? Ну, главная оговорка - это, да, необходимость проверки профессионалами на больших, сложных, ну, может, корпоративных проектах. Его тесты, хоть и разные, но они все же такие относительно изолированные. Как модель себя поведёт в контексте огромной кодовой базы со сложными зависимостями, это пока вопрос. Потенциал огромный, но говорить о готовности к серьёзному продакшену, наверное, пока рано. Но даже так потенциал изменить сам ландшафт разработки кажется огромным, особенно для тех, кто не очень в коде, для стартапов, для быстрого создания прототипов. Вот на это автори делает упор. Барьер входа в создание софта, похоже, и правда снижается. Путь от идеи до работающего прототипа, он становится короче и, возможно, дешевле. Автор там даже прикидывал, имея про план, ну, условно, за 200 долларов в месяц, можно за этот месяц сделать рабочее приложение, то, что раньше требовало бы команды или месяцев учёбы. Он это называет демократизацией создания ПО, и его фраза: "Дорога от нуля до единицы" стала намного проще. Она очень точно это описывает. Это же открывает возможности для творчества, для реализации идей гораздо большему числу людей.
Что ж, давай подводить итоги нашего сегодняшнего погружения в мир GPT5 Codex, основанного на обзоре Весаро. Мы видим модель, которая показывает, ну, впечатляющую автономность, умеет понимать визуальные инструкции, сама ищет и правит ошибки и при этом отлично справляется с разными задачами от сайтов до игр с управлением жестами. И, что важно, делает это доступным для непрограммистов. Да, и главный вывод, наверное, - это потенциальный сдвиг в самом подходе к разработке. От парадигмы пишем код строка за строкой к парадигме делегируем задачу, описываем результат высокого уровня. Это не просто быстрее, это, ну, иначе.
И, конечно, сразу вопрос: а как такие инструменты повлияют на другие области и не только на софт? И вот здесь как раз мысль для размышления, которая выходит за рамки обзора. Если представить, что это только начало, что появятся реально автономные агенты, которые смогут не просто задачи выполнять, а учиться на больших проектах, итерировать и решать сложные проблемы днями или неделями без надзора? Как это может изменить не просто отрасли, а саму суть инноваций? Что будет, когда вот это кричать на агентов, как сказал Руни, станет основным способом создавать новое?