📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

GPT-5 Codeex: автономное кодирование и ревью — на новом уровне

Yersham24:46

Transcription

Приветствую. Сегодня у нас, ну, такой глубокий разбор материалов по очень заметному анонсу в мире искусственного интеллекта для разработчиков ПО. Речь пойдёт о GPT5, кодекс от Open AI.

>> Да, привет. Тема горячая. Анонс действительно наделал шума.

>> У нас есть выдержки из, скажем так, обсуждения этого инструмента. И наша задача сегодня копнуть глубже, разобрать ключевые моменты, понять, что там действительно нового, чем он отличается от того, что было, и главное, как это всё может повлиять на работу программистов. Вот прямо в деталях.

>> Совершенно верно. Цель не просто новости пересказать, этого и так полно, а именно извлечь суть из той информации, что есть, посмотреть на заявленное улучшение, производительность, автономность, вот это вот ревью кода, о котором много говорят. В общем, попытаемся сложить, ну, такую целостную картину, насколько это возможно, по имеющимся данным.

>> Отлично. Тогда давай начнём прямо со снов. Open AI выпустила GPT5 кодекс. Источники описывают его как версию GPT5, но специально оптимизированную для агентной разработки. Agent coding. Что это вообще значит на практике? Вот это слово агентный.

>> Агентство, да, это, пожалуй, ключевое слово здесь. Оно предполагает, что инструмент действует, ну, более самостоятельно. не просто как умное автодополнение или ответ на прямой запрос, а как некий агент, который может взять задачу и сам итеративно над ней работать, выполнять комплексные шаги, возможно, даже принимать какие-то решения по ходу.

>> То есть не просто напиши мне функцию, а что-то большее.

>> Именно источники как раз указывают, что кодекс спроектирован и для таких быстрых интерактивных сессий, ну, помочь что-то быстро поправить. и что важнее для длительной автономной работы над сложными проектами. Это уже не просто помощник, это заявка на партнёра по разработке, что ли. И подчёркивается, что его обучали с акцентом на реальные задачи инженерии ПО, то есть не на абстрактных примерах, а на том, с чем разработчики сталкиваются каждый день.

>> И сразу же вот в этом контексте агентственности упоминается ревью кода. Заявлено, что он способен выявлять критические ошибки ещё до того, как они попадут к пользователям. Насколько это серьёзно?

>> Ну, потенциально это очень серьёзно. Ревью кода - это ж бутылочное горлыш во многих командах требует времени, внимания, квалификации. Если и сможет взять на себя хотя бы часть этой работы, особенно поиск таких, знаешь, неприятных багов, уязвимостей, это может, ну, очень сильно повлиять и на качество продукта, и на скорость разработки.

>> Но ведь есть риск, что он что-то пропустит или, наоборот, будет слишком придирчиво.

>> Безусловно, риск есть, идеальных инструментов не бывает. Вопрос в том, насколько он будет точен и надёжен, и как команды будут его использовать. скорее всего, не как полную замену человека, а как очень мощный инструмент предварительной проверки, который, ну, скажем, отлавливает 80% проблем, а человек уже смотрит на оставшиеся 20% и на общую архитектуру. Но даже это огромная помощь.

>> Понятно. Давай теперь про интеграцию. Где с ним можно будет работать? Ведь не только в чат GPT же.

>> Нет, конечно. И это очень важный момент. Они явно стремятся сделать его максимально доступным в привычной среде. В материалах перечисляют, но, во-первых, терминал, командная строка, CLI, это для многих важно. Во-вторых, IDE. Конкретно упоминается VS-код через расширение курсор и говорится про VS-код Marketplace, то есть интеграция в самую популярную IDE.

>> То есть прямо в редакторе кода можно будет с ним взаимодействовать.

>> Да, именно так. Не нужно будет переключаться между окнами. Плюс, конечно, стандартный веб-интерфейс chat GPT. Интеграция с GitHub - это тоже очень важно для рабочих процессов, связанных с контролем версий, пулреквестами. И что немного удивило, даже мобильное приложение Chat GPT для iOS упоминается.

>> Хм, кодить на телефоне? Но полноценно кодить, наверное, нет. Но, возможно, для ревью кода на ходу или для каких-то быстрых команд агенту трудно сказать пока, но сам факт наличие интересен. Главное вот эта широкая интеграция - это стратегия снижения барьеров. Инструмент приходит к разработчику, а не наоборот. Это всегда ключевой фактор для принятия технологии.

>> Да, согласна. Программисты обычно не любят менять свои привычные инструменты.

>> Вот именно. Поэтому интеграция в ВС-код, в терминал, в GitHub, это очень правильный ход.

>> Хорошо, давай перейдём к самому интересному, производительности цифры. Начнём с бенчмарка SWBCH Verified. Он, как я понимаю, меряет способность решать реальные задачи с GitHub. GPT5 кодекс High показывает 74,5%. А обычный GPT5,8.

>> Да, вот эти цифры, смотри, прирост есть 74,5 против 72,8. Это заметно, но не выглядит как какая-то революция, правда? Меньше двухпроцентных пунктов.

>> Да, не ошеломляет.

>> Это говорит о том, что, вероятно, по общему широкому кругу задач кодирования, ну, модель стала лучше, но не то, чтобы на порядок. Однако дьявол, как всегда в деталях. Нужно смотреть на другие метрики, более специфические.

>> Какие именно? На что ещё стоит обратить внимание в этих материалах?

>> А вот смотри, задача рефакторинга кода, то есть переработка уже существующего кода, улучшение его структуры, читаемости без изменения функциональности. И вот тут цифры совсем другие. Кодекс High 51,3%, а GPT5 H 33,9%.

>> Ого! 51,3 против 33,9. Это же, ну, почти в полтора раза лучше.

>> Вот именно, почти в полтора раза. И рефакторинг, это ведь то, чем разработчики занимаются постоянно, особенно в больших старых проектах. Это часто сложная, неблагодарная работа. И вот такой скачок производительности именно здесь, это очень показательно.

>> То есть он лучше понимает уже написанный, возможно, запутанный код.

>> Похоже на то. Это как раз намекает на ту самую специализацию, о которой говорили в начале, что кодекс не просто генерирует код с нуля, а его специально обучали на задачах работы с существующей кодовой базой. И если это так, то это может быть реальным инструментом для борьбы с так называемым техническим долгом. Представляешь, запускаешь кодекс на старый модуль, и он его приводит в порядок.

>> Звучит заманчиво. Эта способность работать со сложным кодом, наверное, как-то связана и с заявленной автономностью, потому что цифры там тоже впечатляют. Источник говорит, что в тестах кодекс работал автономно над большими задачами, более 7 часов подряд.

>> Да, 7 часов. Эта цифра действительно выделяется. Это, ну, очень много для автономной работы и агента над одной задачей. Автор исходного материала тут верно замечает, что важны два аспекта. Первый, как долго агент может работать без вмешательства человека, а второй, насколько продуктивно он это делает за это время. Одно дело просто крутиться 7 часов, другое за эти 7 часов реально решить сложную инженерную проблему.

>> То есть он не просто ждал команд, а сам итерировал, исправлял ошибки.

>> Заявлено именно так, что он сам итерировал реализацию, натыкался на ошибки в тестах, исправлял их снова. пробовал и так до тех пор, пока не добивался успешного результата. Это и есть проявление вот этой агентности, способность не просто выполнить шаг, а удерживать цель и самостоятельно двиться к ней через препствия. Если это действительно так работает на сложных задачах, то это, ну, качественно новый уровень.

>> В источнике для сравнений упоминали Raplit Agents 3. У них было 200 плюс минут, а тут 7 часов, это же больше 420 минут,

>> да? Сравнение показывает значительный прогресс именно в продолжительности автономной работы. Но, повторюсь, главное не только длительность сама по себе, а то, что он успевает сделать за это время. Если за 7 часов кодекс может выполнить работу, на которую у человека ушёл бы, скажем, целый день или больше, вот это уже меняет правила игры.

>> Интересно, а как он при этом расходует ресурсы? Есть любопытная деталь про токены. Говорят, для 10% самых простых запросов, ну, отсортированных по количеству сгенерированных токенов, кодекс используют на 93,7% меньше токенов, чем GPT5.

>> Да, это очень интересно. Почти 94% экономии на простых задачах. Это значит, что для рутинных лёгких вещей он работает ну очень эффективно. А вот дальше самое любопытное. Для 10% самых сложных запросов он наоборот тратит вдвое больше времени. На что? На обдумывание, на редактирование своего же кода, на тестирование, на итерации.

>> То есть он как бы понимает, когда задача простая и решает её быстро и дёшево, а когда сложная и тогда задумывается, тратит больше усилий.

>> Именно так это выглядит. Это указывает на адаптивность модели. Она не просто молотит токены с одинаковой интенсивностью. Она экономит ресурсы на простых вещах и, так сказать, вкладывается, концентрирует усилия там, где это действительно нужно. Это похоже на то, как человек работает. Рутину делаем быстро, а над сложной проблемой сидим и думаем. Модель не просто генерирует, она размышляет над кодом, когда это необходимо.

>> Очень разумный подход. Давай вернёмся к ревью кода. Мы его уже затрагивали. В источниках прямо подчёркивают, что кодекс специально для этой задачи обучался. Как именно он проводит ревью? Что он ищет?

>> Заявлено, что это не просто проверка синтаксиса или стия, он ищет именно критические недостатки. Для этого он, во-первых, анализирует всю кодовую базу, чтобы понять контекст изменений. Не только сам изменённый файл, но и как он связан с другими частями системы. Во-вторых, он учитывает зависимости между модулями. В-третьих, он может даже запускать код и тесты, чтобы проверить корректность предложенных изменений на практике.

>> Звучит очень глубоко. Это не просто линтер какой-нибудь.

>> Совершенно верно. Это попытка имитировать процесс ревью, который проводил бы очень дотошный и знающий разработчик. И опять же есть цифры, подтверждающие специализацию.

>> Какие на этот раз?

>> Смотри, некорректные или, ну, скажем так, шумные, нерелевантные комментарии. У Коx High их всего 4,4%, а у GPT 5 High было 13,7%.

>> То есть шума стало в три раза меньше,

>> да? А теперь доля действительно важных, высокоимпактных комментариев, которые указывают на серьёзные проблемы или предлагают ценные улучшения, у Кодексхай она выше. 52,4% против 39,4% у GPT5 High.

>> Подожди, получается, комментариев в целом стало меньше. Но при этом доля полезных комментариев выросла.

>> Именно. И общее количество комментариев на один пулреквест пиар, то есть на одно предложение изменений, у кодекс даже ниже. То есть он не заваливает разработчика куче мелочей, а фокусируется на главном. Меньше комментариев, но они более ценные. Качество над количеством.

>> Это же просто мечта любого разработчика, которому делают ревью, получать только важные замечания.

>> Ну да, похоже на то. Источник тут проводит интересную параллель с людьми-ревьюрами. Отмечается, что далеко не каждый человек-ревьюер физически способен или имеет время вкладывать такой уровень усилий в анализ каждого PR, особенно в больших командах, где пиары идут потоком. А кодекс позиционируется как инструмент, который может обеспечивать вот такой тщательный анализ постоянно для каждого изменения. Он сверяет заявленную цель пиар, что хотели изменить с реальными изменениями в кодес. Он смотрит на всю базу кода на зависимости.

>> Но всё-таки не страшно ли доверять машине такую критическую вещь, как поиск багов? Вдруг пропустит что-то важное.

>> Страшно, конечно. И никто, я думаю, пока не предлагает полностью заменить людей. Это скорее инструмент помощник. Очень мощный помощник. Представь, он делает первичный проход, отлавливает кучу всего, от глупых опечаток до потенциальных уязвимостей. А человек-ревьюер уже может сконцентрироваться на более высокоуровневых вещах. Архитектура, логика, соответствие бизнес-требованиям. То есть работа ревьюера не исчезает, но становится другой, менее рутинной. И сам факт, что Open AI, как они заявляют, используют кодекс для ревью подавляющего большинства своих внутренних пиар.

>> Они сами его используют на себе. Да, это называется догдинг, использование собственного продукта. И говорят, что он ежедневно выявляет сотни проблем, часто ещё до того, как ревью начнёт человек. Это, ну, самый сильный аргумент в пользу его практической ценности, если создатели сами на него полагаются в своей работе.

>> И даже есть команды Colxview, чтобы его вызвать в пиар. И можно указать фокус, например, на уязвимости. Да, упоминается и такое: возможность дать ему команду прямо в интерфейсе GitHub и даже указать, на чём сосредоточиться: безопасность, производительность, стиль кода. Это даёт разработчику контроль над процессом.

>> Понятно. В материалах ещё упоминается ID Winsorf. Что это такое и как связано с кодекс? Какая-то реклама.

>> Ну, судя по описанию в источнике, да, это похоже на спонсорский контент или рекомендация автора. Говорится, что Winorf - это одна из IDE, где можно опробовать кодекс. Её называют самой мощной агентной IDE. Отмечается связь этой IDE с компанией Cognition - это те, кто сделал известного EIгента Devon. Видимо, Cognition приобрела Winsurf. Упоминаются какие-то их фичи: Deepвики, Vipe, Replace, магазин MCP, продвинутая память. Вероятно, всё это нацелено на лучшую работу с агентами вроде кодекс или деван. То есть это сторонние ID, которые интегрируется с кодекс.

>> Похоже на то. Мы здесь просто передаём информацию из источника, как она есть. Оценить саму IDA мы не можем, но в связь с кодекс и агентственность там подчёркивается.

>> Хорошо, понятно. Кроме ID обновлялся инструмент командной строки кодекс CLI. Что там изменилось?

>> Да, для тех, кто предпочитает терминал, улучшили отображение вызовов инструментов и вот этих диф разлий в коде. должно стать нагляднее. И ещё доработали режимы одобрения действий агента. Это важно для безопасности.

>> Какие там режимы?

>> Первые. Агент может только читать код и предлагать изменения, но каждое его действие, которое что-то меняет, требует явного одобрения пользователя. Самый безопасный режим. Второй авто. Агент может свободно работать внутри своего рабочего пространства, своего проекта, создавать файлы, менять код. Но если он хочет сделать что-то вне проекта, например, скачать что-то из интернета или измедить файлы в другой папке, он запросит одобрение. И третий Full Access. Полный доступ. Агент может читать любые файлы на компьютере, выполнять любые команды, ходить в сеть. Самый мощный, но и самый рискованный режим.

>> Выглядит как разумная градация. Можно выбрать уровень доверия.

>> Именно. Особенно в корпоративной среде, где есть политики безопасности или при работе с каким-то очень чувствительным кодом, важно иметь такой гранулированный контроль. Ещё упоминается техническая деталь сжатие состояния диалога. Это чтобы агент не забывал контекст при очень длинных сессиях работы, тех самых многочасовых.

>> А что насчёт скорости? Часто такие инструменты бывают медленными?

>> А вот тут очень важный момент. заявлено огромное улучшение производительности именно облачной инфраструктуры, на которой всё это работает. Благодаря кэшированию контейнеров, ну, это технические детали, медианное время выполнения новых задач и последующих шагов сократилось на 90%.

>> На 90%, это же колоссально,

>> да? Это очень много. Скорость отклика - это критически важно для удобства работы. Если ты даёшь команду и ждёшь ответа минуту, это убивает весь поток. А если отклик почти мгновенный, то взаимодействие становится гораздо более, ну, естественным, плавным. Снижение задержки на 90% - это может кардинально изменить пользовательский опыт.

>> Здорово. И появились ещё какие-то новые способности у самого агента, что он ещё научился делать?

>> Да, есть пара интересных моментов. Во-первых, автоматическая настройка рабочего окружения. Кодекс теперь умеет сканировать проект, искать стандартные скрипты, настройки Setup scripts и сам их выполнять. Если у него есть настроенный доступ в интернет, он может сам устанавливать нужные зависимости, например, через pipinall для Python или другие менеджеры пакетов.

>> То есть ему даёшь ссылку на репозиторий, а он сам всё скачает, настроит и будет готов работать.

>> По сути, да, или как минимум попытается это сделать. Это ещё один шаг к полной автономности. Современные проекты часто требуют сложной настройки окружения, установки кучи всего. Если агент может взять эту рутину на себя, это огромная экономия времени и нервов разработчика.

>> И ещё одна функция упоминалась довольно неожиданная про браузер.

>> А, да, вот это очень любопытно. Кодекс может запустить собственный экземпляр браузера. Зачем? Чтобы посмотреть на результат своей работы. Например, если он генерирует веб-страницу, он может её открыть в этом браузере, увидеть, как она выглядит, и даже больше. Он может сделать скриншот этой страницы и приложить его к задаче или к пулреквест на GitHub.

>> То есть он не только код пишет, но и может визуально оценить результат, сделать скриншот.

>> Получается, что так, это уже выход за пределы чисто текстового взаимодействия с кодом. Это элементы гораздо более сложных агентных систем, которые могут взаимодействовать с визуальным представлением. Представь, агент поправил стили CSS, запустил браузер, увидел на скриншоте, что кнопка уехала или цвет не тот, и сам внёс исправление в CSS. Это уже похоже на то, как работает человек, фронтендер. Замыкается цикл, код, визуал, оценка, новый код.

>> Ух ты, это действительно впечатляет. Прямо как в фантастике немного. Ну, пока это, наверное, базовые возможности, но направление мысли очень интересное.

>> Хорошо, мы разобрали возможности, производительность, интеграцию. А как всем этим пользоваться? Какая модель доступа и сколько это стоит?

>> Модель доступа многоуровневая. Она интегрирована в существующие подписки GPTT Plus, Pro, Бизнес, EDU и Enterprise. То есть для широкого круга пользователей от индивидуальных до корпоративных. Но есть какие-то ограничения. Нельзя просто так пользоваться безлимитно.

>> Судя по источникам, есть нюансы. Для планов плюс ЭEDУ и бизнес говорится, что они покрывают несколько сфокусированных сессий кодинга каждую неделю. Звучит так, будто это рассчитано на, ну, эпизодическое использование. помочь с конкретной сложной задачей, провести ревью, но не для постоянной работы в течение всего дня.

>> А для тех, кому нужно больше, упоминался план Pro за 200 долларов в месяц.

>> Да, вот план Pro позиционируется уже иначе. Его описывают как инструмент для полноценной рабочей недели, для работы над несколькими проектами. Источник даже использует такую аналогию, что это как будто у вас появился дополнительный разработчик в команде за эти деньги. То есть это уже явно для профессионалов, которые собираются использовать кодекс интенсивно, каждый день.

>> А для компаний, для бизнеса,

>> для плана бизнес есть опция докупать кредиты, если лимитов стандартной подписки не хватает. То есть можно платить за дополнительное использование. А для самого крупного плана Enterprise предлагается общий пул кредитов на всю организацию, и компания платит только за то, что реально использовали её разработчики. Это гибкие модели, которые позволяют Open AI адресовать потребности разных сегментов рынка от энтузиастов и студентов до огромных корпораций.

>> Понятно. Ну что ж, мы довольно подробно разобрали все аспекты, которые были в материалах. Давай попробуем подвести итог. Что же такое GPT5 кодекс, если свести всё вместе? Какой главный вывод?

>> Главный вывод, пожалуй, такой. GPT5 Codex, судя по всему, что мы обсудили, это не просто очередное инкрементальное улучшение языковой модели для кода. Это скорее заявка на новую парадигму, вот ту самую агентную разработку, инструмент, который может действовать гораздо более автономно и комплексно.

>> Какие ключевые черты ты бы выделил?

>> Ну, во-первых, конечно, повышенная агентность и автономность. Вот эти 7 плюс часов работы над сложной задачей - это знаковый показатель. Во-вторых, значительный прирост производительности в очень важных практических задачах. Рефакторинг и особенно ревью кода. Причём ревью с акцентом на качество, а не на количество замечаний. В-третьих, адаптивное использование ресурсов. Экономия на простом, концентрация на сложном. В-четвёртых, глубокая интеграция в экосистему разработчика IDE, терминал GitHub. Это критически важно для принятия. В-пятых, огромное ускорение инфраструктуры, что делает работу с ним комфортной. Ну и плюс вот эти новые способности: автоматическая настройка окружения, взаимодействие с браузером, визуальная оценка. Всё это складывается в картину очень мощного инструмента.

>> Да, энтузиазм автора исходного материала по поводу этих возможностей становится понятен после такого разбора. Звучит действительно как серьёзный шаг вперёд.

>> Абсолютно. И это, знаешь, подводит нас к такому, ну, финальному вопросу для размышления, который вытекает из всего нашего обсуждения. Вот если представить, что такие ИИ агенты действительно станут обыденностью. Агенты, которые могут не просто писать код по команде, а автономно работать часами над сложной задачей, глубоко анализировать и ревьюить весь проект, сами настраивать себе окружение, ставить зависимости, запускать тесты, даже смотреть на результат в браузере.

>> Да.

>> Что тогда? А тогда вопрос: как это изменит саму профессию разработчика? Я не говорю о полной замене, это вряд ли в обозримом будущем, но о смещении акцентов в работе. Может быть, основная задача разработчика будущего - это не столько писать сам код руками, сколько правильно ставить задачи этим иагентам контролировать их работу, интегрировать созданные ими компоненты, решать высокоуровневые архитектурные проблемы, которые и пока не может. Какие навыки станут самыми востребованными? Навыки прумптнжиниринга для ИИ. Умение декомпозировать большие задачи для агентов, способность критически оценивать результаты работы ИИ.

>> Хмм, действительно, фокус может сместиться с как написать, на что нужно сделать и как проконтролировать. Интересная мысль.

>> Вот именно. Это важный вопрос, над которым, я думаю, стоит задуматься всем, кто связан с разработкой ПО. Как мы будем работать вместе с такими инструментами?

>> Да, определённо есть над чем подумать. На этой ноте, пожалуй, и завершим наш сегодняшний глубокий разбор анонса GPT5 кодекс. Спасибо за интересную беседу.

>> Спасибо. Было очень интересно это всё обсудить.