Transcription
Мы наконец-то получили облачный кодирующий агент от OpenAI, и они называют его Codex. Это даёт нам первое представление о том, как будет выглядеть совместное кодирование в будущем. И также почему сейчас важнее, чем когда-либо, начать изучать кодирование. Сейчас это может быть спорное мнение, поэтому я объясню это позже в видео. Но сначала, у OpenAI огромная проблема, и это наименование этих систем. Так что Сэм Альман написал в твиттере это: «Мы назовём его лучше, чем ChatGPT на этот раз, если он станет популярным». Ну, я не думаю, что они хорошо поработали. Как кто-то отметил сегодня, OpenAI выпустила Codex, который работает на Codex One, специализированной версии OpenAI O3. Его не следует путать с Codex или моделью, выпущенной в 2021 году, или Codex, инструментом CI, выпущенным в прошлом месяце.
Теперь, шутки в сторону, это кажется очень интересной реализацией, и это может стать альтернативой чему-то вроде Devon от Cognition Lab. Эта система облачная, очень похожая на то, что… Теперь, шутки в сторону, это кажется очень интересной реализацией, и это может стать альтернативой чему-то вроде Devon от Cognition Lab. Эта система облачная, очень похожая на то, что Coon Lab предлагает в виде Devon. И вы можете запускать множество параллельных задач. Так что это очень отличается от других IDE, таких как Serf или Cursor, как по функциональности, так и по тому, как пользователи взаимодействуют с системой. Lab предлагает в виде Devon. И вы можете запускать множество параллельных задач. Так что это очень отличается от других IDE, таких как Serf или Cursor, как по функциональности, так и по тому, как пользователи взаимодействуют с системой.
В этом обзоре мы посмотрим, как работает эта система. Мы также рассмотрим некоторые из её сильных и слабых сторон, и что люди говорят о ней. Мнения очень разделились, и я также поделюсь некоторыми своими мыслями о будущем кодирования. Итак, давайте быстро взглянем на некоторые интересные моменты в самом блоге. Итак, одна из вещей заключается в том, что эта модель является точно настроенной или оптимизированной версией O3 для программной инженерии. Так что это не совсем новая модель или система сама по себе. И цель этой системы - быть совместным агентом. Который будет работать вместе с разработчиком. Таким образом, разработчик может назначать ему задачи, и он будет выполнять эти задачи, а затем возвращаться с реализацией, и пользователь должен принять эти изменения или реализацию функций, прежде чем он сможет отправить PR. Как они указывают, задача может занять от одной минуты до 30 минут, и тогда пользователь сможет отслеживать ход выполнения Codex. Так что очень похоже по функциональности на Devon.
Вот как это должно работать. Это будет доступно в интерфейсе ChatGPT, как вы можете видеть здесь. Но вам просто нужно подключить репозиторий GitHub или учётную запись GitHub к нему, чтобы он действительно имел доступ к вашей учётной записи. Сейчас это доступно на Pro и Enterprise. Скоро появится и на Plus, но мы не знаем, когда это произойдёт. Итак, вы собираетесь подключить репозиторий GitHub. Внутри репозитория GitHub вам нужно создать файл Agent.md, в котором будет набор инструкций о том, что представляет собой репозиторий, очень похожий на правила курсора или правила в OneSerf. Таким образом, модель или агент будет смотреть ваш репозиторий GitHub. Он будет настраивать среды, а затем открывать песочницу в облаке OpenAI. Ничего не работает локально. Всё происходит в облаке, и так как всё работает в облаке, вы можете запускать параллельные задачи. Так что это очень удобная функция, и вы можете задавать вопросы. Вы можете назначить задачу по внедрению новой функции в вашей кодовой базе или попытаться выяснить, есть ли какие-либо ошибки в кодовой базе, так что действительно интересные функции. Всё, что вам нужно сделать, это просто описать вашу задачу. Система создаст новую песочницу, как я уже сказал, а затем покажет вам весь свой прогресс того, что именно происходит, и вы, как пользователь, имеете полный контроль. И вам нужно будет действительно объединить эти изменения в виде PR, который он создаст для вас.
Вот пример того, как будет выглядеть файл Agent.md. Опять же, это просто набор инструкций о том, что именно вы хотите, чтобы модель сделала. Теперь, как и хороший программист, он создаст модульные тесты, запустит их, и когда эти модульные тесты пройдут, он создаст отчёт и, возможно, создаст PR для вас, который вы можете проверить сами или ваша команда может проверить и объединить запрос на вытягивание. Теперь вопрос в том, насколько хороша эта новая система кодирования агента Codex? Ну, они предоставили несколько разных бенчмарков, и они также показывают проблему с этими бенчмарками. Вот набор SW Bench Verified. Теперь, если вы ограничите его только одной попыткой решения конкретной задачи, то он определённо лучше, чем O3 на высоких настройках. Однако, если вы увеличите количество попыток, которые могут предпринять Codex и O3 High, на самом деле разница в производительности не так уж велика. Особенно он как бы насыщается примерно на четырёх попытках, потому что разница незначительна. Вот почему у OpenAI есть свой собственный внутренний бенчмарк задач программной инженерии. На этом бенчмарке он определённо показывает относительно большее улучшение по сравнению с O3 High. На трёх бенчмарках они говорят, что им пришлось отбросить 23 образца, которые не были работоспособны на внутренней инфраструктуре, а Codex One тестировался при максимальной длине контекста 192 000 токенов и средних усилиях рассуждения, что является настройками, которые будут доступны всем сегодня. Как кто-то на X отметил, с точки зрения производительности на SW Bench, это не кажется таким уж отличным от O3. Вот Эйден из OpenAI. Он говорит: «SW Bench — это серьёзно несовершенная цель, так же как 98 на MMLU страшнее, чем 95, потому что мы знаем, что некоторые вопросы неверны».
Теперь имейте в виду, SW Bench Verified был создан в сотрудничестве с OpenAI. Так что это вызывает вопрос о том, насколько хороши эти бенчмарки на самом деле, верно? Где угодно. Зачем бы вам тестировать его на бенчмарке, который, как вы знаете, несколько несовершенен? А O3 уже невероятно способен. Codex One предназначен для того, чтобы быть более полезным и лучшим продуктом, который создаёт больше ценности для пользователя. Хорошо, теперь вопрос, сколько больше ценности. Это действительно зависит от того, кого вы спрашиваете. Вот несколько примеров. Вот Мэтт. Он говорит: «У меня был доступ к Codex некоторое время. Я не потратил столько времени, сколько хотел бы, но когда он работает, он мощный. Лучше всего подходит для задач бэкенда по моему опыту». Теперь я заметил, что многие люди, у которых был ранний доступ, говорят, что когда он работает, он действительно хорош. Вот другой пользователь, у которого также был ранний доступ. И снова он говорит: «Когда он работает, это довольно волшебный опыт. Я удивлён уровню понимания модели кода». Но потом у нас есть такие опыты, как этот: «Пробую Codex, как он должен исправлять, если у него нет доступа к интернету. Например, я не могу устанавливать пакеты NPM или обновлять вещи в моём проекте». Так что я думаю, пользователь спрашивал: «Можешь ли ты, пожалуйста, обновить Next.js до последней версии и убедиться, что всё ещё работает?» Но потом он говорит: «Извини, но я не могу обновить Next.js, потому что у него нет доступа к интернету». Я думаю, как только вы создаёте проект, у него больше нет доступа к интернету.
Теперь они действительно выделили эту конкретную функцию в своём блоге. Они говорят, что агент Codex работает полностью внутри защищённого изолированного контейнера в облаке. Во время выполнения задачи доступ к интернету отключён, ограничивая взаимодействие агента только кодом, явно предоставленным через репозиторий GitHub. И я думаю, что это одно из главных ограничений системы. Например, если я создаю новую функцию, я хотел бы иметь последнюю версию всех библиотек, верно? А потом иногда, особенно если вы работаете с этими старыми кодовыми базами, у вас, вероятно, есть старая версия пакета. Пример, с которым я столкнулся, — это пакет Generative AI от Google. Так что большинство старых проектов, которые я создал для Gemini API, используют старую версию Gemini API. Однако сейчас я столкнулся со множеством проблем, потому что теперь есть этот унифицированный SDK. Но если вы отключите доступ к интернету, то вы не сможете использовать последние версии, потому что вам нужно будет искать документацию. Теперь с их точки зрения, они хотят сделать это в целях безопасности, но я думаю, что это действительно ограничит удобство использования такой системы агентов. Теперь. Имейте в виду, что это всё ещё предварительная версия, поэтому, вероятно, они включат эту конкретную функцию. И здесь они говорят: «Мы уделяем приоритетное внимание безопасности и прозрачности при проектировании Codex, чтобы пользователи могли проверять его результаты, — гарантия безопасности, которая становится всё более важной по мере того, как модели ИИ обрабатывают более сложные задачи независимо, и эволюционируют соображения безопасности». Верно? И это, я думаю, действительно важная проблема, но вы также хотите иметь всё больше и больше гибкости. Теперь они серьёзно ограничивают или защищают от вредоносных приложений, которые могут быть созданы с использованием этих управляемых ИИ систем агентов. Но затем они говорят, что важно, чтобы защитные меры не чрезмерно препятствовали законным и полезным приложениям, которые могут включать методы, иногда используемые для разработки вредоносных программ, верно? И кажется, что система достаточно умна, чтобы это понять.
Теперь, с точки зрения реальной мировой «умности», нам придётся подождать и получить мнение сообщества о том, насколько хороша эта система. Но это, по крайней мере, открывает возможность того, что мы потенциально увидим много вкладов от этих агентов ИИ в всё большие и большие проекты с открытым исходным кодом. Devon имел очень похожие обещания. Мы ещё не видели больших вкладов от этих агентов, но я думаю, что мы находимся в той точке, когда это станет реальностью. Теперь, по мере того как эти кодирующие агенты становятся всё лучше и лучше, как нам следует начинать мыслить о программировании и кодировании в целом? Я не знаю. Я думаю, очень важно прислушаться к тому, что сказал Грег Брокман. Одна из вещей, которые я нахожу действительно захватывающими в том, как работает Codex, — это его очень нечеловеческие сильные и слабые стороны. И это действительно означает, что вы получаете гораздо больше от него, если начинаете думать о нём не просто как о статическом инструменте, который вы просто используете, как, знаете, просто, э-э, без необходимости развивать опыт. Но если вы действительно оптимизируете свою кодовую базу под то, что он может делать, вы начинаете… Честно говоря, большая часть того, что приносит пользу Codex, — это просто хорошие методы разработки программного обеспечения, с точки зрения модульных кодовых баз с хорошими тестами и тому подобное. Вы можете двигаться так быстро, и мы видели, что это происходит внутри компании у многих людей в OpenAI.
Таким образом, вы можете воспринять это по-разному. Один из способов — нам нужно выучить совершенно новую парадигму того, как совместно кодировать с этими системами, что, я думаю, неправильно. То, как вы должны думать об этом, — вам нужно начать изучать лучшие методы разработки программного обеспечения. А для этого вам действительно нужно понимать принципы кодирования, если вы хотите эффективно использовать эти системы агентов. И это должно быть очень хорошей возможностью для всех, у кого нет опыта кодирования, и они хотят создавать приложения, чтобы учиться у этих систем, как реализовывать модульный код и каковы лучшие методы. Только так мы сможем создавать лучшие приложения и системы, используя этих кодирующих агентов. Поэтому я лично думаю, что эти кодирующие агенты не заменят программистов, но эффективно повысят их производительность до новых уровней. Сейчас ещё очень рано, и чтобы выжить, вам действительно нужно стать лучше в своём деле. Дайте мне знать, что вы думаете. В любом случае, я надеюсь, что это видео было полезным. Спасибо за просмотр, и как всегда, увидимся в следующем.