📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

Claude Opus 4.7 vs ChatGPT 5.4 - Test on real code

AI Luke15:15

Transcription

О, нет. Что он наделал, мужик? О, мой веб-сайт. Claude Opus 4.7 только что вышел и теперь доступен. И в сегодняшнем видео мы протестируем CodeX против Claude Code Opus 4.7. Мы будем использовать 5.4 extra high для GPT и Opus 4.7 extra high effort на Claude. И мы будем использовать его на реальном коде, который является моим SaaS здесь. Так, по сути, мы проведем несколько разных тестов. Номер один, может ли он действительно создать визуально привлекательный веб-сайт? Номер два, может ли он действительно найти правильные ошибки? И номер три, может ли он исправить простые, но раздражающие функции? Давайте приступим к видео.

Итак, номер один, я хочу, чтобы он попытался творчески воссоздать эту целевую страницу. Улучшить пользовательский опыт моей домашней страницы. Я готов полностью изменить бренд-кит. Я хочу, чтобы у вас был полный творческий контроль. Теперь, ранее, когда я проводил подобный эксперимент, люди жаловались в комментариях, что мои запросы недостаточно хороши. Чего я ожидаю получить? Ну, вся суть, на мой взгляд, этих агентов в том, чтобы они могли работать без необходимости создавать запрос в первую очередь. Например, если мне нужно зайти в ChatGPT, чтобы создать запрос, чтобы затем использовать его в другой модели ChatGPT, это кажется глупым. И вместо этого, вы бы подумали, что они встроили этот уровень в саму модель. В любом случае, посмотрим, что они смогут построить и сколько времени это займет.

Теперь, на первый взгляд, и я уже использовал их, Claude Code кажется намного быстрее, а CodeX кажется намного медленнее. Кроме того, мне не нравится, что на CodeX по умолчанию не показывается, сколько токенов он использует, в то время как на Claude Code вы можете видеть использование токенов. Хотя, я имею в виду, это определенно определенно неправильно, не так ли? 72 токена.

Итак, у обоих, похоже, есть план. Слева, я должен признать, мне нравится, как у CodeX есть эта функция плана, которую он проходит, и вы можете видеть это на экране постоянно по умолчанию. Так что мы никогда не узнаем, сколько времени займет CodeX, потому что это время исчезнет, когда он закончит. Но справа, мы видим, что Claude Code закончил. Так что он даже работает. Он здесь показал себя. Так что мы можем нажать вниз, и мы видим, что это работает здесь на сервере 5190. Так что, если мы откроем это, давайте быстро посмотрим. Бам. Ух, на первый взгляд это немного, немного грубовато, не так ли? Угх. Мои глаза полностью ослеплены буквами. Боже мой, кто это, это огромное лицо? >> [смех] >> Что он наделал, мужик? О, мой веб-сайт. Он испорчен. Как будто он мог убить моего мальчика, мужик. Посмотри на это. Посмотри на это. Посмотри, как прекрасно это выглядит. А посмотри на это. Клод, мужик, что ты со мной делаешь? О, это так плохо. Дайте мне знать в комментариях ниже, ожидали ли вы, что это будет так плохо? Я не ожидал.

Итак, давайте посмотрим, что CodeX, давай, давай. Давай, CodeX, спаси день. Есть что-то про "wield". Здесь есть дуга? Это моя операционная система искусственного интеллекта. В ней есть все приложения, над которыми я работаю. В ней есть место для управления ими всеми, и в ней есть все мои агенты, с которыми я взаимодействую, включая рабочие процессы, задачи и воспоминания, журнал. Но здесь он, по сути, спрашивает, следует ли рассказать Arc о редизайне. Но я просто скажу: "Итак, давайте посмотрим, на каком порту это работает?" 5190. Вау. Это это Клод или это CodeX? Да, я просто перепроверял, потому что они переместили это в точно такой же формат. Как будто это тот же формат, просто другая тема. Подождите, нет. Так, это говорит CodeX. А это Claude Code. О, боже мой. О, нет. Они не разветвились. В этом проблема. Ни у кого из них не хватило интеллекта разветвиться. Ах, они все пытаются редактировать main. Оба редактируют main. >> [вздохи и охи] >> Давай, мужик.

Небольшая деталь, которую вы могли заметить, это то, что у Scripted AI, который сделал Claude Code, был такой же тип бренд-кита. И это потому, что Scripted на самом деле имеет встроенный бренд-кит для того, как это должно выглядеть, какие шрифты и цвета и так далее. Но по какой-то причине CodeX полностью, полностью изменил его. Оба закончили. Claude Code занял почти 13 минут, а CodeX не говорит вам, но это около 15 минут. И вот, это CodeX, а это Claude Code. Так, это это лучше. Это абсолютно ужасно. Прости, CodeX, но это полное дерьмо. Я имею в виду, это просто слова повсюду. Так что вы причина, по которой это выглядит так плохо. Я даже не могу сказать, что вижу, что вы здесь пытаетесь сделать. В то время как, если мы посмотрим на версию Claude Code, у них есть "напиши видео, отправь себя". Мм, звучит не очень хорошо. Напиши видео, потому что ИИ должен это делать. Но там есть "до" и "после" с затем отзывом. Это приятно. Мне нравится эта полоса. А затем у них есть, знаете ли, флагманские вещи, которые мне нравятся здесь. В любом случае, конвейер, а затем это, я. Да, я имею в виду, это не идеально, но это почти идеально. Это довольно круто. Да, я говорю, что это почти идеально, потому что это мое, что я сделал. Затем он оставил это. Так что он знает, как работать с клиентами. Но я имею в виду, это просто абсолютно ужасно. Дайте мне знать, что вы думаете в комментариях ниже. Это так же ужасно, как мне кажется?

Хорошо, тест два, мы протестируем ошибки. Итак, мы перезапустим обе эти сессии. И эта слева снова будет CodeX, а эта справа будет Claude Code. И мы, по сути, запустим их против нашей кодовой базы, чтобы увидеть, сколько ошибок они смогут найти и насколько они релевантны. Так что мы просто скажем: "Проведите полный анализ и найдите любые ошибки. Убедитесь, что вы создали отдельную ветку". И то же самое на этом другом. Итак, CodeX закончил, и Claude Code закончил. Теперь, просто бегло взглянув на то, что он вернул, это кошмар для чтения. Это на самом деле лучше читается, хотя я раньше думал, что Claude Code — это кошмар. Это заняло около 3 минут, а это заняло, я не знаю, около 6, может быть.

Хорошо, что мы сделаем сейчас, это откроем новую сессию. И здесь я просто скажу: "Я только что запустил две разные ветки для поиска ошибок в этом репозитории. Пожалуйста, можете ли вы создать HTML, сравнивающий их?" Итак, вот небольшой веб-сайт AI-слота, который он построил, чтобы увидеть, что они нашли. Ну, CodeX нашел четыре, Claude нашел пять. Интересно. Нет совпадений и шесть ложных утверждений отклонено. Это безумие. Так что Claude Code в основном сосредоточился на платежах. CodeX затронул серверную часть, тесты инфраструктуры. Хорошо, так что CodeX провел реальную проверку. Самые ценные находки в конфигурации. Ошибка загрузки, которая меняет поведение в зависимости от каталога запуска. Плюс сломанные тесты. Claude Code сосредоточился на коде, критически важном для дохода, а также отклонил шесть ложных утверждений из предыдущих запусков агента. Интересно. Так что он обнаружил, что обработчики веб-хуков Stripe проглатывают исключения. Так что Superbase сбой во время оформления заказа молча теряет обновление уровня. Ну, Stripe думает, что все успешно. Эй, у нас может быть больше денег, чем мы знаем. Отправить заказ. Хорошо, так что CodeX, Claude и т.д.

Хорошо, теперь Claude Code, похоже, проверил ложные утверждения агента. Так что я не знаю, пытается ли он сказать, что Claude заметил, что они ложные, или если Claude ложно их посчитал. Давайте проверим. Так что, если мы пойдем сюда, давайте посмотрим. О, нет. Так что он обнаружил ложные утверждения агента. Утверждения агента сами по себе. Эй, это безумие. Он, должно быть, пытается использовать что-то вроде Haiku или чего-то еще в качестве субагента. Так что, да, это безумие. Но также безумие, что они видят совершенно разные вещи. Так что, вот. Что касается отчета об ошибках, нет совпадений. Claude Code нашел поддельные вещи, которые затем отклонил. Так что убедитесь, что вы думаете об этом мифе. Да, и они нашли совершенно разные вещи. Интересно.

Итак, теперь, когда мы знаем, что они расходятся во мнениях по поводу ошибок, я не очень понимаю, кто лучше. Я чувствую, что Claude Code лучше, но штука с ложными утверждениями немного подозрительна. Я замечаю, что Claude Code намного быстрее. 38 секунд, чтобы написать и сохранить эти ошибки Claude.md, в то время как этому почти полторы минуты, чтобы превратить буквально то, что он мне дает, в файл MD для последующего использования. Так что я здесь, в Stripe, и могу подтвердить, что никакие платежи не были нарушены. Так что эта ошибка не была затронута или найдена пользователями. Какой бы ни была терминология. Ха. Так что, молодец.

Итак, одна глупая маленькая ошибка или функция, которую я хотел исправить, здесь вы можете видеть, как мы прокручиваем, все появляется. Ну, оно появляется слишком рано. Как будто оно появляется. Как будто трудно понять, что оно появляется. Как этот текст здесь, посмотри. Он начинает идти, а затем исчезает, и он уже загружен. Так что я хочу, чтобы они исправили это изменение здесь, чтобы оно действительно загружалось вовремя. И теперь, поверьте мне, я знаю, что вы смотрите и думаете: "Смотри, это крошечное исправление. Наверняка ты можешь его исправить". Я пытался. С 4.6 я старался изо всех сил, и это никогда не работает без того, чтобы мне пришлось копаться в кодовой базе, чего я, как vape coder, отказываюсь делать. Я зашел и просто вывалил это, знаете ли, просто открыл свой мозг и позволил всему вылиться, надеясь, что это исправит.

Итак, у нас здесь CodeX, а затем здесь это в Claude Code, точно то же самое. И я полагаю, прежде чем я что-либо сделаю, убедитесь, что вы переходите на новую ветку. Бум. Так что мы позволим им идти. Мы посмотрим, сколько времени это займет, и посмотрим, смогут ли они действительно это исправить. Почему он постоянно пытается сказать Arc оставить Arc в покое? Почему Сэм Альтман хочет весь мой код? Честно говоря. Вы хотите, чтобы я обновил команду Arc? Почему? Зачем вам обновлять команду Arc? И для контекста, все это потому, что он получает это начальное сообщение, но это начальное сообщение также вставляется в Claude Code при запуске.

Оба закончили довольно быстро, на самом деле. Но я нахожу, что этот начальный рабочий этап CodeX меня просто сводит с ума. Он занимает около 20 секунд размышлений. О, ну, вот он, 15 секунд размышлений, прежде чем он начнет что-либо делать, судя по всему. Так что он даже не закончил, не так ли? Для CodeX. CodeX не закончил. Он просто пытался что-то изменить. О, я не знаю, мужик. Так что давайте посмотрим. 5190 должно быть закончено сейчас. Так что давайте посмотрим, как это выглядит при прокрутке. О. Нет. Это не CodeX. Он не сделал. Вы убили текущий процесс на 5190? Может, попробуем другой порт? И вы используете основной код? Вы создали ветку?

Хорошо, так что Claude утверждает, что он создал ветку. Что-то переключило ветку из-под меня. Я создал home review. Я внес правки. Теперь текущая ветка — это эта. Есть ли эта ветка. Так что давайте посмотрим. CodeX говорит, что он закончил. Давайте проверим. Так что он все еще запускает это здесь в новом окне инкогнито. Нет, это просто неправильно. Это не кэшируется или что-то в этом роде. Это то, что я часто замечаю, и это, возможно, фреймворк, который нам нужно будет встроить в Arc, какой-то менеджмент git, потому что они постоянно наступают друг другу на пятки. Я всегда это замечаю, независимо от того, какое программное обеспечение я использую, они неизбежно, знаете ли, наступают друг другу на пятки. Это безумие. И это будет то же самое, когда я открывал несколько Claude Code. Дайте мне знать, если вы замечаете, что происходят те же вещи. Знаете ли, они просто не понимают базовую концепцию. И вот здесь я вижу, что люди говорят, что запросы действительно важны, потому что вам нужно дать им контекст и все такое, вроде как, иди на главную, используй эту целевую страницу, создай свою собственную ветку, убедись, что имя ветки уникально на момент создания, перейди в нее, убедись, что порт, который вы хотите использовать, еще не занят. Это самые базовые вещи. Это абсолютно нелепо, что у них этого нет встроенного.

Так что, по-видимому, это было на неправильном рабочем дереве. Знаете что? Я просто считаю это провалом для обоих. Или давайте просто быстро посмотрим, как выглядит появление вещей. Хорошо. Этот, версия CodeX, слишком быстрая. Как будто у нее нет ничего. О, нет, вот она. Это здесь. Как это выглядит? Ой. Я не знаю. Я не могу точно сказать. Но я должен признать, мне надоело сравнивать их друг с другом, и они постоянно все портят. Дайте мне знать в комментариях, что вы думаете об этом. Какой, по вашему мнению, лучший? Я думаю, Opus 4.7 выигрывает с большим отрывом. По-видимому, я слышал, что скоро выйдет новая модель CodeX, как в течение следующей недели. Так что подпишитесь на нее. Если она уже вышла, проверьте канал. Если это неделя позже 17-го. Так что 24-го и далее, проверьте канал для последней версии, и я увижу вас в следующем видео. Ставьте лайк, комментируйте, подписывайтесь. До свидания.