Transcription
В последнее время вышло много крутых и мощных нейронок. GPT5, обрушившие ожидания пользователей, Грок 4, которого не перестаёт нахваливать Elon Musk, а также неожиданный OPUS 4.1 от Anthropic. Сегодня я буду тестировать и сравнивать эти нейронки на самых жёстких вайпкодинг-задачах, которые старые модели просто и были не способны выполнить. Я хочу выяснить, есть ли какой-то прирост в эффективности работы таких моделей, или они, как и раньше, способны выполнять только очень простые таски. Для этого я сегодня заставлю модели разработать приложение под iPhone, сервис для автомонтажа видео, свой собственный виртуальный синтезатор, игру для одной очень необычной платформы, а также создам модель в блендере и многое другое. Погнали.
Привет. Меня зовут Олег. Обычно я разработчик, но на этом YouTube канале я скорее вайпкодер. На этом канале я тестирую AI инструменты, автоматизирую всякие штуки и показываю свои собственные проекты. Смотрю, что реально работает, а что нет. С каждым релизом нейронки становятся всё умнее. Небольшие задачи становятся всё более решаемыми. Теперь любой человек с помощью ChatGPT, Llama или Cursor может поднять свой собственный сервер, написать простой лендинг или поправить логику в коде, совсем не понимая, как он работает. В общем, делать простые задачи, не нанимая для этого программиста. Подробные примеры того, как можно разрабатывать с AI, я показывал вот в этом ролике про Cursor. Однако большие запутанные проекты на legacy стеках, костылях и трудночитаемом коде всё ещё очень плохо поддаются и работать с ними нужно пошагово, учитывая все нюансы, влияющие на результат. Такие проекты действительно сложны для LLM. Поэтому сегодня я проверю свежие нейронки именно на таких задачах.
Для запуска тестов я буду использовать консольные AI утилиты, которых в последнее время появилось очень много. Они позволяют работать с кодом часами, следуя плану и изначальной задумке. Как правило, имеют тул-лист для отслеживания прогресса по задаче, а также легко запускаются в терминале в любом редакторе кода. Самый популярный такой инструмент — это Claude CLI. Его сделали Anthropic, поэтому работать внутри него можно только с моделями Claude. Я буду использовать его для тестов нейронок Opus 4.1 и Sonnet 4. Sonnet за последнее время особо не обновлялся, но я буду использовать его как хороший экземпляр модели, которая стабильно используется в разработке. Для остальных моделей я подготовил аналогичные тулзы: Gemini CLI для Gemini, Codex CLI для GPT5, Quent Coder CLI для Quent. Да, я также решил прогнать тесты на модели Quent 3 Coder, чтобы посмотреть, на что способна хорошая open source нейронка. Для Грок 4, к сожалению, нет CLI, который бы работал по подписке в терминале, поэтому для него я буду использовать базовый Cursor.
И давайте проговорим правила сегодняшних тестов. На каждое задание у нейронки будет ровно одна попытка для реализации. Я буду закидывать исходный промпт, запускать процесс и в случае проблем буду докидывать пять дополнительных запросов нейронке с просьбой исправить проблему. Если за пять допзапросов задача всё ещё не будет выполнена, тест будет считаться проваленным. А теперь поехали.
Начну с интересного. Сделаю приложение под iPhone. Идея следующая: камера на iPhone снимает действительно круто. Однако для творческих фотографий, чтобы не получать неожиданные автообработки от Apple, хочется настраивать все параметры съёмки вручную. Поэтому решил сделать небольшую приложуху в виде камеры, где абсолютно все настройки устанавливаются руками, чтобы можно было установить фиксированный ISO, выдержку, баланс белого и ручной фокус. Я написал небольшой промпт, который описывает требования к приложению. Описал там всё, что мне нужно, прописал язык Swift и указал на шаблон проекта, который сгенерирован VS Code. Для каждого теста я буду генерировать новый шаблон и скармливать папку нужной нейронке. Шаблон — это приложение, которое корректно запускается на моём телефоне и выводит надпись "Hello World". Все исходные промты для сегодняшних проектов лежат по ссылке в описании в моём Telegram-канале.
Начнём с китайской модельки от Alibaba — Quent Coder. Как говорил ранее, она open source, однако находится достаточно высоко на лидербордах LLM в разделе кодинг. Запускаю Quent-Coder, закидываю prompt и получаю ошибки сборки. Прошу пять раз исправить, но в конце концов ничего не выходит. Приложение в итоге всё ещё не собирается. Quent Coder не справился, и поэтому за это задание он получает ноль баллов.
Следующая модель — это Gemini 2.5 Pro. Она имеет огромный контекст — миллион токенов. Это практически как целая книга, то есть может держать в одном диалоге очень много информации. Google обновляли эту модель очень много раз, и наконец-то у нас есть нормальная релизная версия без всяких preview-преписок. Нормальная 2.5 Pro. Запускаю Gemini. Кстати, для этой задачи я активировал платный тариф. Это было вообще не очевидно. С платным тарифом у меня теперь достаточно лимитов, чтобы делать большие проекты на Gemini 2.5 Pro. На free плане промодель очень быстро заканчивается, и программа переключается на модель Flash, которая гораздо хуже в программировании. Как активировать платный тариф для Gemini, я написал по ссылке в описании. Это действительно нетривиально. В общем, запускаем разработку. После пяти допфиксов нет никаких ошибок в сборке. Приложение запускается у меня на телефоне, однако оно выглядит как просто чёрный экран. Нет никаких кнопок. Ставлю ноль баллов за это задание.
Переходим к модели, которая стала стандартом для разработки в последние месяцы. Это Claude Sonnet 4. Я писал много проектов чисто на нём. Он неплохо справляется с небольшими задачами. Посмотрим, как он будет выдерживать объёмные проекты. Открываю Claude CLI, выбираю модель Sonnet и запускаюсь с тем же промтом. Через 30 минут получаю проект, который собирается и запускается на моём телефоне. В целом работает, но превью не соответствует сделанным фото. Цвет в приложении немного отличается от цвета фотографий, которые сохраняются в галерее. Готов поставить 80% за такой результат.
Claude Opus 4.1 — это новая версия самой большой модели от Claude. Для работы с ней в Claude CLI нужно купить подписку минимум за 100 долларов, так как модель по API реально дорогая. Посмотрим, оправдает ли она свою стоимость и есть ли смысл вообще покупать такой дорогой тариф. Выбираю Opus в Claude CLI. Запускаю. Получаю приложение, которое собирается и успешно запускается на моём телефоне. И оно работает, вылетает при настройке выдержки, но всё остальное функционирует нормально, не считая того, что параметры закрывают весь экран при настройке и их приходится устанавливать наугад. За такое ставлю 90%.
Далее переходим к сильной модели от XAI, которую бесконечно нахваливает Илон Маск. Grok 4. По общим бенчмаркам на интеллект она показывает себя достаточно хорошо. Посмотрим, как она ведёт себя ещё и в разработке. Открываю папку в Cursor, закидываю промпт. Grok пытается что-то переименовывать и иногда останавливается. Приходится его подталкивать к работе, пока он не сделает готовое приложение. Также интересно, что Grok достаточно молчалив. Он завершает работу и даже не говорит, что было сделано, как это запустить и так далее. После пяти дополнительных промтов приложение успешно собирается и запускается на телефоне. Однако в приложении не работает превью. Вместо трансляции картинки с камеры я вижу только чёрный экран. Также оно вылетает при настройке баланса белого и вылезает странное предупреждение: "Camera Permission required", хотя я дал доступ к камере. Фото сохраняются, и это хорошо. Даю 50% за это задание.
И финальный босс — GPT5. Лучшее, что есть у OpenAI на данный момент. Недавно вышло, вроде хорошая, а вроде не очень. Сейчас я проверю сам. Запускаю в Codex CLI. Codex, конечно, ультра плохо выглядит по сравнению с Claude CLI или тем же Gemini, но о'кей. Через 30 минут получаю работающее приложение, которое запускается и работает без ошибок. Единственный момент, что на некоторых настройках нет числа, которое отображает реальное значение настройки. Ну, с этим в целом можно работать. Круто. 100% за этот тест.
Вот такие итоги первого раунда. GPT5 в лидерах, затем идут Claude, Grok, все остальные по нулям. Двигаемся дальше.
Если вы пилите свой AI проект, экспериментируете с LLM или другими нейронками, то советую присмотреться к агрегатору API — Польза AI. В нём есть сотни различных моделей, и при этом всё работает без VPN и зарубежных карт. Можно спокойно внедрять в свои проекты N8N автоматизации и AI инструменты. Подключить эту штуку ультралегко, так как взаимодействие совместимо с OpenAI API. Нужно сгенерировать API ключ, указать его в вашей интеграции, а также заменить base URL на вот этот: `https://api.polza.ai/v1`. И всё.
Затестим эту штуку на CLI. CLI — это аналог Cursor, в котором можно разрабатывать на любых LLM. Он как раз работает на API ключах. Качаю расширение для VS Code, выбираю OpenAI-совместимый AI. Для интереса возьму модель GLM 4.5. Она сейчас одна из самых лучших в open source. Вставляю ID модели, API ключ и base URL. Отлично, модель работает. Давайте запилим визуализатор в браузере, который будет отображать анимацию, где текст будет появляться как будто бы в результате работы игры "Жизнь в клетках". Такую анимацию можно использовать где-нибудь в титрах в видео. Я использовал подобную программу в видео про MCP. Закидываю промпт, пару минут — и готово. Работает. Прикольно. В общем, если вы давно хотели внедрять нейросети в свои проекты, но вас останавливали VPN, зарубежные карты и сложные подключения, то сейчас всё решаемо. Сервис российский, удобный, работает без проблем. Ссылка в описании. Регистрируйтесь, тестируйте и не откладывайте на потом построение своих AI-решений.
Теперь повысим сложность. Перейдём к ещё более жёсткому тесту. На него я вдохновился ещё весной, когда прощупывал Claude Sonnet 3.7 в Cursor. Я хотел сделать свой виртуальный синтезатор, который бы генерировал пресеты по запросу пользователя с помощью LLM. Я успешно создал прототип, который работал в браузере. Но при попытке создать подобную штуку в виде VST плагина, который бы работал в Ableton Live или FL Studio, я сильно забуксовал. Оказалось, что разработка музыкальных плагинов имеет огромное количество нюансов. Код пишется на C++, иногда что-то может просто не работать. Никаких логов практически нет, и генерация звуков в синтезаторе имеет очень-очень сложный внутренний процесс. Номер ноты переводится в частоту, которая колеблется в реальном времени, данные о которой пересылаются пачками в вызывающую систему в виде Live или FL Studio. На всё это накладываются эффекты и модуляции. И так это работает в любых цифровых синтезаторах, когда играет дабстеп, басс, драм-н-бейс, мелодия или синтезированные ударные инструменты. Но сегодня я хочу сосредоточиться на басс-звуке для фанк-треков. Я хочу сделать VST плагин-синтезатор, который будет иметь полный функционал, аналогичный существующим Serum или Massive, но при этом с уклоном в басс-звук для фанка. Я подготовил промпт, в котором подробно описаны все блоки осцилляторов и эффектов. Посмотрим, как с ним справятся модели. Погнали.
Quent Coder сделал несколько плагинов, но они не работали. Завелся только тестовый плагин эффекта, но он был пустой, так что 0% за этот тест.
Gemini работал 2 часа и в итоге запилил плагин, который запускался и даже не крашил Ableton. Из него выходил звук. [музыка] Плюс были крутилки, но они не имели надписей, однако как-то влияли на него. Я считаю это серьёзным успехом, заслуживающим 40% баллов.
Sonnet 4 за 30 минут создал плагин, который запустился, звучал [музыка] и даже имел понятные блоки параметров, которые кое-где даже ожидаемо влияли на звук, и даже отрисовал картинку колонки, как я просил в промпте. Правда, она находится не совсем в удачном месте, но всё равно круто. Ставлю 80% за такую реализацию.
Opus 4.1 после 2 часов разработки выдал плагин, который выдаёт звук, и его в целом можно использовать. Однако в интерфейсе видно только один голос плюс базовые настройки этого звука без эффектов. За такое могу дать только 50%.
Grok. После 2 часов разработки он так и не смог пофиксить сборку плагина. Она всё время падала, поэтому ставлю заслуженные ноль баллов.
GPT5. После всех попыток собрал плагин. Однако запуск синтезатора в Ableton вызывал мгновенный краш. GPT5 не справился. Ноль баллов.
Итоги второго раунда. Лидером здесь становится базовый Claude Sonnet 4, за которым идут Opus и Gemini. Нули у Quent Coder и Grok. Двигаемся дальше.
Раз сегодня я тестирую довольно жёстко и использую необычные платформы, я решил создать игру. Игру под PSP. Я прикупил такой вот б/у экземпляр приставки в Японии. Он отлично работает. Иногда я на нём играю в какие-то классические игры. В этом тесте я хочу создать простую игру. Это будет мини-игра с управлением машинкой, которая едет по прямой дороге в закат, как на RetroWave видосах. Для работы с PSP пришлось скачать PSP dev SDK. Игры здесь пишутся на C. Я описал все требования в промпте, чтобы была машина, дорога, препятствия, которые нужно объезжать. Дополнительно хотелось бы видеть бэкграунд для красоты. Этого вроде достаточно. Посмотрим, что получилось по результату.
Quent Coder выдаёт ошибку при запуске. Не работает, поэтому ставлю ноль баллов.
Gemini CLI. Игра запускается. Белый квадратик даже как-то двигается при нажатии на кнопки. Есть какие-то жёлтые и красные препятствия. По какой-то логике машина даже ломается и открывается меню, в котором все буквы как-то перевёрнуты. По кнопке игра перезапускается. Дам 70% за такой результат. Графика очень плохая и непонятная, но в целом что-то работает.
Sonnet. Его все версии зависали на чёрном экране. Он пытался упрощать игру, чтобы она хоть как-то завелась. В итоге работает только "Hello World" приложение, которое пишет текст и закрывается при нажатии на крестик. 10% за такой результат.
Opus. Он сделал очень много версий игры, но все они выпадали в ошибку. В итоге он сделал простую версию, в которой ничего нет, только синий экран, и она заработала. 10% за этот тест.
Grok. Игра запускается, и в ней квадратик в целом куда-то едет, но трасса как будто дублируется. Есть какой-то мигающий глич, который игрок не смог исправить. В общем, игра работает, но гораздо хуже, чем у Gemini. И за такое могу поставить только 50%.
GPT5. Игра отлично работает. Вместо квадратика здесь уже что-то приличное. Дорога и препятствия понятные. Есть жизни и меню ретрая. Всё офигенно понятно по сравнению с результатами от других моделей, поэтому поставлю 100% за этот тест.
Итоги третьего раунда. Все модели справились с тем, чтобы сбилдить образ игры. Но почти у всех были сложности с запуском этого образа на приставке. Более-менее что-то получили в результате Grok и Gemini. И абсолютным лидером стал GPT5, так как он сделал базово хорошую игру, которую доработал в дополнительных запросах. Двигаемся дальше.
В следующем тесте я решил посмотреть немного в другую сторону. Я взял довольно стандартный бэкенд плюс фронтенд, но по логике и работе придумал реально сложный алгоритм, который программа должна реализовать. В чём суть? При производстве видео, таких как это, монтаж является одним из самых долгих и рутинных процессов. Нарезка успешных дублей плюс удаление пауз занимает реально много времени. К примеру, нарезка десятиминутного видео у меня занимает несколько часов. Однако для каждого такого видео я готовлю подробный сценарий, в котором прописан весь текст, который я произношу. И тут мне в голову пришла идея сделать программу, которая занимается автоматической нарезкой видео. Алгоритм будет следующий: для начала Eleven Labs будет транскрибировать звук из видео, получая тайминги каждого произнесённого слова. Затем LLM будет идти по сценарию и транскрипции, подмечая куски, которые являются фразами сценария, брать последние успешные дубли, в которых нет прерываний, убирать из них паузы и получать набор таймингов для нарезки исходного видео. Такой набор таймингов можно сохранить в формате FCPXML, чтобы легко импортировать его в любой видеоредактор и получить готовую нарезку видео. Я описал такой верхнеуровневый алгоритм, обозначил примерный стек и отдал задание нейронкам.
Quent 3. Он запутался в ошибках на бэкенде, не смог их до конца все исправить, и программа так и не заработала. Ноль баллов.
Gemini CLI. Тоже не справился с ошибками на бэке. Процесс так и не выдал никакого результата, лишь ошибки. Ноль баллов.
Sonnet. Аналогично погряз в ошибках на бэкенде. Результат ноль.
Opus 4.1. На него большие надежды. После всех исправлений система начала работать и даже генерировать файл в результате. Он импортировался в DaVinci Resolve, где автоматически подтягивалось тестовое видео. Однако нарезка работала ультрасомнительно. В ней было просто два первых фрагмента исходного видео, то есть алгоритм нарезки работал некорректно, но за работу без ошибок и генерацию конечного файла дам 50%.
Grok 4. После всех попыток на бэкенде остались ошибки. Программа не работает и поэтому получает ноль баллов.
GPT5. У него, в отличие от других, возникли проблемы на фронтенде при извлечении аудио. До последнего он не мог исправить все баги, и в итоге программа не работает. Ноль баллов.
Итоги этого раунда. С заданием справился только Opus 4.1 и только частично. Остальные модели просто не смогли разобраться с ошибками в коде. На данный момент это самый жёсткий тест. Спасибо, что хоть какой-то результат удалось получить. Погнали дальше.
Предлагаю чуть сбавить обороты и вернуться к локальным задачам, которые не требуют создания огромных сервисов с нуля. Давайте пофиксим баг на фронте. В моём сервисе генерации фанфиков есть один неприятный момент, который я всё не могу исправить. При удалении последней главы в браузере открывается почему-то всегда первая глава, а не предпоследняя, которая становится новой последней. И я попробовал её решить на вайбе, но ничего не вышло ни с первого, ни со второго промта. Поэтому сегодня попробую пофиксить этот баг с помощью свежих нейронок. Погнали.
Quent Coder. Баг пофиксился после первого промта плюс одной правки. Отлично. Даю 80%.
Gemini CLI. Баг с первых попыток пофиксить не удалось. Дальше начал понимать, что у него мало попыток, и начал реально стараться. На последней попытке переволновался и начал переписывать файл с нуля. Полетели ошибки вызовов инструментов. В итоге после всех попыток не справился. Ноль баллов.
Sonnet. Баг с ходу ошибка осталась. И после второй попытки тоже. В итоге на последней правке он всё-таки сделал нужное исправление и фикс исправил ошибку. Поставлю 20% за такой фикс на последней попытке.
Далее Opus. Здесь фикс заработал только после трёх правок, что уже лучше, чем результат на этом. О'кей, 50%.
Grok. Фикс применился удачно с первого же промта. Офигенно. 100% за этот тест.
GPT5. Получил первое же решение, и оно сработало отлично. 100%. В итоге все нейронки, кроме Gemini, справились. Grok и GPT5 справились с первого же промта. Офигенно.
Перейдём к чуть более творческим тестам. Я хочу использовать MCP для подключения Blender — программы для 3D-моделирования, чтобы позволить нейронкам работать в ней. А что такое MCP, смотрите вот в этом ролике. Я хочу повторить тест из видео, где я тестировал Claude Sonnet 4, и попросить нейронки создать 3D-версию советской панельки ещё раз. Мне интересно узнать, будут ли сегодня какие-то более качественные результаты по сравнению с предыдущими тестами. Погнали.
Quent Coder. Он создал базовые параллелепипед, ряды окон и землю. Однако окна и детали дома рядами летают где-то в воздухе. Это никуда не годится, и поэтому ноль баллов.
Gemini CLI. Попытался создать балконы. Однако без окон и со стенками, которые летают в воздухе, это никуда не годится. Ноль баллов.
Sonnet. Создал что-то более-менее похожее на дом. Окна на месте. Балконы немного странные. Есть даже специальная крыша. Мм, поставлю 50% за такую модельку.
Opus. Профакапил все окна и балконы. Они как обычно мимо. Ноль баллов.
Grok. Сначала сделал неплохую структуру, выдолбив ровные ряды отверстий в доме. Однако затем всё скатилось непонятно во что. Поставлю 10% за изначально ровные прикольные дырки под окна.
И наконец GPT5. Создал неплохой вариант панельки. Окна, двери и балконы более-менее на месте. Хотя и у балконов нет боковых стенок. Поставлю 80% за такой результат.
В этом раунде получилось очень мало хороших результатов. Порадовали только GPT5 и Claude Sonnet. Ну ладно, двигаемся дальше.
В качестве завершающего раунда я хочу провести максимально творческий тест. Я буду просить модели написать мелодии в музыкальном редакторе Live. То есть модель сама выберет музыкальный инструмент и пропишет ноты. Промпт примерно следующий: "Создай фортепианную мелодию. Длительность мелодии должна быть 20-30 секунд. Её нужно использовать для романтическо-научно-фантастического аниме в стиле Макото Синкая. Она будет звучать в меланхоличном эпизоде под названием "Конец лета". Она будет передавать ощущение, что лето и любовь закончились, что всё уже никогда не будет как прежде. Всё будет совершенно иначе. Но жизнь должна продолжаться. Метафорически за осенью последует зима и весна, и когда-нибудь в будущем снова наступит лето. Любовь в хорошее время. Она должна вызывать ностальгию по белым ночам, прогулкам и встречам. Сделай её мелодию многослойной, сложной и оригинальной. Сделай её в жанре фортепианного саундтрека аниме. Что-то типа Matroсk или, может быть, даже Midwestema." Запустим и посмотрим, что получится.
Quent Coder. На мой взгляд, сделал ультрастранную, скучную и роботизированную партию. Мне не нравится. [музыка]
Gemini CLI. Создал что-то напряжённое с каким-то драматическим финалом. [музыка] М, интересно, но, по-моему, странновато.
Sonnet. Сделал простую, но такую плавающую мелодию. [музыка] Вроде интересно, но я бы сказал, что слишком скучно и вяло.
Opus 4.1. Вот эта мелодия мне уже нравится. Она немного плавающая, но такая честная. [музыка] Я бы сказал, звучит в стиле саундтрек, как Minecraft. Ставлю лайк такому варианту.
Grok. О, такая мелодия мне нравится ещё больше. Она простая и понятная, но при этом настроение передаётся хорошо. [музыка] Её действительно можно использовать как саундтрек в каком-то лиричном эпизоде. Очень хорошо.
GPT5. Эта мелодия хороша. [музыка] В ней есть драма, она передаёт настроение, имеет умеренную структуру и понятный звук. Мне нравится.
Я попросил подписчиков в Telegram-канале проголосовать за мелодии, чтобы выяснить, какая из них лучше всех. В лидеры вышли мелодии моделей GPT5 и Opus. Дам им по 100%. И также Grok и Gemini набрали неплохое количество голосов, поэтому дам им по 80%. Остальные заслуживают максимум 20%.
Итоговая таблица за все раунды выглядит примерно так: Суммарный результат 0,8 у Quent Coder, 1,9 у Gemini, 2,4 у Sonnet, 3,5 у Opus, 2,9 у Grok и 4,8 у GPT5. Неплохо. По этим тестам получается, что GPT5 действительно лучше всех справляется с жёсткими вайпкодинг-задачами. Эта модель лучше всех работает как кодинг-агент и также хорошо справляется со внешними инструментами. Она значительно обходит обновлённый Opus 4.1 и Grok 4. И даже проверенные временем Gemini и Sonnet остались далеко позади. Возможно, в ближайшее время мне нужно побольше поработать и поэкспериментировать с GPT5.
В качестве обобщённого итога сегодняшних тестов я бы сказал, что модели действительно становятся умнее. Они постепенно начинают быть способными на решение всё более комплексных задач. Это радует и пугает одновременно. Однако на данный момент любая работа с AI имеет огромное количество нюансов, без вникания в которые взаимодействие с AI значительно теряет в эффективности. Поэтому подписывайтесь на мой YouTube канал. Будем вместе вникать в нейронки и инструменты, тестировать модели и подходы, чтобы создавать что-то действительно крутое. А также заглядывайте в мой Telegram-канал, там я выхожу на связь чуть чаще. Пишу свои мысли, приколы, нюансы при работе с AI, выкладываю полезные материалы. Ссылка в описании. Увидимся.