📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

Агенты ИИ для кодинга: обзор эффективности за август

Yersham24:26

Transcription

Ну что ж, август выдался просто взрывным для всех, кто следит за ИИ в программирование. О, да, это точно. Выход с GPT5, грок код фаста, ещё и новый и агенты. Прям голова кругом идёт.

Согласен. Сегодня наша задача помочь разобраться во всём этом, ну, потоке новинок. У нас тут как раз есть очень детальное такое масштабное тестирование. Верно. Задачка непростая.

Тесты, ну, они действительно впечатляют своим размахом. Это же не просто проверить, напишет ли и сортировку. Да, конечно, нет. Это целая симуляция работы над сложными проектами. Там, знаешь, от 10 до 30ти, а то и больше файлов задействовано. Попробуем понять, какие из этих штук реально работают на практике. И главное, почему.

Вот именно. Сегодня мы как раз проведём такой обстоятельный разбор результатов этих тестов. постараемся, ну, вычленить самое важное, подсветить неожиданные моменты, а их, кстати, было немало. О, да. И в итоге помочь сориентироваться в текущем, ну, очень быстро меняющемся мире и помощников для кодинга.

В общем, давайте погрузимся в детали. Предлагаю начать с новичков, те, что появились буквально в прошлом месяце. Вот, например, Кира. У них там интересная оплата за запрос. Ага, слышал про такое. Но по сути, как вот говорят в источнике, это ещё один клон вс-код. Пока, ну, какого-то прорыва не видно. Понятно. Очередной.

Дальше кодер. С ним пока много неясного. Да, да, с коудером мм туманно. Модель конкретную выбрать нельзя, цена тоже неизвестна. Ну да, предполагается, что там внутри Qн Coder от Алибабы, но по тестам, в общем-то, справляется неплохо. Но пока такая, знаешь, тёмная лошадь. Угу.

Ещё один агмент CLI. Был момент, когда показалось, что он как бы копирует Gemini CLI. А, дада, помню. Но вроде бы нет. Просто ещё один инструмент для командной строки в общую копилку. Ну и нельзя обойти вниманием клодкораутер. Его тестировали, потому что много просили. А, понятно. Правда, с настройкой пришлось повозиться. Автор тестов упоминает, что нужно было выйти из основного аккаунта ДДКД, чтобы всё заработало так надо. О, как. Да, это заняло время, но результат интересный получился. Мы к нему ещё вернёмся. Хорошо.

С новыми именами немного познакомились, но главный вопрос: а как именно измеряли их производительность? Что это за тесты такие, которые позволяют так уверенно сравнивать настолько разные инструменты?

Тут ключевой момент фокус на комплексных задачах. не какие-то изолированные задачки, а имитация реальной разработки. То есть, ну, там, создать веб-приложение или добавить новую фичу в существующий проект или исправить баги в коде, который разбросан по куче файлов.

Оценивался целый ряд параметров. Каких именно? Ну, во-первых, насколько точно агент следует инструкциям? Это как бы основа. Во-вторых, проходят ли код юнит-тесты автоматически? Ага. В-третьих, проверялось качество кода через линтинг. Ну, это стиль, потенциальные ошибки и статический анализ, который ищет уже более глубокие проблемы в логике. Угу. Использовался даже специальный LLM оценщик для общей оценки качества, но его вес в итоговом балле сделали небольшим сознательно, чтобы упор был на объективных метриках. То есть максимально приближенно к тому, как код смотрели бы в реальной команде.

Именно так. И что важно, сами тесты-то не стоят на месте, они развиваются. В смысле? Ну, старые тесты со временем устаревают. Модели просто учатся их проходить на отлично, и они перестают показывать разницу. А, понятно. Поэтому вот в этом цикле два тесты усложнили: добавили новые фичи, больше юнит-тестов. Хотя, как автор отмечает, даже этого м оказалось недостаточно для сильной дифференциации. Уровень моделей в целом сильно вырос, особенно скло 4 son.

Получается, модели в целом стали лучше понимать и выполнять инструкции? Да. Да, особенно GPT5 в этом плане выделяется. Сейчас проблемы чаще возникают не из-за того, что модель не поняла задачу, а из-за нехватки у неё каких-то специфических знаний. Ну, там про конкретный фреймворк или библиотеку.

А ещё что-то. И есть ещё одна такая, знаешь, распространённая довольно коварная проблема. Неправильное исправление ошибок. Это как можешь пояснить? Ну, смотри. Модель генерит код. Он почти правильный, но с ошибкой. Она получает сообщение об ошибке, ну, от компилятора или из тестов. Пытается исправить и делает это неверно. Уводит решение совершенно в другую сторону, ломает то, что работало до этого. Вместо того, чтобы как бы шаг назад сделать, переосмыслить, она упрямо исправляет не то и не так. Любопытно.

А есть модели, которые вот особенно склонны к такому? В источнике упоминается, что гроккот Фаст этим особенно грешит. Ошибки, которые он видит в терминале, часто его провоцируют на какие-то довольно странные, нелогичные изменения в коде, которые только хуже делают. Понятно. Да уж, важный нюанс.

А что с самими тестами планируется дальше? Есть планы по созданию, ну, так называемой V3 версии тестов. Основная идея - сделать их полностью открытыми. Open source. О, это интересно, да? с публичными задачами, метриками, чтобы сообщество могло участвовать в разработке, в улучшении, потому что создавать и поддерживать такие сложные тесты - это, ну, колоссальный труд.

Согласна. И главный вывод из всей этой методологии, конечно, сама ИИ - модель - это очень важно, но не менее важна и, скажем так, обвязка агента. Обвязка. Можешь пояснить, что имеется в виду под этим? Обвязка или харнес по-английски? Это вся система вокруг самой модели. То есть как именно ей ставятся задачи, ну, промты, как агент обрабатывает ошибки, какие допинструменты или команды он умеет использовать, как он управляет контекстом проекта. Ага. Вот именно эта обвязка и позволяет раскрыть потенциал модели или наоборот ограничить его даже у самой мощной модели. Приводился там пример старого теста с Python приложением, где надо было не просто пару функций написать, а построить работающее приложение с нуля. Вот тут обвязка себя и показывает.

Отлично, с методологией разобрались. И вот теперь, как говорится, самое интересное, да, результаты. Давай перейдём к ним. Как разные модели себя показали в связке с разными агентами.

Начнём, наверное, с Cloud 4 Sonet. Одна из самых популярных сейчас. Ага. Sonet. Здесь мы видим такую любопытную картину, которую можно назвать конвергенцией. Конвергенцией. Ну да. Результаты у разных агентов, которые используют SonetТ, оказались очень близки друг к другу. Модель сама по себе сильная, да, но она уже не такой, знаешь, безусловный лидер во всём, как может пару месяцев назад было. Разрыв сокращается. Но даже при этой близости есть настоящие сюрпризы.

Кто же вырвался вперёд с Sonнет? И тут я смотрю первый шок - это warp. Да, просто невероятный скачок. Ещё недавно в обзорах его, помнится называли ленивым. Говорили, что он часто не доводит сложные проекты до конца, а теперь номер один в тестах Sonet. Да, это, пожалуй, главный сюрприз месяца. Похоже, разработчики WB, ну, проделали огромную работу над его обвязкой, над внутренними механизмами за последний месяц. Это вот ярчайщий пример, как сам агент может повлиять на результат.

Кто ещё хорошо с сониц работал? Стабильно хорош Кюрсор, он часто в топ-три оказывается. И ещё один взлёт у Аугмент. Он тоже значительно улучшил свои показатели, поднялся с нижних строчек таблицы. Но ведь есть и обратная история. Кто-то неожиданно сдал позиции.

Да, совершенно верно. И это ещё один сюрприз, но уже со знаком минус clудко. Серьёзно? Клоуд код? Да. Агент, который раньше стабильно был в лидерах, теперь опустился ниже середины списка. В тестах Соннит он показал результаты хуже, чем даже Винсдрув, Кира и Краш. А есть предположение, почему так? Это вот та самая экономия токенов, о которой говорили, или что-то ещё? В источнике основное предположение - это какие-то агрессивные внутренние оптимизации, возможно, да, связанные с экономией токенов, которые негативно повлияли на способность модели генерировать качественный код в сложных сценариях. Да, конечно, это может быть и следствием других изменений в её архитектуре или промтинге, кто знает. Но так или иначе тенденция, скажем так, настораживает. Хотя по соотношению ценакачества он всё ещё может быть неплохим вариантом для не самых сложных задач.

Идём дальше. Следующая модель от Antropic Clod OPUS 4.1. Что про неё можно сказать по тестам? Ну, главное, что сразу бросается в глаза - это стоимость. В источнике приводился пример, один из самых сложных тестов. Ну, симуляция создания WebOS обошёлся в 50 долларов только на вызовы этой модели. Ого, 50 долларов за один тест. Это прямо заставляет задуматься о повседневном использовании.

Вот именно. Автор тестов субъективно отмечает, что Опуus, возможно, меньше подходит для такой рутинной кодиговой работы здесь и сейчас, но может быть полезнее для задач, ну, высокоуровневого планирования архитектуры или для сложных рефакторингов. А вот как. К тому же он работает заметно медленнее, чем Son.

А что по результатам? Понятно, что данных меньше из-за цены, но всё же. И снова на первом месте угадай кто? Неужели опять варп? Именно варп, причём с абсолютно заоблачным результатом больше 27.000 баллов. Это, возможно, вообще рекорд за всю историю этих тестов. Ничего себе. Именно Sopus 4.1 впервые смог пройти один из самых сложных тестов с результатом выше 87%. Это, ну, действительно, впечатляет.

Невероятно, кто ещё смог совладать с OPС. На втором месте Root Code. И это, кстати, объясняет, почему разработчики Root Code так любят использовать именно опус. Их обвязка, похоже, хорошо с ним работает. Логично. На третьем месте Айдер. От него, судя по всему, ожидали даже большего. И что показательно, клод кода 5 оказался на последнем месте среди тех, кого тестировали с OPUS. То есть падение подтверждается и на более мощной модели. Да, похоже на то.

А что можно сказать про Gemini 2.5 Pro от Google? Его тестировали не так много, в основном в связке с инструментами самого Google Jemini Code Assist и Jemini Clea. Общий вывод, который сделали в источнике, довольно суров. Модель, ну, постепенно теряет актуальность на фоне более сильных конкурентов. Понятно.

Переходим к миру Open Source. Модель Quen 3C кодер от Алибаба. Какие о ней отзывы? Её называют одной из лучших, если не самой лучшей, открытой моделью для кодинга. На данный момент в источнике выражалась такая большая надежда на появление модели среднего размера в этой линейке. В смысле? Ну что-то между существующими тридцатимиллиардной и гигантской 480миллиардной версиями, чтобы можно было эффективно запускать локально. А вот она что интригующе.

А как она показала себя в тестах с разными агентами? Здесь лидером стал Квин-код. Похоже, у них получилось создать очень эффективные промпты и настройки именно для этой модели. Угу. На втором месте, и это было большим сюрпризом, оказался Клода код Грураутер. Тот самый, с которым были сложности. Да, тот самый. В связке с Квен 3 он сработал неожиданно хорошо.

Кто ещё из агентов подружился с Квен 3? Очень интересная история с OpenC. Он показал просто феноменальные результаты, когда использовал Квен 3 и через провайдера Fireworks AI. А через другого? А вот через провайдера по умолчанию это Openраутер значительно хуже. Это ещё одно яркое подтверждение тезиса о важности объязки и того, как именно агент работает с моделью, через кого, с какими параметрами. Да уж, показательно. Также в топе оказались root Code, Killow Code и Cle.

А были те, у кого связка с Q13, ну, не задалась? Да, были. Acer, GitHub Copilot в стандартной конфигурации и Z показали не лучшие результаты. Z, например, вообще получил ноль баллов в одном из тестов. Он часто просто сдавался на полпути, прекращал генерацию. Да, неприятно.

Теперь давай обратимся к, пожалуй, самой ожидаемой новинке GPT5. Модель, безусловно, очень сильная, но её производительность, как выяснилось, сильно зависит от выбранного уровня рассуждений. Ну, reasoning level. Что это такое? По сути, это настройка, которая определяет, насколько глубоко модель должна продумать задачу перед тем, как выдать ответ. Уровни там разные. Minimal, medium, high. И не везде можно выбрать. Да, не все агенты позволяют пользователю выбирать этот уровень. Как уже говорили, GPT5 отлично следует инструкциям, но ей, как и другим, нужны знания в конкретной предметной области.

И кто же оказался лучшим проводником для GPT5? Номером один стало расширение для VS-код, называется Codex IDE, при использовании с высоким уровнем рассуждений Highasoning. Угу. В источнике отмечается, что это очень перспективная и быстро развивающаяся экосистема. На втором месте снова VARP уже с уровнем Medium Rening. Скорость работы при этом была вполне приемлемой. Вар прямо в ударе в этом месяце. Точно. Третье место занял Курсор. Он использовал уровень рассуждений по умолчанию дефолт, но он субъективно ощущался довольно медленным.

Кто ещё попал в список успешно работающих с GPT5? На четвёртом месте код Компли. тоже с медиум reasoning. Он тоже активно развивается. Недавно добавили новые фичи. Z и Трей показали в целом хорошие результаты по качеству кода, но Трей Трей был отмечен как невероятно медленный. Прямо так и написали, да? Просто мучительно медленный. Судя по описанию, Айдер и Краш тоже продемонстрировали неплохую производительность, а были проблемы. А вот у Open Code и AGM возникли проблемы с работой с GPT5. Они часто не доводили задачу до конца, сдавались, возникали ошибки при вызове инструментов.

А что это за вызов инструментов? Tool calling - это способность модели использовать внешние функции или команды. Например, запустить тесты или найти файл. Вот с этим были проблемы. Возможно, дело было в специфике тестового окружения. Например, OpenCE часто тестируют в WSL. А Windows Subsystem for Linux. Да, и не все агенты одинаково хорошо там работают. Понятно.

И последний из основных игроков, которого мы рассмотрим, GRК Code Fast от XAI. У этой модели есть два огромных плюса. Первое, она невероятно быстрая. Второе- очень-очень дешёвая. Её даже назвали королём экономии. Ого. Плюс есть возможность кэширования результатов, что ещё больше ускоряет. Но есть и серьёзные минусы. Во-первых, уже говорили проблемы с вызовом инструментов. Tool calling. Модель не всегда корректно их использует. Угу. Во-вторых, ошибки, связанные с окружением. Она может пытаться выполнить команды, которых нет в системе, или неправильно понимать вывод команд.

Несмотря на проблемы, как она показала себя в тестах, лучше или хуже ожиданий? Результаты оказались в целом лучше, чем можно было ожидать, учитывая вот эти проблемы. Хотя обычно GR Code Fast находится во второй половине итоговых таблиц, а сюрпризы были. Самый большой сюрприз здесь второе место занял GitHub Cilot, когда использовался грок через провайдер Open Router. Это очень неожиданно высокий результат для такой связки. Обычно Copilot не показывает чего-то выдающегося с моделями не от Open. Eye. Да, удивительно. А кто на первом и третьем? На первом месте снова кюрсор, а на третьем rootкод. Причём отмечалось, что разработчики Rootc специально адаптировали свой инструмент для лучшей работы именно с GRК Codefast. В частности, улучшили обработку вызовов инструментов. Понятно. А вот Cloud CД Router и Winzerf оказались в нижней части списка при работе с этой моделью.

Давай теперь вернёмся к новичкам, которых мы упоминали в самом начале. Посмотрим, как они проявили себя в общем зачёте. Если судить по тестам с моделью Clot Sonet 4, то лучшим среди новичков оказался C. Он показал весьма достойный результат. Угу. Однако, как мы уже упоминали, с GPT5 его производительность была значительно хуже.

Кто на втором месте среди дебютантов? Это Kira тоже с SIT 4. Результат вполне солидный, но сам агент, ну, как уже говорили, это ещё один клон VSкод, что сегодня уже не вызывает такого восторга, как может год назад. Рынок насыщен подобными штуками, это точно. И на третьем месте среди новичков coder. Результат не то чтобы выдающийся, но если этот инструмент будет дешёвым, он может найти свою нишу. Напомним, модель там точно неизвестна, но предполагается, что это Qвен 3 Coder.

Итак, мы рассмотрели просто уйму моделей и агентов. Давай попробуем собрать всё это воедино. Какие главные выводы и тенденции можно выделить из этого масштабного тестирования?

Ну, если взглянуть на сводные графики, где результаты разных моделей показаные разными цветами, то хорошо видно, есть группа явных лидеров среди самих моделей. Это GPT пты, Clot Sonet четвёй, Clot Opus 4.1 и QNC Coder. Угу. Важно отметить, что разница в их пиковой производительности на сложных задачах, она не так уж и велика. Они все способны на многое. То есть выбор лучшего инструмента уже не сводится просто к выбору самой умной модели. Это уже не так просто.

Совершенно верно. На первый план выходят другие факторы: стоимость использования, скорость работы и модели, и агента, а также наличие у моделей специфических знаний, нужных для конкретной задачи или области программирования, и обвязка. И, конечно, как мы неоднократно видели, критически важен сам агент и его обвязка. Можешь ещё раз напомнить примеры, где агент сыграл решающую роль? Самые яркие. Самый яркий этого месяца взлёт ORB, который из аутсайдера превратился в лидера. И Sunnet и с OPUS благодаря улучшениям самого агента или Quind Code, который выжил максимум из открытой модели Quent 3. Дада. Или кодекс IDE, показавший лучший результат с GPT транше за счёт грамотной интеграции и выбора высокого уровня рассуждений. С другой стороны, падение CLД код во всех тестах - это пример того, как даже хорошую модель можно испортить неудачной обвязкой или, возможно, агрессивной оптимизацией.

А что насчёт других тенденций? Что ещё заметно? Гроккод Fast выглядит очень перспективно, из-за скорости и цены, особенно если разработчики решат проблемы с надёжностью вызова инструментов и работы с окружением следующей версии. Будем надеяться. Также стоит отметить проблемы со стабильностью у некоторых агентов определённых условиях. Ну там openды или augment при работе с GPT5 или UZS с Quen 3, особенно в средах типа WSL. Это напоминает, что важно тестировать инструмент в своём реальном рабочем окружении. Да, это точно.

Очень интересно. Автор источника, кстати, поделился и своим личным выбором инструментов на ближайшее время. Вот на основе этих тестов, что он планирует использовать? Да, он рассказал о своих планах на сентябрь. Во-первых, он собирается активно использовать Кодекс ID. Несмотря на довольно высокую стоимость подписки ПРО, там что-то около 200 долларов в месяц. Немало, да? Ему нравится развивающаяся экосистема и возможности для сложного дебагинга, который она даёт. Правда, есть некоторые опасения насчёт возможного изменения лимитов использования в будущем. Ну, знаешь, ракпу. А, понятно.

А какие ещё инструменты в его личном топе? Фаворитами остаётся root Code и Open Code. Их ценят за гибкость настроек. Можно выбрать модель, провайдер, настроить температуру и другие параметры из-за простету конфигурации. Угу. Rootcode с графическим интерфейсом и Open Code как инструмент командной строки. Они как бы отлично дополняют друг друга.

А что будет склодкод, учитывая его падение в рейтингах? Будет им пользоваться? Использование Clot Code планируется сократить, отдавая предпочтение кодекс для более сложных задач. Грок Code Fast будет использоваться время от времени, но скорее для мониторинга прогресса этой модели, чем для постоянной работы. Основными же рабочими лошадьми остаются модели GPT FIS, Cloud Sonet и Q& Coder 3C, запускаемые через наиболее эффективные для них агенты. Также упоминались планы поэкспериментировать с большими локальными моделями, которые можно запускать на своём железе.

Были ли ещё какие-то почётные упоминания? Ну, инструменты, которые не в топе, но на которые стоит обратить внимание. Да, было несколько. Во-первых, краш отмечается, что это красивый инструмент, который становится всё лучше. Многие первоначальные проблемы вроде как исправили. Хорошо. Во-вторых, Огмент, у него отличный движок для работы с контекстом проекта. CLI версия выглядит перспективно, хотя пока уступает расширению для ID. Важно, что они добавили выбор модели, но поддержку GPT5 ещё нужно дорабатывать. Угу. И в-третьих, Kline упомянули новую функцию Cens Prompt. Она может быть полезна для работы с локальными моделями, у которых ограниченное контекстное окно.

Что ж, картина вырисовывается действительно очень динамичная. и многослойная. Мир и ассистентов для программирования меняется, ну, буквально каждый месяц. Это точно. Эти тесты ясно показывают, чистая мощь базовой модели - это лишь часть уравнения. Настройки самого агента, его обвязка, умение справляться с ошибками, стабильность работы в конкретном окружении. Всё это играет огромную, а иногда и решающую роль. Мы увидели неожиданные взлёды, как у Варжные падения, как у CL Code.

Так что же всё это значит для разработчика, который выбирает себе помощника? Главный вывод, пожалуй, в том, что выбор EИ инструмента для кодинга становится всё более нюансированным делом. Нельзя просто сказать: "О, GPT 5 лучшая модель, значит, берём любой агент с ней". Нет, не всё так просто. Нужно смотреть на связку модель плюс агент, учитывать стоимость, скорость работы, специфику своих задач и даже своё рабочее окружение. Результаты таких детальных тестов, как те, что мы сегодня разбирали - это, ну, бесценный компас, помогающий ориентироваться в этом сложном и быстро меняющемся пространстве.

И в завершении, как обычно, мысль для дальнейших размышлений. Вот если топовые модели действительно сближаются по своим фундаментальным возможностям, ну там понимать, исследовать инструкциям, то не сместится ли фокус конкуренции в ближайшем будущем? Интересный вопрос. Возможно, следующим полем битвы станет способность и агентов не просто выполнять команды, а эффективно управлять сложными рабочими процессами разработки, глубоко адаптироваться к специфическим инструментам и средам или даже предлагать какие-то проактивные улучшения и решения, выходящие за рамки первоначального запроса, что на самом деле будет определять лучшего и напарника для программиста завтра.