📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

Сравниваем на реальной задаче Claude, Qwen, OpenAI, Gemini и DeepSeek

Timur Karimbaev6:14

Transcription

В этом видео мы будем сравнивать нейросети. Мы будем сравнивать три американские нейросети, то есть вот Cloud, Open Eye и Gemini. И две китайские псик и Quin на какой-то более-менее стандартная задача вот создать форму обратной связи, а которая пишет данные в таблицу.

То есть нейросеть должна будет создать таблицу, должна будет создать форму, должна будет создать э endpint, который пишет данные в эту таблицу. Вот делать мы бы это будем на себя на чатиуме. Это у нас среда разработки, в которой можно просто ввести задачу и получить результат. Берём вот такой достаточно стандартный запрос. Сделай форму, а, три поля, email, телефон, а, и, ну, к примеру, имя человека. Сделай таблицу, в которую будешь записывать данные.

И давайте посмотрим, что нам сгенерирует клод. Вот у нас получился некий базовый вариант, который сгенерил плот. Давайте попробуем записать, а что-нибудь в эту форму. Посмотрим, что у вас случится. Так, здесь запись есть. В таблицах запись есть. То есть он сделал таблицу, он сделал форму. Давайте посмотрим на код. Он сделал в целом, ну, такое мини-приложение с апи, которое должно принимать запись. Оно отправляет уведомление администратору, записывает события и, в общем-то, всё. Ну и таблицу объявил.

Вот давайте возьмём этот результат за базовый и попробуем взять такой же промт, прямо один в один, скопировать его с разными нерозтями. Так, ну, я запустил эту генерацию по четырёх разных платках ещё. Одна из них Квен. Давайте посмотрим форму он сделал. Попробуем ввести что-нибудь. Так, здесь должен быть email. Он хорошо сделал тип поля. Так, вот он, например, дал ошибку. А-э, какую жику не знаю, но вот эта история про то, что квенкодер, который лучше, чем, точнее на уровне Clлот Санета и при этом очень дешёвый, она пока не оправдывает себя. То есть у них инструкции одинаковые почему-то. Вот, ну, где-то там внутри ошибка. Можно покопаться, что внутри ему не понравится, но факт в том, что Клод справился с первого раза, а Квен, ну, нужно уже дальше ээ отправлять и фиксить ошибку. Можно ещё раз посмотреть. То есть можно ему дать, сказать фикс и править её. Он её, скорее всего, пофиксит, но это будет уже второй запрос.

Давайте дальше посмотрим. Это у нас Open. I это у нас моделька, сейчас посмотрим, какая. Workspace GPT 41, которую они рекомендуют для кода. Давайте посмотрим. Так, здесь как минимум он ответил. Давайте проверим таблицу. Так, ну, в таблицу записал, тоже хорошо.

Давайте следующий. Здесь это deep китайский. Форма достаточно странная, но рабочая, в принципе, тоже принимается. Не могу сказать, что она мне нравится. Я бы такую ещё несколько раз правил. Ну, давайте проверим, как у нас отправка произошла. Что-то там случилось. Проверим, есть ли таблица. Таблица есть, данные записались. Ну, если не брать в расчёт визуал, то в целом он справился очень даже неплохо. Таблицу сделал, компонент, форму, всё сделал.

И последнее, что у нас есть, Giniгугловский. Ну, форма выглядит вполне себе прилично. Давайте проверяем запись. Да, и Джени тоже справился. На самом деле задача не самая сложная. Она для всех нересетей должна была работать нормально. Но вот почему-то Квин не справляется с первого раза разрекламированный.

Теперь давайте посмотрим на числа. Я точно также загрузил все числа в чатим, которые получены, и сказал ему: "Сделай мне сравнительную таблицу". Открываем её в новой вкладке и давайте посмотрим. Вот у нас задача для тестирования. У всех был один промпт. Вот результаты сравнения.

Итак, у нас есть Sonnet. А меня очень удивило, что он по стоимости самый выгодный, но в этом случае он просто уложился в меньшее количество запросов. Нересить, когда она видит ошибки в своём коде, она их правит. И, ну, вот, например, у на это ушло семь запросов на чтобы отправить, проверить, отправить, проверить. Другое дело, что она достаточно быстро справилась за 28 секунд со всеми этими проверками, но она потратила немножко больше денег. 12 центов против семи у Клода и семь забросов против одного.

Deepсик. Deпсик спрятался за 14 центов, что, кстати, очень удивительно. Обычно он самый дешёвый. Э за 29 секунд он управился. Очень близкий результат к Open. А, и у него это заняло шесть запросов. Кстати, прямо очень близкие результаты.

Джеминился за два запроса и потратил 11 центов, но думал достаточно долго. В целом форма была рабочая.

Квен отгобы потратил шесть запросов, 14 центов, 64 секунды. И самое плохое, что он сделал результат нерабочий, хотя задача достаточно простая.

Вот мы видим, что у нас есть 42 секунды среднее число и средняя стоимость такого такого результата, ну, такого в данном случае результата это 12 центов. Мы видим, что по скорости опера победил, по стоимости Sonне, по простоте, ну, в любом случае Sonnet он выдал самый приятный, во всяком случае для меня результат. Поэтому мы эту модельку берём в базу. Это была самая простая задача.

В следующих видео мы потестируем на чём-нибудь более интересном. Посмотрим, как справятся неросети с чем-то, типа поиска картинок или, ну, генерации более сложных лендингов, к примеру.