Transcription
А ты знал, что можно собрать рабочего и агента на своём компьютере бесплатно, без подписок, с доступом к твоим файлам? И это не чат GPT в браузере, это терминал, локальная модель и настоящий агент, который выполняет задачи.
В этом выпуске покажу полный путь от поиска модели на Hagenface до запуска агента через клодкод или гусь. протестируем реальные задачи, кодинг, анализ файлов автоматизации на маленьких локальных моделях и поймём, насколько вообще они к этому сегодня приспособлены.
Людироботы, привет. Это Продсовет. Меня зовут дядя Д. Чтобы нас поддержать, подпишитесь на канал и поставьте лайк и комментарий к этому видео. А чтобы разворачивать проекты любой сложности, используйте Selecttel. Топовые видеокарты, бесплатная миграция, кастомные конфигурации. Подробнее по ссылке в описании.
Как уже сказал, пройдём полный путь. Будет много практики, поэтому готовьте свои мозги, пальчики, терминалы, локальные машины и всё в этом духе. Перед тем, как запускать что-либо, нужно понять, где вообще брать модели, как они называются, что значит вот эти вот сложные обозначения. Давайте разберёмся.
Есть hinface. Это как GitHub, но только для нейросетей. Там лежат сотни тысяч моделей, всяких датасетов и куча разной интересной эмэлечной истории. Но не пугайтесь, нам нужны локальные модели. Давайте покажу, что искать. Когда вы изобреёте на Хагинфейсе, начнёте поиск по локальным моделям, то часто увидите вот такие вот сложные названия. Как вообще разобраться, что это значит? Погнали.
Вначале, конечно, идёт название самой модели. И сразу во всех названиях моделей есть количество параметров. Например, мы с вами будем запускать модельки GEM 4 в разных вариациях. 4 млрд параметров и 26 млрд. Здесь вы видите 26 млрд параметров в версию и А4B значит, что там 4 млрд активных.
Далее нам всегда нужно выбирать вот этот формат GGUF - это упакованная версия модели, которая влезает на обычный компьютер. Это такой контейнерный формат, как ZIP или MP4. Внутри него лежат веса модели, такинизаторы, настройки. И мы можем без лишних заморочек запустить это на нашей локальной машине.
Ещё часто в названиях моделей есть такая приписка IT или Instrct, что говорит о том, что модель понимает инструкции вот в этом формате взаимодействия модели и пользователя. Всегда выбирайте именно такие версии. Ну и, наконец, квантизация модели. Это бывают совершенно разные обозначения FP16, что значит полная версия точность 16 бит. Бывают квантизации Q8, Q4, Q3, Q2 и так далее. Чем выше квантизация, тем более качественная и менее урезанная модель. Поэтому, если ваша локальная машина позволяет запускать версии с большей квантизацией, то выбирайте циферки побольше.
Ну и погнали к реальному примеру. Вот я захожу на сайт HAINF. Он встречает нас таким интерфейсом. В поиске я могу ввести название моделей, которые хочу установить. Предлагаю вам последовать моему примеру и работать с модельками Гемma. Это модели от Google. На данный момент они очень вкачанные, действительно крутые. По уровню большей версии этих моделей совпадают с уровнем модели GPT4O, которая вот когда-то давно в целом вызывала большое количество фурора уже в EA комьюнити. Просто вводим в название гемма. И дальше мы видим разные версии модели, которые мы можем выбрать. Начнём с установки модели Gemma 4E4B. Это значит, что у модельки 4 млрд параметров. И видите, у него здесь сразу есть переписка IT, что значит инстракт. И дальше вы можете почитать на Хагинфейсе все вот эти вот характеристики модели. Тут большое их количество, разные бенчмарки для разных версий. Но нам следует идти вот в это, в эту область. И смотрите, тут вечеринка такая. Усорсных моделей есть так называемые файнтюны. Это когда модель взяли и что-то в ней изменили. Могли изменить сильно, могли могли изменить не сильно, дотренировать её как-то, докорректировать. Например, бывают модели расцензурированные, где нет никаких этических ограничений. Я покажу одну из таких моделек.
Если вы хотите использовать абсолютно базовую версию и не искать что-то более замороченное, то сразу следует идти в раздел квантизации, выбрать нужный нам формат. Как я говорил, это GGUF. И в данном случае вот провайдер Unsloth, часто вы его встретите, предоставляет такой формат. И можно сразу посмотреть количество скачиваний. Тут их огромное количество, что уже говорит как минимум о том, что модель пользуется популярностью. Переходим сюда. И вот здесь, вот в этом разделе, вы сразу можете посмотреть, насколько модель подходит под ваше устройство, будут ли запускаться её разные версии на вашей локальной машине. Для этого, конечно, нужно настроить в аккаунте HagenF, что у вас из устройства. Нажимаем вот на этот чудный шестерёнку и добавляем сюда ваш хардвер, то бишь ваши характеристики вашего устройства. Я уже добавил в свой Apple M4 Pro 24 ГБ оперативы. И, соответственно, когда теперь я захожу на страничку любой модели, я вижу эту чудную зелёную, жёлтую или красную галочку, которая говорит мне о том, что модель потянет или не потянет на моём устройстве. Базово выбирайте модель средней версии 4бита. Это квантизация Q4К - это самая такая стандартная и базовая квантизация, которая в целом подходит для большего количества задач. Модель не сильно умная, но и не сильно тупая. Выберем её.
И дальше нам нужно выбрать провайдера, как это всё дело запустить. Я вам предлагаю использовать Олаama. Для этого, конечно, Оламу нужно установить. Делается катастрофически просто. Заходим на сайт olama.com и либо устанавливаем десктопную версию, либо устанавливаем по этому cl, который нам сразу здесь на на страничке видим и предлагается. Альтернатива алама и выбираем, собственно, скачать для вашей операционной системы десктопное приложение. После этого десктопное приложение нужно запустить. Вы можете, кстати, общаться с моделью прямо в привычном вам интерфейсе чата, но я дальше все настройки буду показывать через терминал.
Вернёмся на hgen нужную нам команду. Мы выбираем провайдеров, которым мы будем запускать эту модель. Я выбираю Олаama. И мы сразу видим ту команду, которую нам нужно ввести в терминал. Переходим в терминал, команду вводим. Всё очень просто. Загрузка модели начинается. И по этой конкретной команде вы сразу запустите модель после того, как она загрузится. Если вы хотите просто модель скачать без запуска, то запишите сюда команду Allлаama Pol. Точно также нажмите Enter, и модель загрузится. Я их сейчас загружать не буду, потому что у меня уже установлено приличное количество этих моделей. Мы можем ввести команду Allam List и посмотреть на весь список тех моделей, которые у нас установлены, и, конечно, на то, сколько места они занимают. Учтите, что вам нужно какое-то количество места на вашей на вашей карте. Видите, большие модели занимают по 18-16 ГБ.
Для наших с вами сегодняшних тестов я буду использовать фантюненную версию локальной модели Gemma E4B. Она называется вот таким вот образом. Некий Need all её зафтю за зафантюнил и выложил в открытый доступ. Можете перейти по этой ссылочке и тоже её скачать. Она у меня же уже загружена, и её главное преимущество в том, что она расцензурирована, у неё выключены абсолютно все гардрейлы, ограничения. Вы можете общаться с ней на любую тему, и это прикольно. В целях того, чтобы YouTube не ругался на этот ролик, я не буду ничего противозаконного или противоэтического сегодня вам показывать в работе с этой моделью. Но по моему опыту самые разнообразные темы с ним можно обсуждать достаточно смело.
Чтобы её скачать, аналогичным образом нажимаем Us model, выбираем Olama, которую нужно ввести в терминал. Я эту модель запущу и сразу покажу вам то, что она работает. Вы можете начинать общаться с ней в чате прямо здесь через терминал. Она мне катастрофически быстро ответила. Если вы хотите увидеть чуть больше статистики о том, как модель вам отвечает, с каким количеством токенов секунд и так далее, то, соответственно, можете ввести вот такой вот такую команду set verbow, и вы сразу увидите определённую метату по вашему рану запуску модельки.
Но смотрите, какая проблема возникает прямо сейчас. для того, чтобы использовать локальные модели, которые мы загрузили через Олаama, как и агентов, чтобы у них был доступ к инструментам, к нашим файлам, к нашему контексту, как мы привыкли работая с клодко или другими агентными харнесами, а ламы недостаточно. Что же делать? Обязательно вам расскажу после короткой интеграции, коей являемся мы сами.
Совсем скоро стартует наш интенсив и разраб, где мы за 4 недели будем создавать продукты, проекты, автоматизировать свою ретину и идти от идеи к реальным клиентам при помощи и инструментов. Соестно, мы катастрофически сильно прокачали эту программу, этот поток. Это уже четвёртый запуск. У нас будет 4 недели с полноценным обучением и менторством от наших разработчиков. Первую неделю будем говорить про старт, идею, настройку окружения, затем поговорим про и разработку, и создание сквозного проекта. Конечно, пообсуждаем инфраструктуру, завершение продукта, разные настройки быстрого деплоя, CCD, как настраивать оплаты, безопасности, отладки. Ну и в конце у нас будет защита проектов. И более того, у нас есть партнёры. Будет возможность получить стажировку в AID компании, оплачиваемую и даже от партнёра нашего канала Select получить сервер абсолютно бесплатно для того, чтобы вы сразу начали запускать свои продукты и срезали свои косты на тесты и гипотезы. Ведём курс я, Сергей Эль, мой коллега, архитектор в области и разработки, Евгений Шиконов, IT-руководитель и разработчик, и ещё разные приглашённые эксперты. Честно, будет очень насыщенная программа, поэтому, если вы готовы инвестировать силы и время для того, чтобы действительно достичь результата и освоить эту новую область, то приходите. На ряде тарифов вы получаете доступ ко всем нашим курсам по иагентам, по созданию и аватаров, и видео, базовому промтингу и, в общем, всё, что мы уже создавали. и за время нашей работы накопили и нагенерировали контента. Поэтому выбирайте подходящий вам тариф и увидимся на интенсиве. Стартует совсем скоро, 11 мая.
В этом ролике я показываю вам те модели, которые вы действительно можете использовать как иагентов. Но если вы захотите дальше в эту область погрузиться, углубиться, то всегда обращайте внимание на катастрофически важную характеристику локальных моделей, которые вы будете скачивать. А именно Tool calling, вот эта вот штука или tool use, tool calling, вот этот параметр всегда должен присутствовать в описании модели. В противном случае модель не будет обучена использовать инструменты. Это главная фишка и агентов. И вот эта вот файнтюнинная расцензурированная версия модельки имеет Лколин. И базовая версия Геa 4 имеет толколинг. Давайте посмотрим, как их настроить и как запихать их в клод-код или гуся. Если прямо по шагам.
Смотрите, я нахожусь сейчас в какой-то папке, и неплохо бы узнать абсолютный путь к этой директории, который выглядит вот таким вот образом. У меня есть ряд моделей, которые я могу узнать при помощи команды Allam List. И тут у меня есть уже модели, отредактированные, приспособленные для запуска, как и агентов. Возьмём самую базовую версию модели, например, на 26 млрд параметров. Вот она у меня есть. Если вы повторите мой путь и скачаете модельку Гема 426 млрд параметров, э, при помощи уламы, то вы увидите именно такое значение. Сейчас у этой модели, во-первых, неправильное контекстное окно, не то, которое нам нужно, и, во-вторых, в неё не записано использование инструментов. Нам нужно с вами создать модуфайл. так называемый, и немножко его изменить.
Базовая команда выглядит следующим образом. Сначала мы с вами вводим команду Allлаam Show. После этого через вот этот вот флаг двойной дефис вводим значение modele. Дальше название той модели, которую мы хотим менять обязательно. Я меняю сейчас GMA 426B. Я буду вводить именно её название. После этого мы прописываем путь к новому модел файлу, который мы с вами создадим, через вот такую вот галочку. И я хочу этот модельфайл создать в моей директории, в которой я сейчас и, собственно, а, ну, практически в которой я нахожусь. Я её запишу в users Daniel My AI, потом Temp, и дальше вот здесь вот я введу название этого нового модул файла. Давайте мы его немножечко переназовём. Это будет GEMA 4 YT, чтобы мы с вами не запутались. То есть этой командой мы просто создадим файлик с настройками модели, которые мы потом откроем с вами и отредактируем ещё раз. Вот это вот название модели, которую мы будем менять, вот здесь вот вам нужно изменить просто на название, которое вы хотите придумать для вашей новой модели. Ну и, соответственно, прописать абсолютный путь к той директории, куда этот файлик будет положен нашим терминалом и вызовом нашей команды. Я ввожу эту команду и получаю ничего. Но я только что сделал этот файлик. Предлагаю его найти. Я открыл в визуальном редакторе Z свою папку My AI. Мне нужно найти папку М. И в ней должен оказаться этот модел файлик. Вот он, смотрите. Gemma 4 YT model file.
В данном конкретном случае мне нужно в этом файлике провести несколько операций. Во-первых, модель идёт с виженом, она может понимать картинки. У меня не получилось заставить её это делать, поэтому я убираю вот эту вот строчку, которая предопределяет её вот эту вот способность. Просто её отсюда стираю. Далее, для того, чтобы Алама видела, что модели есть инструменты, нужно ввести два вот таких вот значения. Кстати, всё обязательно, конечно же, там в Telegram-каналах или где-то по ссылочкам. Я эти инструкции предоставлю и там у меня найдёте в канале. Переходите, смотрите. И вот эти вот две строчки ещё раз определяют, что у модели есть возможность использовать инструменты. Это хорошо. Ну и дальше ещё один параметр, который перезапишет контекстное окно модели, потому что базово они все идут с контекстным окном 4.000, хоть у них есть возможность там до 120.000 это контекстное окно расширить, но как только вы скачали модель, у неё вот это вот дурацкое контекстное окно в 4.000. Нам нужно это перезаписать. Если хотите использовать контекстное окно, там 32.000 токенов, то мы это перезаписываем вот таким вот параметром. Параметр нам CTX 32768 - это должно быть точное число. Если хотите меньшее количество токенов использовать, проперплексите посмотреть, какое конкретное число вам нужно ввести. И на самом деле всё. Нажимаем сохранить.
После сохранения переходим в терминал снова и вводим уже команду для того, чтобы создать модель. Выглядит она следующим образом. Смотрите, create. Дальше название модели, которую мы с вами опреде определили ранее. Напомню, у меня это Gemma 4 YT. Давайте я так это название сюда и введу. Гмма. 4 YT и дальше путь к этому файлу, который тоже мы с вами создали ранее. Вот здесь он у меня снова неправильный. Здесь у меня ведь такая переменная. Точно также Gemma 4 YT. В нашем конкретно в моём конкретном случае это всё будет называться. Даже давайте нажмём Enter. Не нашёл модулфайл. Я где-то ошибся. А именно я ошибся вот здесь. Не нижнее подчёркивание, а дефис. Нажимаем снова. Собираю модель. И обратите внимание, сейчас мы создадим новую версию модели, и она снова займёт место на нашем компьютере, что, конечно, немножко страшно, если у вас его там мало.
Введу сначала команду clear для того, чтобы терминал очистить. После этого введу команду Allam List. И мы увидим, что вот она появилась родненькая GEMA 4 YT latest. Мы можем её запускать теперь в наших агентных средах. Я её прямо сейчас удалю, потому что у меня уже есть такая же адаптированная версия модели, но на 64.000 контекстного окна, видите, она называется у меня здесь вот таким вот образом. Поэтому, чтобы она лишнее место на моём компьютере не занимала, удалю эту модель при помощи команды Oлаama RM и наименование модели.
Если вы хотите теперь проверить, что всё заработало, что у модели появились нужные параметры, мы введём с вами команду Allama Show и добавим название этой модели. Здесь в capabilities мы увидим заветные completion, чтобы было всегда tools и thinking. Мы добавили вот эти два параметра. Теперь модель использует использует инструменты, использует режим резонера. Думающие погнали запустим её в агенте.
Алаama не так давно завезла очень удобную команду, которая позволяет запускать модели локальные через клод-код. И выглядит она следующим образом. Катастрофически всё просто. Вы, в принципе, можете ввести команду Олаama launch clot и выбрать здесь любую модель, которая у вас есть. У меня тут ещё облачная подписка на ламу. И все мои локальные модельки тоже здесь есть. Видите? Вы можете просто их выбрать в таком удобном интерфейсе. Либо в противном случае просто сразу через флаг выбрать нужную вам модель. Причём есть несколько режимов. Вот есть режим Bare mode, который является таким минимальным режимом, который не загружает проектный контекст, не загружает ваши MCP скилы, всякие фоновые процессы. Он для слабого железа подойдёт лучше. Ну и для версий модели, кото у которых контекстное окно меньше. Также вы можете через разные флаги прямо конкретно ограничить разные инструменты, например, только использовать терминал, только использовать чтение файлов. И, в принципе, можете очень кастомизированно запускать локальные модели модели через код-код.
Проблема следующая. У меня они работали там достаточно плохо. То есть по моим экспериментам всё это запускалось, ну, прямо коряво. Те версии моделей, которые я использовал, были очень слабые, и они прямо не могли вызвать инструменты. Но вот что-то в клод-коде так работает. Какая-то у них там своя схема вызовов, которая не стакается немножечко на данный момент вот с этими маленькими локальными модельками, которые я пробовал запускать. Поэтому, несмотря на то, что ролик называется Клодкод и агент и всё вот это вот, если он так называется, я вам предлагаю использовать гуся. Прекрасная штуковина, гораздо менее нагруженая разными функциями, но позволяет запускать локальные модельки только так.
Заходим сюда либо качаем терминальную версию при помощи команды, что сделать достаточно просто. Я использую именно её. Либо качаем десктопное приложение, но терминал мне нравится. One love, буду работать через него. Ну и дальше всё катастрофически просто. Мы с вами гуся вводим. Я думаю, как только вы его скачаете, вы пройдёте определённый этот установщик wiard, который поможет вам всё сконфигурировать. Но дальше для того, чтобы поменять вашего провайдера внутри гуся, мы вводим команду configure. После чего нажимаем configure providers. Я выбираю Olama Local Open Source Models. Enter. Не перенастраиваю никакие хосты, не перенастраиваю Advanced настройки и просто выбираю ту модель, с которой я хочу взаимодействовать. Не сразу у нас здесь с вами все появляются вот наши супергемы. YT не YT. Выберу сейчас вот эту версию модельки, которой я создавал ранее. У неё 64.000 контекстного окна. Нажимаю Enter. Мы, точнее гусь конфигурирует всё это дело. И дальше нам остаётся запустить гуся опять же несколькими командами.
Если мы запустимся только при помощи команды Гусь, то мы сразу в него загрузим все те системные, ну, точнее ваши кастомные настройки вашего вашего агентного окружения, которые вы, вероятно, уже создавали, если смотрели мои предыдущие ролики. Всякие agent, MDC, MD, различные скилы, возможно, туда подтянутся. То есть некоторые Давайте ему напишем: "Привет". Может, он нам даже покажет, сколько контекста он уже выжрал в таком режиме. То есть некоторое количество сразу системных инструкций в него залетит, как минимум там Clot MD, Agent MD, который у меня есть. Но опять же всё описание всех тех инструментов, как работать со скилами, с тудулистами, с вызовами всяких л команд, баш команд, вот этого всего прекрасного чуда, это всё сразу попадёт в контекст модели. А это значит, что если у неё маленькое контекстное окно, то она как бы это всё и не вывезет. Смотрите, она уже катастрофически долго думает. То есть помните, насколько быстро ответила мне вот эта самая базовая версия модельки, когда я запускал её через Оламы. Ну о'кей, она там догрузилась, запустилась, дальше будет отвечать быстрее, но тем не менее, видите, она сразу под поняла, отличная площадка user Danнил my и яй с твоим хранилищем знанием. Она уже знает создание контента, исследование обучения, разработка кодиг, Obsidian W. Она знает, что у меня я использую Obsidian как всё вот это вот визуальное окружение. И мы видим с вами, что 15.000 тыся контекста было выжрано сразу просто тем набором файлов, которые уже есть как бы внутри моей рабочей директории.
Вариант запуска моделей, который я нашёл достаточно интересным и тем не менее как будто бы удобным для ряда случаев выглядит вот таким вот образом. Я сотру сейчас Max Sterns, не буду, наверное, объяснять, что это, но вот такую команду вы можете ввести. Точно так же вы запустите гуся и в таком случае он уже не будет подтягивать сюда всякое описание MCP, описание, которое у вас есть в ClД MD, но тем не менее у него будет доступ к различным командам и в целом достаточно агентный модель будет перед вами. Посмотрите, насколько сильно изменился её ответ и количество токенов, которое было ей использовано за раз. Минус 6.000 токенов мы сразу сэкономили, скажем так. Он уже говорит, что он гус, потому что у него нету вот этих клод MD и информации о том, что за проект, с каким он работает. Тем не менее, он сразу понял, в какой рабочей директории он находится. Ну и всё-таки вытащил некоторую информацию о моих проектах и обо мне об этом отчитался, ответил гораздо быстрее.
Ну и третий режим запуска модели через гуся выглядит следующим образом. Go Session No Profile. Если я не ошибаюсь, вообще никакие инструменты сюда не подтягиваются. Это просто возможность ваша работать с локальной моделью в интерфейсе гуся, но как бы вообще без каких бы то ни было инструментов. Но, видимо, я вам всё-таки наврал. Она прекрасно знает, кто я. Всё-таки подтянула информацию о себе, а точнее обо мне и даже чуть больше, чем в предыдущем запуске. И тоже 6.000 токенов выжрало, наверное, потому что здесь как раз-таки её девелоперовские инструменты, всякие башкоманды не подтянулись. я выдам вам это как домашнее задание разобраться, в чём разница между этими двумя способами запуска.
Ну и, на самом деле, дальше я провёл несколько тестов, работая вот с этой маленькой моделькой на 4 млрд параметров разцензурированной и работая с большой моделькой на 26 млрд параметров. Первый тест выглядел следующим образом. Вы можете прочитать этот пром. Я прошу модель достаточно подробно, какой мне создать проект. простенький консольный таск-трекер в текущей папке. Описываю всё, что мне нужно сделать, от неё получить. Ну, и, откровенно говоря, обе модельки с этим справились. Но первая моделька на факапила много. Во-первых, сам результат программы получился не идеальный. Она где-то дублировала ответы, дублировала те задачи, которые были в моём тасклисте. Во-вторых, добавляла абсолютно ненужные разделители, о которых я у неё просил. Тест она провела неполноценно, самостоятельно консоль запустить не смогла и тем не менее сказала мне, что о'кей, я всё сделал и всё работает хорошо. Поэтому откровенно результат достаточно слабый, хоть она это и выполнить смогла. В то время как модель на 26 млрд параметров вполне себе выполнила очень недурно эту задачу. И у меня вообще нет нареканий, по крайней мере, на том уровне, на котором это всё работает. по частоте кода наверняка там есть огрехи и проблемы, но в общем и целом с таким форматом несложных задач модель справляется.
Следующей моей задачей было проверить как раз-таки агентные способность, умение вызывать инструменты, умение вызывать скилы. И что интересно, моделька маленькая, в принципе, как бы поняла, что нужно вызвать скилл. Она его не смогла, тем не менее, вызвать, потому что она запуталась в инструментах. Она начала использовать это как тул, а не как скилл. То есть, по сути, если, наверное, с более грамотными инструкциями, она бы смогла это сделать, но здесь она зафакапила, потому что у меня всё-таки большое количество, там 16.000 контекста сразу на вход, и модель запуталась, несмотря на то, что контекстное окно у неё более 60.000 токенов. Тест она провалила, она написала абсолютно нерелевантный пост. Тем не менее, она обработала тот пост, который я её просил, сделала мне самри. Как-никак, это какой-то результат, хоть и не тот, который я ожидал. скил она не вызвала и не смогла получить нужный контекст, чтобы выполнить работу в том формате, котором я от неё ожидал.
Ну и абсолютный трэш, конечно, с моделькой G 426 млрд. Она у меня на железе запускается плохо. Ну то есть она очень слабо тянет, и у меня загружается не только GPU, но и CPU. Когда вы модель запускаете или оно у вас было только что запущено, вы можете в отдельном окошке терминала посмотреть это при помощи команды Allama PS. У меня вот, видите, маленькая модель сейчас запущена. И здесь 100% GPU заюзано, контекст, бла-бла-бла. Если здесь у нас не только GPU на 100%, но и CPU, то модель уже работает достаточно плохо, медленно. Ну и вот такое количество минут, как бы модель потратила, чтобы не ответить. И не ответила. Я всё это закрыл. Ошибка, не ошибка. На самом деле печаль. Для такой супербазовой, для моей рутины рабочей задачи модель, к сожалению, не подошла.
Ну и, наконец, ещё одна задачка, которую я хотел вам показать в прямом режиме, но что-то мне стало уже лень. Поэтому здесь вы видите результаты. Я прошу модель использовать Brave MCP для того, чтобы пойти и собрать три последних ролика с моего YouTube канала и сделать JSON файлик на компьютере, мне об этом отчитаться. Маленькая модель сумела выполнить задачу, но она не нашла релевантные ролики самый последний и не сделала JSON файл, а только прислала мне в JSON формате её ответ. А с большой модели опять полная катастрофа. Она думала 10 минут и не смогла ничего выполнить. Думаю, если выбирать модели, чуть-чуть более подходящие под моё желёзы, то они будут работать лучше. Но, к сожалению, эта версия модели на 26 млрд параметров тотально не справляется с моими задачами внутри агентных харнесов.
Да и на этом, в принципе, всё. Моей главной задаче было показать вам, как запускать локальные модели в качестве и агентов. И, честно, по-моему, пока что абсолютно не применимо. В ряде задач может быть суперпростеньких задач может быть, но скорее локальные модели сейчас больше идут на какие-то такие скриптовые штуки, когда у вас есть просто рутинная работа по обработке каких-то данных или самаризации или заполнение таблиц или переводы. И вы вызываете этот интеллект, скажем, при помощи скрипта, и вы даёте ему просто такими пачками, батчами или короткими отдельными задачами на обработку тот или иной кусочек текста. С большим контекстом они вроде, ну, как бы и да, но вроде как бы и даже на моём железе модель 26 млрд запускается уже туго. А это хоть какой-то приемлемый уровень интеллекта, потому что, ну, 4 млрд совсем, честно говоря, потупливает и слаба и на кодинговых задачах, и на ресрчерских, и на агентских, и всё в этом духе.
Надеюсь, ролик оказался полезным. Ставьте лайки, комментарии, подписки. С вами был продуктивный совет дядя Д. Куча полезной информации по ссылкам в описании. Увидимся в будущих выпусках. Пока.