📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

Run ANY AI Model on Your Machine WITHOUT a GPU! (Ollama Cloud)

Execute Automation8:34

Transcription

Привет, ребята, добро пожаловать обратно, и сегодня мы поговорим о том, как вы можете использовать мощь больших языковых моделей, работающих локально на вашей машине, для целей разработки и тестирования. Это один из вопросов, который возник у меня во время конференции здесь, в Окленде, Новая Зеландия, и один из участников спросил меня, что у нас на самом деле нет такого большого потенциала и мощности на наших машинах для запуска большой языковой модели, потому что каждый раз, когда мы пытаемся ее запустить, возникает проблема с памятью или она не может обрабатывать какие-либо запросы. Так какой же именно способ мы можем это сделать, не тратя на это никаких средств, потому что, если вы проводите тестирование на своей локальной машине, вы знаете, что вам не нужно тратить на это деньги, потому что все будет работать на вашей машине, поскольку сама большая языковая модель размещена на вашей машине. Если вы используете Olama или любое другое средство. Так как же именно обойти эту конкретную проблему? Ну, угадайте что? Есть способ, которым вы можете это сделать. На этот раз мы будем использовать то же самое событие Olama, но только на этот раз мы будем использовать облачную модель Olama. Опять же, эта модель будет работать на самой платформе Olama, но они заявили, что она будет супербезопасной или что-то в этом роде, и вы не будете чувствовать, что работаете в облаке, потому что способ, которым вы можете это сделать, будет очень, очень простым. Так что, если я перейду в настройки Olama здесь, вы можете увидеть, что это почасовое использование, которое я получил. Это еженедельное использование, и вы можете видеть, что я никогда не превышу примерно 10% еженедельного использования, даже если я много использую облачные модели, но я действительно не превышаю этот конкретный план. Так как же нам на самом деле использовать эту конкретную модель? В Olama это очень, очень просто. Все, что вам нужно сделать, это перейти к моделям здесь, в Olama, и вы увидите, что есть опция под названием "облако", где эти модели, помеченные как "облако", являются облачными моделями. Таким образом, вы можете использовать модель GPT OSS, которая имеет даже 120 миллиардов параметров. Вы также можете использовать модель зрения и языка QN3 vision, которая имеет даже 235 миллиардов параметров, или даже модель Q3 coder, которая имеет 200 480 миллиардов параметров. Посмотрите, сколько у нас моделей, и это будет продолжать улучшаться. Даже предварительная модель Gemini 3 pro также доступна для вас, чтобы попробовать и посмотреть, как это [хмыкает] на самом деле будет работать. И она была выпущена буквально вчера на момент записи, что довольно удивительно. Так что, если вы хотели выполнить любую из этих операций здесь, мы можем фактически использовать мощь Olama для наших целей тестирования и разработки. Таким образом, вы можете видеть, что это код, который у меня есть здесь, который создает агентов с поддержкой инструмента RAG с локальной большой языковой моделью. Так что, если я хочу запустить этот конкретный код, вы можете видеть, что я фактически буду использовать локальную большую языковую модель, которая является моделью QN 2.5 здесь, и я также делаю здесь довольно много вещей. Я делаю встраивание данных, а также сохраняю их в векторном хранилище данных, а затем я также вызываю агента и тестового агента Playwright для выполнения автоматизации пользовательского интерфейса, и я делаю довольно много различных операций здесь, как вы можете видеть, это часть моего курса на Udemy, который доступен здесь, как вы можете видеть, мы просто перейдем на четвертую страницу, это курс, который вы можете увидеть здесь, создайте и протестируйте AI-агента чат-бота RAG и локальную большую языковую модель. Так что этот конкретный курс, как вы можете видеть здесь, имеет около 2000 регистраций, и вы можете видеть, что это детали, которые уже доступны в этом курсе, и он полностью обновлен до версии Langchain 1.0. Поэтому вы видите все эти жирные символы там, что означает, что все полностью обновлено. Так что этот конкретный курс на самом деле использует все, что работает на локальной большой языковой модели, а также на облачной модели, и именно это я собираюсь показать здесь. Так что, если я запущу этот конкретный код прямо сейчас. Итак, скажем, я просто очищу весь вывод. И если я запущу их все, он в настоящее время запускает тесты на моей локальной большой языковой модели. Так что он вызовет токенизацию, а также векторизацию и сохранение в базе данных, а также встраивание всего, что здесь произойдет, как вы можете видеть. И теперь вы можете видеть, что он вызывает агента для выполнения операции. И вы увидите, что время, которое потребуется для выполнения этой операции, будет довольно большим, потому что, даже несмотря на то, что я использую машину Mac M1 Max на моей локальной системе здесь, это, безусловно, займет довольно много времени. Выполнение этой операции займет много времени. Но если вы собираетесь использовать модель, которая работает в облаке, это будет намного быстрее, и вам не нужна вычислительная мощность для этого. Так что это ответит на ваш вопрос тем, кто спрашивал на конференции, как именно мы можем использовать мощь большой языковой модели, работающей локально, и при этом использовать ее мощь, не имея этой мощности на нашей машине. Я знаю, что это все еще не будет работать на вашей локальной машине. Промпт - языковая модель все еще работает в облаке, но кажется, что она работает на вашей машине, и в то же время вы не будете нести никаких расходов. Опять же, если говорить о безопасности и прочем, это будет применимо только в том случае, если вы будете разрабатывать или создавать приложение, которое будет развернуто на ваших корпоративных серверах и тому подобном. Ну, сказав это, я также быстро покажу вам, как вы можете использовать облачную модель на своей локальной машине. Так что, если вы просто зайдете в любой терминал здесь, вы можете увидеть, что я делаю здесь список, он покажет вам префикс облака амма QN3 coder 480 миллиардов параметров, а также суффикс облака. Так что этот суффикс облака означает, что эта конкретная модель является моделью с поддержкой облака. Вы можете фактически скачать ее отсюда, из Olama. Так что, если вы просто зайдете в Olama и перейдете к моделям, вы увидите, что у нас есть эти модели. Просто выберите любую модель. Например, если я собираюсь использовать любую другую модель, скажем, модель Deepseek версии 3.1 u. Так что я скопирую 671 миллиард параметров. Эти вещи никогда не будут работать на вашей машине вечно, потому что вы знаете, что для этого требуется много мощности GPU и тому подобного. Так что это не сработает для нас. Так что я просто скажу ama run deepseek v3 670 миллиардов параметров cloud. И вы видите, что он все еще загружает его из реестра для использования в вашей Olama. И это все. Он сейчас подключен. И я скажу, как дела. Если я сделаю это, вы увидите, что он просто общается с фактической большой языковой моделью, работающей или размещенной в облаке для вас там. И это будет довольно быстро, если вы собираетесь делать это на этой конкретной машине. Так что, если я хочу использовать эту конкретную модель или, возможно, любую другую модель, вы можете просто использовать ее. Скажем, я собираюсь использовать эту конкретную недавно загруженную модель. Так что я скопирую ее сюда и перейду к коду, который я выполнял. Я думаю, он уже выполнен. О, да, вот оно. Вы видите, что выполнение этой конкретной операции заняло 55 минут, что, честно говоря, очень много. Но если вы собираетесь запустить тот же код через облачную модель, которая является этой, и я очищу весь вывод, сброшу и запущу их все. Так что посмотрим, как это работает. Так что в идеале, поскольку это будет работать на облачной модели, способ, которым это будет работать, будет намного быстрее, если я не ошибаюсь. Так что давайте просто подождем выполнения. Вот оно. Это заняло всего 13 секунд против 1 минуты, которая занимала раньше, и вы видите, что все работает нормально, как и ожидалось. Так вот как вы можете использовать мощь большой языковой модели, работающей в облаке, и вам не придется тратить много денег, как я вам только что сказал, потому что прямо сейчас я использовал ее только один раз, и если я перейду в настройки, вы увидите, что это всего лишь 2,4%, и даже если я буду использовать ее много раз, она никогда не превысит этот лимит. Но если вы все еще хотите использовать ее еще больше, вы можете перейти к опции биллинга и обновить ее, чтобы получить еще больше использования и тому подобного. Но пока вы можете просто изящно использовать все предоставленное нам использование в Olama, которое может быть использовано для ваших целей тестирования и разработки. Так что вот и все, ребята. Еще раз спасибо большое за просмотр этого видео, и я уверен, что это тот путь, которым вы должны идти, когда занимаетесь разработкой и тестированием на своей локальной машине, по крайней мере, не для разработки корпоративного уровня. Но вы можете видеть, что это довольно потрясающе видеть, как быстро они [музыка] работают при выполнении любой операции. Посмотрите, на этот раз это заняло всего 9,4 секунды для завершения этой операции, что просто фантастически.