Transcription
Итак, я построил еще один суперкомпьютер с ИИ. И этот просто сумасшедший. Четыре Mac Studio, по 512 ГБ ОЗУ каждый, 2 ТБ унифицированной памяти. Это, возможно, самая мощная локальная установка ИИ, когда-либо созданная. Подождите. Я уже делал это раньше. Ранее в этом году я объединил в кластер пять Mac Studio, и это было довольно ужасно. Я ожидал, что он будет работать с моделями ИИ как чемпион, но на самом деле добавление большего количества компьютеров сделало его медленнее. На 91% медленнее. Все говорили, что кластеризация — это глупость, и они были правы. Так почему я снова это делаю? Ну, Apple только что выпустила кое-что новое. Простое обновление программного обеспечения, которое может изменить всю игру. То, о чем я умолял. Итак, в этом видео мы снова кластеризуемся. Мы собираемся бросить самые большие, самые крутые модели ИИ на этот кластер и посмотреть, на что он способен. Наша цель — ответить на один вопрос. Имеет ли кластеризация локального ИИ смысл для нас? Будет ли это действительно быстро, или это просто будет отстой, как в прошлый раз? Приготовьте свои копии. Давайте узнаем. Теперь Apple наблюдала за мной. В моем последнем видео я сказал это. Я не знаю, как XLabs собирается это решить, потому что мы находимся во власти того, какое оборудование у нас есть, и этого. Я хотел бы знать, каким будет опыт с каким-то серьезным соединением между графическими процессорами этих пяти Mac Studio. Я был, честно говоря, довольно расстроен производительностью этого кластера. У меня были такие большие надежды. Я знаю, что вы, вероятно, тоже. Но Apple послушала и что-то с этим сделала. И они также прислали мне кое-что. Эта установка безумна. Я не был уверен, пришлют ли они мне это, но я был шокирован, когда они сказали "да". Они прислали мне свои самые большие, самые крутые машины, полностью укомплектованные. Но подождите. У моего старого кластера было пять Mac Studio. Как это лучше? Посмотрите на это. Теперь эти машины смешны. Каждый из этих Mac Studio имеет 512 ГБ ОЗУ. ОЗУ? Для некоторых компьютеров это жесткий диск. И это унифицированная память, что означает, что графический процессор может ее использовать. Так что позвольте мне выразиться так. 512 ГБ памяти графического процессора видеопамяти. У них 8 ТБ хранилища, 80 ядер графического процессора. И если мы посчитаем, этот монстр-кластер имеет 2 ТБ унифицированной памяти, 32 ТБ хранилища и 320 ядер графического процессора. Это Maczilla по сравнению с нашим старым кластером, работающим на M2 Max. Это даже не сравнение. Это как-то глупо, потому что, хотя у нас на один Mac меньше, каждая из наших машин имеет в восемь раз больше памяти. Итак, у нас в 6,4 раза больше ОЗУ, мы удваиваем пропускную способность нашего графического процессора. И это окажет огромное влияние, мы используем Thunderbolt 5 против Thunderbolt 4, что также является удвоением пропускной способности. Единственное, что заставляет вас немного задуматься: "Ох, это больно", — это цена этого кластера. 50 000 долларов. Я знаю. Но серьезно, подумайте об этом. Какова альтернатива сделать что-то подобное локально? Например, если бы вы хотели те же характеристики от кластера Nvidia H100, вам понадобилось бы 26 H100, каждый с 80 ГБ видеопамяти. Это обошлось бы вам более чем в 780 000 долларов. И на самом деле это больше, если вы собираете систему. Об этом мы поговорим позже. Но суть в том, что этот кластер смешон. Ладно, круто. У нас есть эти большие удивительные монстры, но самой большой проблемой, с которой мы столкнулись в прошлый раз, была сеть, пропускная способность. Что сделала Apple? Мы доберемся до этого. Но сначала нам нужно их подключить, верно? Это вся часть кластеризации. Теперь, чтобы это работало, мне пришлось подключить их через Thunderbolt и Ethernet. К счастью, у меня был запасной коммутатор UniFi, у которого были порты на 2,5 гигабита, которые мне отчаянно нужны были, потому что загрузка этих моделей, они огромны. Самую большую, которую мне пришлось скачать, была 735 ГБ, и мне пришлось скачать ее на каждом из Mac. Мне также пришлось убедиться, что мой восходящий канал — это 10-гигабитный Ethernet, потому что, боже мой, это заняло целую вечность. Мы также используем Ethernet, чтобы кластер мог видеть друг друга, но это не то, как они на самом деле соединяются и обмениваются информацией. Вот где вступает в игру Thunderbolt. Мне дали эту очень причудливую схему, чтобы соединить их в сетку. Это просто немного сетчато. Извините, пришлось это сделать. Теперь давайте сделаем шаг назад и посмотрим на это на мгновение. Разве это не красиво? Я честно думаю, что это может быть самая мощная локальная установка ИИ, когда-либо созданная. Опровергните меня. Что может превзойти 320 ядер графического процессора, 2 ТБ унифицированной памяти? Этот кластер должен справиться со всем. И обратите внимание на нашу звездочку, "должен", потому что на самом деле не имеет значения, насколько мощны эти Mac, если соединение между ними не супербыстрое. И это то, что убило его в прошлый раз, сеть. Запуск больших моделей не имел значения, потому что все замедлилось до ползания. И хотя мы удваиваем нашу пропускную способность с Thunderbolt 5, у нас все еще есть огромная сетевая проблема, задержка. Но Apple полностью изменила игру с обновлением программного обеспечения. Вот и все. Посмотрите на это. Знаете, что меня действительно раздражает? Когда проблема на самом деле в сети. Все винят сеть, но на этот раз это было действительно так. Когда я запускал эти модели на пяти Mac Studio, это было на 91% медленнее. Это был не графический процессор, не память, это была сеть. Это была задержка между соединениями. Я имею в виду, посмотрите на эти скорости с прошлого раза, когда я объединил их в кластер. Это плохо. Но Apple сказала, что они решили это. Давайте посмотрим. На самом деле, позвольте мне просто быстро показать вам. Давайте посмотрим, сделали ли они это. Не смотрите на это слишком долго. Это ваш предварительный просмотр. Вот старый способ. Пять токенов в секунду. Не очень. Давайте попробуем исправление от Apple. Теперь это намного лучше. 15 токенов в секунду. Это в три раза быстрее. Та же модель, тот же кластер. Но что они делают? Как они делают это быстрее? Это сеть. Это всегда связано с сетью. Теперь способ, которым они решили это, на самом деле довольно прост. Они просто увеличили скорость наших соединений Thunderbolt. И я не говорю о переходе от Thunderbolt 4 к Thunderbolt 5 и удвоении этой пропускной способности. Нет, нет, нет, нет. Метрика, на которую мы смотрим, — это задержка. Как быстро пакет или сообщение может перейти от Mac к Mac. Сейчас эта задержка составляет около 300 микросекунд, что, я знаю, звучит довольно быстро, но не в мире ИИ. И из-за этой задержки мы застряли с так называемым конвейерным параллелизмом. Это забавное слово. В десять раз быстрее. Конвейерный параллелизм. Конвейерный параллелизм. Как далеко ты продвинулся? По сути, это техника, которую мы используем для разделения модели между несколькими системами в кластере. Например, возьмем модель ИИ, такую как Llama 3.37DB FP16. Это хорошая точность. Такая модель будет иметь около 80 слоев, которые, по сути, представляют собой серию фильтров, через которые проходит ваш запрос, чтобы помочь ей ответить вам. Так что, если вы скажете: "Эй, какая столица Японии?" Это может обработать это так. Каждый слой выполняет некоторую сложную математику над входными данными и передает результат следующему слою. Каждый слой уточняет ответ, пока вы не получите ответ. Теперь, когда вы кластеризуете эту модель, она разделяет слои между каждой машиной. Так, Mac 1 получит слои с 1 по 20. Mac 2 с 21 по 40 и так далее. Но вот где становится больно. Это последовательно. Так что для каждого токена Mac 1 обрабатывает слои с 1 по 20, останавливается, отправляет результаты MAC 2. Он обработает слои с 21 по 40, остановится, а затем так далее. Это похоже на эстафету с очень быстрыми спринтерами, но мы не работаем вместе. Мы ждем друг друга. Теперь конвейерный параллелизм — это здорово, потому что он дал нам емкость. Мы могли запускать большие модели, которые мы никогда не могли запустить на одной машине, и запускать их на нескольких. Но он не дал нам скорости. Вместо этого мы получили комнату ожидания. Но есть лучший способ, более быстрый способ, и он называется тензорным параллелизмом. Я знаю, мы немного углубляемся в технические детали. Короткий перерыв на кофе. Это гораздо более умный способ. Вместо того, чтобы каждый Mac владел слоями и обрабатывал их последовательно, все Mac работают вместе над каждым слоем. Здесь мы не разделяем слой, мы разделяем математику. Так что для слоя 1 Mac 1 выполняет 25% математики. Mac 2 выполняет 25, 35, 4 25. Когда они закончат, они объединят результаты. Теперь, теоретически, это должно быть в три с половиной раза быстрее, чем конвейерный параллелизм. Боже мой, эта фраза меня убивает. Так что круто, давайте просто сделаем это. Это решение. Мы не можем. Наша сеть все еще отстой. И с этим методом еще хуже. Потому что для того, чтобы каждый Mac работал над одним слоем за раз, происходит много коммуникаций. Это как групповой проект. Много сообщений отправляется туда и обратно. На самом деле, мы говорим о двух комбо за слой. Так что для каждого токена у нас происходит 160 комбо. Давайте посчитаем. Предполагая, что каждое сообщение занимает около 300 микросекунд. Теперь я знаю, что микросекунда — это этот маленький символ здесь. Я просто не могу его нарисовать. Я не могу этого сделать. Мне жаль. Умножить на 160, это почти 50 миллисекунд ожидания на токен. Так что из-за нашей сетевой задержки тензорный параллелизм на самом деле оказывается медленнее, чем конвейерный параллелизм, поэтому мы не могли этого сделать. Вся эта болтовня убила это. Если бы только наша сеть была быстрее. Если бы только задержка была решена. Ну, вот что сделала Apple. Они сделали ее быстрее. И я не шучу. Это было просто простое обновление программного обеспечения. Apple незаметно включила в Tahoe 26.2 технологию на своих портах Thunderbolt под названием RDMMA или удаленный прямой доступ к памяти. Это огромно. Мы в высшей лиге. Мы не играем. Теперь вы, возможно, слышали, как я упоминал RDMA раньше в предыдущем видео, говоря о сетевом оборудовании для центров обработки данных ИИ. Вы можете посмотреть его прямо здесь. Это то, как кластеры ИИ и центры обработки данных общаются друг с другом на чрезвычайно высоких скоростях. Это то, что используют такие модели, как ChatGpt и Claude. Но что это такое? Ну, давайте поговорим о том, как выглядит жизнь до RDMA с нашими соединениями Thunderbolt 5. Эти соединения здесь, по сути, просто сетевые соединения, использующие старый добрый TCP IP, традиционный сетевой стек. Теперь это проблема для нас здесь, потому что это вводит накладные расходы, увеличивая задержку, потому что каждое сообщение должно пройти несколько этапов, выполняя такие действия, как обработка центральным процессором, прежде чем оно сможет попасть в память графического процессора. И я понятия не имею, где находится центральный процессор и графический процессор в этом Mac Studio. Я просто выдумываю. Именно эта традиционная сетевая обработка вызывает нашу задержку. Но с RDMA мы пропускаем все это. RDMA — это прямой доступ к памяти. Мы удаляем стек TCP IP. Говорим: "Нет, он нам больше не нужен. Мы получаем прямое соединение. Больше никаких остановок. Прямое соединение из памяти графического процессора в память графического процессора, от графического процессора к графическому процессору." Это часть прямого доступа к памяти. И вот что это делает. Это снижает нашу задержку с 300 микросекунд до трех микросекунд. Вы шутите? Это 100-кратное увеличение или уменьшение. Это скоростной поезд. Прямое соединение. Так что теперь с нашим кластером нам больше не нужно беспокоиться об IP-адресах, накладных расходах TCP IP, всей этой обработке центральным процессором. Нет, нет, нет. У нас есть прямое соединение между графическими процессорами с этими портами Thunderbolt 5. Прямой доступ к памяти. Это решает нашу проблему задержки. И снова, это было просто обновление программного обеспечения. Почему они так долго тянули? Серьезно, Apple, мне жаль. Я благодарен за то, что это есть. Мне жаль. Теперь, теоретически, это звучит потрясающе, но работает ли это на самом деле? Теперь вы уже видели тизер, но это была всего лишь меньшая модель. Что происходит, когда мы бросаем на нее какие-нибудь сумасшедшие большие модели? Например, самые большие модели, доступные прямо сейчас. Будет ли это работать? Сделает ли кластеризация действительно полезной? Давайте узнаем с помощью программного обеспечения, которое, как вы все думали, исчезло, но оно вернулось с удвоенной силой. Привет, я сейчас на улице. Почему? потому что я хочу рассказать вам о нашем сегодняшнем спонсоре, Twinate. Потому что посмотрите на это. Я не могу получить доступ к своей лаборатории сейчас на своем ноутбуке. Я пытаюсь подключиться к нашему кластеру, и это не работает. Это потому, что я не использую Twinate. Посмотрите на это. Я просто нажимаю "Подключиться". Аутентификация, потому что это очень безопасно. И кстати, это не VPN. Нет, нет, нет. Это лучше, чем VPN. Это больше, чем VPN. Ладно, круто. Мы аутентифицированы. Давайте попробуем еще раз. Лучше бы сработало. Знаете что? Это все еще не работает. У меня нет доступа. Но вы, вероятно, думаете, Чак, отличная реклама. Вы пытались показать нам, что у вас нет доступа, и пытались получить доступ с помощью Twin Gate. Это не сработало. Это по дизайну. Twate — это нулевое доверительное сетевое решение. Вы можете настроить его. Вы можете установить его. Это займет около 5 минут. Вы можете использовать Raspberry Pi. Что угодно. Это бесплатно для пяти пользователей в вашей домашней сети. Это очевидно. Просто сделайте это. Но также вам нужно явно разрешить доступ. Так что давайте сделаем это прямо сейчас. Я создам ресурс, а затем здесь я предоставлю доступ. Я предоставляю доступ только администраторам. Теперь давайте попробуем еще раз. Держите пальцы скрещенными. Мы внутри. И я проверяю свой кластер, чтобы увидеть, что я скачиваю новую модель. Quinn coder. О, вы этого еще не должны были видеть. Вы получили предварительный просмотр во время рекламы. Посмотрите на себя. Серьезно, если вы не используете Twin Gate, что вы вообще делаете? VPN — это устарело. И если вы говорите: "Чак, мне не нужен Twin Gate". Да, нужен. У вас есть домашняя лаборатория, верно? Вот почему вы смотрите мой канал. Вы занимаетесь локальным ИИ. У вас есть Plex. Как вы получаете к нему доступ, когда вы в поле? Серьезно, просто зарегистрируйтесь. Это бесплатно. Проверьте ссылку ниже. twgate.com/networkshuck. И серьезно, спасибо Twinkgate за то, что сделали это видео возможным. Я не смог бы делать такие вещи без них, так что проверьте. Ладно, теперь вернемся к видео. И здесь становится холодно. Мне нужно вернуться внутрь. Теперь многие думали, что Exo Labs сдались. Даже Джефф. >> Exo прекратил разработку около 5 месяцев назад, и даже простые исправления игнорируются. Так они отказались от мечты о кластеризации ИИ с потребительским оборудованием? Нет. Они здесь, они живы, и они работают с Apple, чтобы воскресить кластеризацию. Воспоминание о начале этого года, я использовал ExoLabs для кластеризации моих пяти Mac Studio вместе. Это все еще было довольно ново, сыро, и это своего рода удивительное программное обеспечение, удивительная идея, потому что вы можете кластеризовать любое оборудование вместе, но сеть, это было проблемой. Так что, когда ExoLabs и Apple связались со мной, я сказал: "Эй, у нас есть новое обновление. У нас есть то, над чем мы работали, и мы думаем, что это решит ваши проблемы с сетевой кластеризацией, и они сказали: "Хочешь присоединиться?" И я такой: "Чувак, подними этот сигнальный фонарь, я там". Так что, перемотаем вперед, вот мы. У меня есть Mac. Я подключил их согласно нашей официальной схеме. Я установил бета-обновление Tahoe 26.2. И вот настоящее волшебство. Мне пришлось перейти в режим восстановления и включить RDMA. Увидев, что RDMA включен, это меня взволновало. Оттуда все было довольно гладко. Я установил суперсекретную бета-версию, которую мне дал ExoLabs, которая, я думаю, может быть доступна прямо сейчас. Я могу ошибаться. У меня будет больше информации ниже. Но посмотрите на это. Он получил новый вид, верно? Раньше это был только инструмент командной строки, что меня устраивает, но теперь у нас есть нативное приложение для Mac, и оно великолепно. Итак, вот мы после нескольких патчей программного обеспечения от Exo. Мой кластер подключен. И, как вы, возможно, видели ранее в нашем предварительном просмотре, у нас есть возможность работать в "тупом" режиме. конвейерный параллелизм или тензорный параллелизм. Просто для развлечения, давайте сделаем это по-старому еще раз. Итак, мы выберем наш конвейер и MLX ring. Мы выберем четыре узла, используя весь наш кластер, и выберем нашу llama 3.370B FP16. Загрузим эту штуку. Теперь она загружается довольно быстро. Это так весело. Готово. И имейте в виду, это старый, медленный способ. Пять токенов в секунду. Около 200 миллисекунд на токен. Боже мой, это очень медленно. Я уже могу выпить чашку кофе, пока это закончится. А затем давайте попробуем это. Это будет весело. Давайте сделаем тензорный параллелизм, но останемся на старой сети. Без RDMA. Давайте посмотрим, что получится. Имея в виду, что у нас 160 разговоров на каждый токен. Давайте загрузим. Готово. Посмотрим, что произойдет. Да, это медленнее, верно? Я имею в виду, мы говорим в два раза медленнее, что было не так уж много, верно? Мы на трех токенах в секунду. 370 миллисекунд на токен. Это не очень хорошо. О, я имею в виду, это непригодно для использования. Но давайте добавим магию Apple. Давайте включим RDMA. Тензорный параллелизм, RDMMA, четыре узла, llama 3.37DB. Загрузим эту красотку. И это на самом деле очень быстро загружается. Посмотрите, как они работают. Мне нравится этот новый интерфейс. Готово. Я имею в виду, посмотрите на это. Это невероятно. 16 токенов в секунду в среднем. 66 миллисекунд на токен. Они сделали это. Apple, вы потрясающие. Но это меньшая модель, верно? Есть и побольше. Что насчет DeepSeek? Что насчет Kimmy K2? Как насчет обоих одновременно? Приготовьте свой кофе. Я думаю, вы заставите этот кластер попотеть. Давайте. Итак, мы только что доказали, что тензорный параллелизм работает с RDMA. Это фантастика. В три раза быстрее. Но вот настоящий вопрос. Вам вообще нужно кластеризоваться? Например, имеет ли кластеризация смысл для вас? Например, почему бы просто не купить один дорогой Mac? Например, у одного из этих парней 512 ГБ ОЗУ. Какие модели нам нужно запускать, которые не могли бы работать на этой одной машине? Давайте проверим. Давайте бросим на это постепенно увеличивающиеся модели. Давайте бросим на это все модели одновременно. Давайте посмотрим, что произойдет. Короткий перерыв на кофе. Время кластеризации. Я не знаю, почему я это сказал. Это не звучало правильно. Ладно. Вот наш кластер здесь. У нас есть наши метрики. Mac один, два, три и четыре. Теперь я хочу протестировать все эти модели прямо здесь. Но первое, что я хочу протестировать, это своего рода крошечная модель. Я хочу увидеть, какова производительность на одном Mac по сравнению с четырьмя. Мне интересно, будет ли производительность лучше с RDMA? Потому что один Mac сам по себе может работать с этой моделью нормально. Давайте проверим. Так что я просто выберу один узел и загружу небольшую модель, маленького детеныша llama 3.2 3B 8-битную. Это ничего. Запуск. Ладно, готово. И мы работаем на 147 токенах в секунду. Давайте спросим что-нибудь более сложное. Так что это быстро. Давайте кластеризуем. Ладно, теперь с четырьмя узлами в кластере. Это быстрее. Ладно, так что 240 токенов в секунду. Это потрясающе. Это на 100 токенов быстрее, чем один узел. Посмотрите, как он работает. Максимальная загрузка графического процессора по всем направлениям. Похоже, я где-то потерял сценарий, но похоже, что мы потребляем около um, около 100 Вт на Mac. Так что 400 Вт всего. Неплохо. Давайте двигаться дальше. Давайте перейдем к одному узлу для llama 3.370B FP16, потому что эти парни могут это сделать. Так что мы загрузили его на Mac 2. Мы видим, что он полон там. Давайте посмотрим, как он работает. Ладно, пять токенов в секунду. Не впечатляет. Он максимально загружает этот графический процессор. Похоже, 150 Вт. Я меняю мониторинг на полпути, потому что думаю, что это лучше. Я буду использовать Mactop. Он все еще работает. Но обратите внимание, что у нас все еще много памяти на этом втором Mac, где он загружен. Ладно, круто. Примерно пять токенов в секунду. Давайте кластеризуем. Загружено. Посмотрите, как заполняется память. Так весело наблюдать за этим здесь, на экране. Это день и ночь по сравнению с нашим последним кластером. Это заняло целую вечность. Вы понятия не имеете, насколько болезненным было создание этого видео. Ладно, готово. Ладно, 16 токенов в секунду. Попробуйте более интенсивный запрос. И вот он. Максимальная загрузка графических процессоров по всем направлениям. Память 9% на каждом. Около 130 Вт на каждой машине. Это кластер, чувак. В хорошем смысле. Ладно, двигаемся дальше. Давайте повысим ставки. Мне нравится смотреть, как um, память графического процессора также уменьшается. Ладно, наша следующая модель. Давайте возьмем что-нибудь побольше. Deep Seek. Ладно, я вернулся. Он не знал, что я ушел. Мне пришлось устранять некоторые проблемы. У меня нет скачанной модели Quinn. Я думал, у меня есть Quinn. Думаю, мне придется дать ей скачать немного. Час. Но у меня получилось. Мне пришлось скачать эту новую модель. Я забыл скачать. В любом случае, вот мы. Мы собираемся загрузить ее. Ладно. Сначала мы сделаем um один узел, и мы сделаем Quinn 3 coder 480B. Это большая модель, но опять же, у наших Mac есть 512 ГБ ОЗУ. Теперь это смесь экспертных моделей, так что она должна быть немного быстрее, потому что она не использует все параметры одновременно. Давайте запустим ее. И имейте в виду, мы строим наш путь к модели Kimmy K2, которая имеет триллион параметров. Я даже не могу, что? Да, мы можем это сделать. Думаю, увидим. Ладно, она загружается на одном узле. Mac 2. Mac 2 взрывается. Ладно, он готов. Объясните мне, если 27 токенов в секунду. Это довольно хорошо. Давайте кластеризуем. Выключение. Тензор RDMA четыре узла. Quinn 3 coder запуск. Посмотрите, как он работает. Ладно, готово, и давайте посмотрим, что у нас есть. 40 токенов в секунду. Так что скорость почти удвоилась. Так что история до сих пор такова: кластеризация не замедляет нас. Она ускоряет нас, чего мы и ожидали в первый раз, верно? Давайте двигаться дальше и следить за питанием и всем остальным. У нас это будет на экране. Давайте перейдем к нашей следующей модели. Мы сделаем на самом деле, знаете что? Хватит дурачиться. Давайте возьмем Kimmy K2. Я не думаю, что мы сможем загрузить эту модель на одном узле. Да, минимум нужно два, что все равно безумие. Нам нужно всего два. Но давайте запустим ее на четырех. Это огромная модель. 658 гигабайт на узел мне пришлось скачать. Один триллион параметров. Позвольте мне просто перепроверить свои расчеты. Да, один триллион параметров. О боже. Ладно, давайте загрузим. Давайте посмотрим, как это заполнится. Вот оно. Теперь это лучшая модель для кодирования прямо сейчас для локального ИИ. И даже когда люди используют облачный ИИ для кодирования, они платят за эту модель на хостинговой платформе. Она настолько хороша. Но здесь нам не нужно использовать никаких облачных ресурсов. Мы можем разместить все здесь локально. Она все еще загружается, заполняя эти резервуары для графического процессора. Ладно, готово. Она использовала 33% ОЗУ на каждом. Давайте зададим ей вопрос. Триллион параметров. Давайте посмотрим, как это будет. Вау. Так что она думает прямо сейчас. Давайте расширим мышление. Но у нас почти 30 токенов в секунду. О боже. И это так круто. Она думает, верно? Как будто, о боже, думающая модель. Я имею в виду, это быстро. Сколько ОЗУ требуется для запуска 4-битной модели? Давайте посмотрим. Мощность. Мы потребляем около 110 Вт на каждом. Теперь одна вещь, которую я хотел вам показать, но просто не мог. И это пропускная способность, задержка, сетевой трафик. Я хотел увидеть, сколько всего мы передаем. Но прямо сейчас, и вы можете это увидеть. О, эта штука думает. Если я зайду в свою сетевую конфигурацию, мост Thunderbolt неактивен. Он отключен. Это, по сути, призрачный трафик. Я не могу его видеть. Я не могу его отслеживать. Это может измениться, но я спросил Apple. Я сказал: "Эй, дайте мне способ визуализировать это". Они сказали: "Да, мы пока не можем этого сделать". Так что, извините. Предположим, что это много, потому что мы должны это предположить, верно? 160 разговоров на каждый токен. Давайте попросим ее создать скрипт Python, который может сканировать веб-сайты. Я имею в виду, она справляется отлично. Она думает. Она создает мой скрипт сейчас. Это локальный ИИ. Ладно. Но это не вся история, верно? Так что у нас есть место. Мы запускаем самую большую модель, которую смогли скачать прямо сейчас. И у нас есть место. Давайте вернемся домой. И имейте в виду, мы будем держать эту модель работающей. Мы загрузим новую. Просто обновите мою страницу, чтобы получить свежий экземпляр. Я собираюсь загрузить эту. Она более мощная, то есть она 713 гигабайт. Это самая большая модель, которая у них есть. Но это всего лишь 671 миллиард параметров, что так безумно. Наш последний кластер, мы пытались запустить 671B, и это как бы разрушило все. Теперь мы собираемся запустить ее вместе с моделью с триллионом параметров, что заставляет меня чувствовать себя успешным, даже если я ничего не сделал. Давайте запустим. Хорошая работа, Apple и Exo. Итак, давайте посмотрим, как заполняется этот графический процессор. Так что мы запускаем Kimmy K2, думающую. И что это за модель снова? Deepseek 3.18bit 671B. О, она не сработала. Мне это не нравится, но я знаю, что мы все еще можем это сделать. Я попробую еще раз. Мне пришлось создать эти скрипты с облачным кодом, который перезагружал бы кластер и инициализировал его заново, потому что это происходит с бета-программным обеспечением. Так что, подождите. Ладно, я вернулся. Давайте попробуем еще раз. Пришлось перезагрузить весь кластер. Давайте сначала попробуем загрузить Kim K2. Я знаю, что мы можем это сделать. Я знаю, что мы можем это сделать. Ладно, мы загружены. Давайте перейдем к Deepseek. Давай. Давай, Deepseek, я верю в тебя. Запуск. Давай. Не подведи. Ладно, мы загружаемся. Она заполняется. Пока все хорошо. Я нервничаю. Почти готово. Думаю, мы на 50% более чем на 50% на каждом узле. Ух. Ох, эти штуки напрягаются. Посмотрите на карту внизу. Это как ух. О боже. 60%. Ой-ой. Мы сломали это? О, она все еще заполняется. Ух, мы сделали это. Ладно. Я даже боюсь говорить с ней, потому что не хочу снова сломать. Но мы должны с ней поговорить, верно? Так что давайте поболтаем с Deepseek. 27 26 токенов в секунду. Давайте переключимся на Kim K2. И вот оно. Как будто мы используем обе модели. У нас загружены обе эти штуки. Это безумие. Сколько еще мы можем загрузить? Давайте сделаем еще одну. О боже. Давайте загрузим Llama 3.37B FP16, потому что это одна из других, которые я скачал. И запуск. Она загружается. Ладно, она готова. Использование ОЗУ немного странное, верно? Оно поднялось до 60%, а затем снова упало до 50. Но я знаю, что у нас загружены эти модели. Давайте поговорим с Llama. Вау, какой глупый ответ. Я просто хочу убедиться, что у меня все загружено. Я буду переключаться туда и обратно. О, подождите. Почему это? Это была моя Это смешно. Это был мой буфер обмена с прошлого раза, потому что именно так мне пришлось перезапустить кластер. Ладно. И давайте переключимся на Kimmy. Kimmy, я не уверен, как это сказать. Я также горжусь Apple и XO. Y так хорош. Теперь вот в чем дело. Я могу запускать другие модели, но я не скачал никаких других больших. И это занимает Это самая долгая часть. Я больше этого делать не буду. Но давайте посмотрим, что еще у меня скачано. У меня есть несколько вариантов Llama. Я имею в виду, я вытяну ту 3.2 модель с прошлого раза. Давайте просто запустим ее, если нам придется что-то делать. На самом деле, у меня есть llama 3.370B 4-битная. Давайте загрузим вас, потому что можем. Готово. Давайте сделаем еще одну. Давайте возьмем llama 3.2 3B 4-битную. Думаю, у меня есть эта. Да, давайте загрузим его. Ладно, это было легко. Так что у нас работает одна, две, три, четыре, пять моделей, но использование памяти остается около 50%. На самом деле продолжает снижаться. Я не знаю, почему это так. Так что я думаю, мы ответили на вопрос. Кластеризация теперь потрясающая. Я запускаю каждую модель, которую только могу, и она просто работает как чемпион, и это быстро. Но, ладно. До сих пор мы были заперты в интерфейсе Exo. А как насчет использования реальных приложений, таких как кодирование или open code или open web UI? Например, можно ли использовать это с этим? Давайте узнаем. Ладно, давайте попробуем open web UI, потому что это реально. Это не просто тесты. Это не просто тестовое программное обеспечение. Давайте посмотрим, что произойдет. Я хочу использовать свой кластер здесь или не мой кластер, мой open web UI, ai.hogwarts.studio. У меня уже должны быть загружены мои модели, потому что EXO работает через API-эндпоинт. Давайте посмотрим. Давайте найдем Kimmy. Вот она. Давайте займемся мышлением. Посмотрим, не начнет ли она немного напрягаться. Ладно. Давайте посмотрим, что произойдет. Ладно. Um, да. Я имею в виду, вот оно. Оно сходит с ума здесь. Оно думает. Я имею в виду, это так круто. Посмотрите на это. Я использую open web UI на совершенно другом сервере в моей серверной комнате, и он подключается к моему кластеру Mac, работающему на KBK с моделью с триллионом параметров. Насколько это потрясающе? Оно много думает. Это очень умная модель. Я скажу вам, пока она это делает, давайте перейдем на этот сервер. У меня установлен Xcode, который похож на VS Code от Apple. Он все еще работает. Ладно, он написал это. Так что он закончил приложение. Я имею в виду, я имею в виду, это впечатляет, что он сделал. Это так круто. Ладно, давайте попробуем Xcode. Теперь я просто попробую um, посмотреть существующий проект Daniel Misource Fabric. Давайте найдем здесь какой-нибудь код. Давайте попросим его рассказать нам, что делает этот код. Давайте поговорим с DeepSeek. Это так безумно. Ладно, оно работает. Оно сходит с ума. Оно думает здесь. Посмотрите на это. Я попробую еще раз. Давайте попробуем open code. Я люблю CLI-инструменты для кодирования и всего, что вы хотите делать. Теперь у меня уже должна быть настроена кластеризация. Да, вот она. На самом деле, K2, думающая, прямо здесь. Да. Так что оно сходит с ума там. Оно делает свое дело. Мы видим мышление. Но я просто хотел показать, что мы можем использовать любое из этих приложений. Хотя, я думаю, ему трудно использовать инструменты с open code. Ладно, вот оно. А затем я переключу модели на Llama 3.3 и скажу проанализировать код, который только что был создан. Чувак, оно идет на полную. Оно создает целый чертов веб-сайт. Ладно, думаю, готово. Я попробую это. О, это мило. Это мило. Я собираюсь прервать его. Я позволю Llama взять верх. Давайте посмотрим, пока оно думает здесь, смогу ли я все еще использовать open web UI, потому что я думаю, что я его напрягаю. Да, я пытаюсь здесь. Да, оно полностью напряжено прямо сейчас. Думаю, я его заблокировал. Ладно, мы заставили его плакать. Давайте посмотрим, работает ли веб все еще. Теперь я спишу это на бета-программное обеспечение. Это ошибка, которую можно исправить, но теперь мне нужно um, сказать ей умереть. Так что я сделаю это сейчас. Перезапущу свой кластер. Я не хочу, чтобы он перегревался там. Так что, вы впечатлены? Например, кластеризация вернулась? Я так и чувствую. Например, я был впечатлен этими результатами сейчас. Конечно, я запускаю кластер за 50 000 долларов, но это концептуальное доказательство. Теперь есть возможности, и мы прошли долгий путь с начала этого года, когда мы видели только ледниковые скорости, но теперь это функционально. Это удивительно. Теперь, для полной прозрачности, Apple одолжила мне это. Я не могу это оставить. Хотел бы. Но у меня есть это еще немного. Что мне с этим делать? У вас есть идеи? У меня есть кластер за 50 000 долларов. Должно быть что-то еще, что я могу сделать. Дайте мне знать в комментариях ниже. И, конечно же, если вы хотите увидеть то последнее видео о кластере, если вы еще не видели его, оно здесь. Если вы хотите узнать больше о RDMMA и о том, как работает сетевое оборудование ИИ в центре обработки данных, я сделал полное видео об этом здесь. Нет, я просто поставлю его сюда. Я углубляюсь в то, как RDMA помогает нам обойти все эти препятствия, эти кочки на дороге. В любом случае, это все, что у меня есть. Увидимся в следующий раз. Эй, быстро. Только что поступило. Просто немного дополнительной информации, небольшой мини-сегмент о том, как Exo использует MLX, который MLX — это то, как мы запускаем все эти модели. Это фреймворк машинного обучения с открытым исходным кодом от Apple, который позволяет разработчикам, таким как Exo, делать такие вещи, как объединение этого. Теперь, вот что говорится. Драйвер RDMMA через Thunderbolt позволяет MLX распределенно общаться. >> Эй, Чак, я закончил анализ функции обратного вызова. Вот что я нашел. >> Извините, это звонил мне Claude. Так что говорится: "Драйвер RDMMA через Thunderbolt позволяет MLX распределенно общаться с низкой задержкой через Thunderbolt 5, обеспечивая высокий уровень бла-бла-бла-бла-бла". Теперь, что круто, так это то, что операции MLX могут выполняться либо на центральном процессоре, либо на графическом процессоре. И это без необходимости перемещать память, потому что это унифицированная память. Так что, серьезно, привет команде MLX за то, что они потрясающие. Exo тесно сотрудничал с ними, чтобы это произошло. И без них это видео не было бы возможным. Так что я вижу вас, команда MLX. Вы потрясающие. И вы, смотрящие это видео прямо сейчас. Напишите в комментариях и скажите спасибо команде Apple MLX. Давайте покажем им немного любви. В любом случае, это конец вашего новостного сегмента. И да, я читал свой телефон или что-то в этом роде. Эй, вы все еще здесь. Так что в конце моих видео я люблю молиться за вас, мою аудиторию. Я знаю, что это может показаться немного странным. Это так. Я согласен с вами. Но я искренне забочусь о вас, ребята, и хочу видеть ваш успех. Я хочу, чтобы у вас была жизнь с целью и радостная жизнь. Um, так что в любом случае, я просто помолюсь за вас. Um, если вам это не нравится, это нормально. Вы можете просто отключиться. Вот почему я поставил это в конце. Но давайте помолимся. Господи, я благодарю тебя за человека по ту сторону экрана. Я благодарю тебя за то, что um, они здесь, что они увлечены технологиями, что они взволнованы будущим, и что, даже если ИИ иногда может показаться немного подавляющим, um, они видят свет впереди. И я молюсь, чтобы если у них есть какая-либо тревога по поводу ИИ или рынка труда или того, что будет в будущем, ты бы просто успокоил эти страхи. И если они беспокоятся о том, что их нынешняя работа исчезнет, или если они пытаются найти работу, я прошу, чтобы ты дал им мир, чтобы ты показал им путь вперед, потому что вещи меняются. Будем честны. Но, Боже, ты знаешь, что произойдет. Ты знаешь, ты ничем не удивлен. Так что я прошу, чтобы ты просто дал нам путь вперед. Дай нам мудрость. Дай этому человеку мудрость. И я прошу, чтобы ты благословил их семейную жизнь прямо сейчас. У всех есть семья, и я молюсь, чтобы ты, как прямо сейчас, я делаю это видео на Рождество, так что около Рождества. Так что я молюсь, чтобы ты наполнил их сердца радостью и напомнил им о важности людей, которые им ближе всего, и если они не близки этим людям, то им следует это сделать сейчас. Восстанови отношения, мужик, почини то, что сломано, наполни их миром. Я видел фильм на днях. Он называется "То Рождество". И Рождество — это как эмоциональная лупа. Оно сказало, что если вы грустите в это время, если вы одиноки, это усилит это, усилит. Если ваше сердце полно радости, и вы окружены семьей, это усилит и усилит это. Так что я молюсь за людей, которые сейчас одиноки в это время, чтобы ты наполнил их сердца радостью, и что um, я надеюсь, что в этот сезон они смогут узнать немного о причине, почему мы берем это время Рождества больше Христа. Я действительно верю, что высшую радость можно найти в тебе, Иисус. И я молюсь, чтобы другой человек, этот человек по ту сторону экрана, где бы он ни находился, он мог просто встретиться с тобой каким-то образом, в чем бы это ни было, даже в их сомнениях, даже в их неверии. Тебе все равно. Встреться с ними там. Я прошу этого во имя твое, Иисус. Аминь. Извините, это было немного длинно, но я чувствую, что это было то, о чем я хотел помолиться за вас. В любом случае, это все, что у меня есть. Увидимся в следующий раз.