📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

Esse cubo TRANSFORMOU minha forma de rodar IA local (ZimaCube 2 Pro)

AI ProgBr19:28

Transcription

Quando o pessoal da Ice Way falou que ia

mim mandar o Zima Cube 2, eu fiquei

muito animado. Eu já tinha experimentado

o Zima Board, gravei um vídeo aqui pelo

canal, inclusive que é um aparelho deles

muito legal, mas o Zim Cube é outro

nível. E depois de usar por algumas

semanas, eu não só tô apaixonado como um

pouco surpreso, porque ele se tornou uma

peça fundamental aqui no meu laboratório

de IA e eu não podia imaginar por isso.

Bem, que que é o Zimacube 2? O Zima Cube

2 é o NAS, tá? Network Attached Storage.

E isso é algo que eu sempre quis por

conta do canal do YouTube. Gravar vídeos

é uma atividade que gera arquivos

gigantescos. E agora que a minha sócia é

a minha editora, também conhecida como

minha esposa, a forma mais eficiente que

eu tinha de gravar aqui, passar o

arquivo para ela era através de pen

drives. E eu comprei um monte deles e já

perdi vários. Então eu sempre quis um

NAS para essa atividade e o Uzimacube

funcionou muito bem para isso. Na

verdade mudou a nossa vida porque agora

eu termino de gravar, eu arrasto o

arquivo aqui pro Zimacube que tá aqui do

meu lado e ela lá do computador dela

consegue acessar. Baixa lá, faz a

edição, sobe o bruto. Eu reviso aqui,

ficou muito melhor. E se a gente parasse

por aí já tava perfeito. Só que ele

acabou trazendo um efeito colateral para

mim que eu não podia imaginar antes. Ou

melhor, podia imaginar, mas não sei

porque eu não pensei sobre isso. Que que

acontece? O Zimacub 2, ele tem seis

entradas para HD. Então você pode botar

HD ou SSD nessas entradas. Eu hoje tenho

um HD de 8 TB aqui, né, que eu mantenho

ali para coisas que eu não vou usar, por

exemplo, arquivar vídeos que a gente já

subiu, esse tipo de coisa. E aí eu tenho

um SSD que fica em uso pra gente fazer

essa troca dos arquivos de vídeo, mas

ele também tem uma sétima baia, onde dá

para colocar até quatro SSDs do tipo

NVMR. Esse tipo de SSD ele é mais

rápido, então ele é ideal para quê? Ll,

modelos de inteligência artificial.

Então, assim que ele chegou, eu falei:

"Cara, isso aqui vai facilitar muito

minha vida, porque eu já tinha aqui uns

três ou quatro SSDs NVM que eu tava

usando para colocar os meus modelos".

Porque normalmente quando a gente vai

pensar em montar um setup para IA, a

gente pensa na memória, né? Quantidade

de memória primordial pra gente saber

qual modelo vai caber ou não. E também a

largura de banda. Pouca gente pensa na

largura de banda, vai, porque eu tô

vendo tanta gente animada aí com os

devices de largura de banda baixa, mas

largura de banda também é muito

importante. Só que a gente deixa de lado

o armazenamento. Eu fiz exatamente isso

quando eu fui comprar o meu Mac. Eu

tenho uma justificativa. Se você

configurar hoje um Mac mini no Brasil

com chip M4 Pro 48 GB, que é uma memória

considerável, já dá para rodar uns

modelinhos legais ali, ele vem com 512

GB de HD a 21.799.

Mas aí você pensa, eu quero armazenar

vários modelos, aí você resolve aumentar

um pouco a capacidade da tua máquina. Aí

que que acontece, ó, de 21, se você

aumentar para 2 ter vai para 29.000. Só

que no Mac min talvez 2 ter seja

suficiente porque você vai conseguir

carregar modelos ali de 30 GB. Então dá

para você armazenar 20 modelos

tranquilamente, sobra muito espaço com 2

ter, mas mesmo assim a gente viu o

salto. Agora se você for para um Mac

Studio com 96 GB, olha só, ele vem com 1

ter de espaço, né? 96 GB já é bastante,

dá para você colocar modelos muito

grandes ali, principalmente se você for

quantizar modelos. Outro dia, quando eu

queria testar o modelo do finado Rio 3.5

Open, eu baixei os pesos dele inteiro,

que tinham 800 GB. Depois gerei um outro

arquivo Q3 de mais ou menos 200 GB.

Então, se eu tivesse 1 tera no meu Mac,

eu não conseguiria fazer isso. Eu tenho

2 teras no meu Mac. Eu só consegui fazer

isso por causa do Zima Cube, porque eu

não conseguiria ter mais de 2 teras.

Olha isso aqui. Esse computador já é

caro no Brasil, tá? Ele custa R$ 51.000,

R$ 52.000. Se a gente colocar 16 teras,

ele mais do que dobra, o preço vai para

107. Então sair de 1 para 16 teras sai

mais caro do que você comprar um outro

Mac Studio com 1 tera também. Então olha

só como é caro, né? O armazenamento,

principalmente quando a gente fala de

Apple. Obviamente aqui para mim é um

pouquinho mais barato porque eu tô no

Canadá, mas mesmo assim aqui no Canadá

sairia de 5.500, ó. Ó custa mais do que

o valor dele, tá vendo? 16 teras sairia

para 12.399.

É um salto absurdo. E foi aí que eu

falei, quando o Zima chegar, que que eu

vou fazer? Vou colocar uns HDs ali,

NVME, e vou usar eles para armazenar os

meus modelos. Assim eu consigo carregar

os modelos, mesmos grandes, diretamente

do Zima Cube, através do Mac, como se

fosse ali um HD de fato. Só que aí eu

pensei o seguinte, pera aí, o meu Mac

ele tem 256 GB de memória unificada,

quer dizer que eu consigo carregar

modelos bem grandes, mas como é que eu

vou carregar um modelo de quase 200 GB

às vezes através da rede? Vai demorar

demais. E foi aí que eu me surpreendi de

fato, por eu fui ver as especificações e

o Zima Cube 2, ele tem duas entradas

Thunderbolt, quer dizer que são conexões

de alta velocidade. Então quando eu

conectei o Zima Cube no Mac, foi

praticamente como se eu tivesse todo

esse armazenamento conectado diretamente

nele. Não muito diferente do que eu já

tava fazendo, porque eu já tava usando

HDs externos para armazenar os modelos e

carregar direto dos HDs externos. A

diferença agora é que tá tudo muito mais

organizado e eu consigo expandir de

forma muito mais fácil. Antes eu tinha

que ficar com todos esses HDs

pendurados. Esses daqui, por exemplo,

são cases de NVMs, SSD, NVME. E eu já

tava indo pro terceiro, quarto pendurado

aqui. Tava um negócio terrível. Às vezes

eu esbarrava, desconectava. Agora eu

consigo facilmente manter todos os meus

modelos, principalmente os maiores aqui

no NVME. Quando eu tenho um modelo muito

grande, que eu sei que eu não vou usar

por um tempo, mas eu também não quero

deletar ele porque eu quero ter essa

carta na manga, por exemplo, a gente

testou aqui no canal o Mini Max M3,

então quer dizer que provavelmente o

Mini Max M 2.7 eu não vou usar por um

tempo, aí eu vou coloco ele no HD disco

rígido mesmo, né, que tem 8 TB, então eu

consigo colocar alguns modelos grandes

lá e ele fica ali. Se eu precisar dele

eventualmente eu trago ele de volta pro

NVME e carrego direto do NVME. Para

arquivos que são pesados, mas ainda mais

leves do que isso, como vídeos, por

exemplo, de 3 GB, 4 GB, o SSD me atende

perfeitamente e a própria conexão da

rede também é super suficiente para

trocar de forma rápida. Além disso, o

Zimacube ele trouxe também alguns

benefícios, porque ele tem aqui embaixo

um hardware bem potente. Ele tem um Core

5, tem 16 GB de memória DDR5 que dá para

expandir, dá para você colocar mais, dá

para colocar até 64 GB. Inclusive, tem

uma versão que eles vendem que já vem

com 64 GB, que é a versão Creator Pack,

que ela vem com algo a mais também, um

negócio que eu queria muito ter pego

essa versão, mas eu não consegui, que é

uma placa de vídeo dedicada, uma placa

de vídeo RTX 2000 Pro já da família

Blackwell com DDR7. Ela vem com 16 GB, o

que quer dizer que você consegue rodar

IA nesse equipamentinho aqui. Eu não

consegui pegar essa versão, mas eu não

podia ficar para trás. Eu falei, se esse

equipamento me permite rodar IA com uma

placa de vídeo, eu nesse canal tenho que

conseguir fazer isso, certo? Então eu

fiz a mesma conexão que liga a RTX 2000

que vem no Creator Pack, ela tá

disponível aqui nessa minha versão

também que é o Zima Cube 2 Pro. Então eu

consigo conectar uma placa de vídeo se

ela for small form factor, aquele perfil

mais baixinho, né? E se ela consumir até

70 W. Só que eu não tenho uma placa de

70 W. Eu não tenho uma placa desse

perfil baixo. O que que eu fiz? Eu

liguei um adaptador Ocolink e conectei

num doc. Agora esse doc ele tem uma

fonte própria de 800 W. Quer dizer que

eu consigo colocar placas muito mais

potentes ali, que consomem muito mais

também. No momento eu tô usando aqui com

uma RTX 5060 de 16 GB, o que seria

parecido ali com a RTX 2000 que vem, com

a diferença de que como essa placa ela

consome mais energia, ela também é mais

potente, ela tem uma largura de banda

maior, então acaba trazendo um resultado

melhor especificamente pra IA. Mas eu

vou te confessar uma parada aqui, tá? Eu

não sou um cara de redes, configuração

de equipamento que envolve rede, eu acho

um pouco chato. Então tudo isso que eu

falei até agora, seria um completo

pesadelo se fosse difícil de usar, se

tivesse que fazer milhares de

configurações, mas não tem. Graças ao

Zima OS. Zima OS é esse sistema

operacional que a gente tá vendo aqui.

Então, basicamente, eu conecto a

internet do meu Zima Cube, conecto ele

na tomada, aperto o botão de ligar e ele

já fica automaticamente acessível via

rede. Então, eu posso vir aqui, ó. No

meu caso, eu tô no endereço interno

10.0.0.168

e eu já consigo acessar o sistema

operacional que tá rodando nele, que é

um sistema operacional chamado Zima OS,

baseado no Linux, mas todo pensado para

funcionar na rede de uma forma fácil,

muito simples, feita para qualquer tipo

de usuário. Tá aqui você pode ver que

ele tem um estilo até de um iPad,

digamos assim, né? Ele tem widgets, ele

tem aplicativos, como eu falei, aqui

dentro a gente tem um i5, tem 16 GB de

RAM, então a gente consegue rodar

algumas aplicações aqui tranquilamente.

Aqui a gente tem os widgets, consegue

ver o sistema, né? Quanto que ele tá

consumindo, qual que é a temperatura,

quanto tá consumindo de memória. Já vou

te explicar porque eu tô com a memória

tão cheia assim. Aqui eu tenho os dados

da minha Nvidia que tá conectada nele,

que é a 5060 Ti. E aqui eu tenho algumas

aplicações. Essas aplicações você pode

baixar da própria App Store. Aqui nessa

App Store, ó, você tem já o Hermes, né,

o agente Hermes. Você tem aqui OpenCla,

você tem algumas outras aplicações que

são parecidas com Notion, por exemplo.

Você pode basicamente substituir várias

aplicações que você usa na nuvem por

aplicativos que você baixa nessa loja

aqui. Para quem é programador é

excelente porque dá para você

experimentar várias coisas. Você pode

instalar aqui, ó, um servidor Post Greek

com um click. Como ele é todo baseado em

Docker, você consegue criar um sistema

de teste completo. Dá até para no tempo

livre a gente jogar alguns emuladores.

Pode usar como servidor de mídia da sua

casa. A gente tem NN aqui, mas uma coisa

muito interessante é que se a aplicação

não tiver aqui na App Store, você pode

vir aqui, instalar um app customizado e

entrar com os dados de uma imagem Docker

e você consegue instalar qualquer

aplicação. Nesse caso aqui, eu tenho,

por exemplo, lhama CPP instalado dessa

forma aqui. Ele tá já usando a 5060 Ti.

Então eu tenho, por exemplo, aqui o Gema

12B rodando, ó. Dá um olá para ele. Olá,

como posso ajudar você hoje? Ele tá

rodando na 5060 e tá trazendo pra gente,

ó, 36 tokens por segundo. Eu tenho

vários outros modelos aqui. Aqui, por

exemplo, Quen 3.6, Q3 ou Q2. Se eu

quiser usar eles, eu vou tirar, né? Vou

descarregar esses modelos que estão

carregados. Vou carregar ele aqui. Leva

alguns segundos para carregar. Eu

consigo, inclusive acompanhar por aqui,

ó. Assim que tiver carregado, essa barra

vai subir. Ó, a barra subiu aqui, quer

dizer que o modelo tá carregado lá. Se a

gente voltar lá, ó, quer dizer, ainda

não terminou, mas tá quase, quase todo

carregado, ó, acabou de carregar,

aparece aqui pra gente. Pronto. Vou

criar aqui uma nova janela. Vou dar um

oi. E aqui, ó, Quen 3.6, 35 milhões de

parâmetros, rodando a 44 tokens por

segundo. Uma versão Q2, tá? Mas isso é

uma limitação da placa que a gente tá

usando agora, porque ela só tem 16 GB.

Se a gente tivesse uma placa com mais

memória, a gente conseguiria rodar mais

rápido. Inclusive, o meu plano é deixar

Intel Arc de 32 GB ligado aqui. O único

problema hoje é que o ZMOS, na versão

que a gente tá agora, o kernel dele não

é compatível ainda com as placas da

Intel. Eu tô só esperando eles

atualizarem porque o próximo kernel vai

ser compatível e a gente vai conseguir

usar de forma tão simples como a gente

tá usando a RTX. E eu sei que vai dar

para usar porque eu já liguei a Intel

Arc B70 no Zima Cube. A diferença foi

que eu fiz o seguinte, eu peguei um dos

NVM que eu tenho, menorzinho dele, que

tem 256 GB. E a propósito, eu podia ter

feito isso até com pen drive, mas eu fiz

nele. Eu instalei o Bunto nele, né?

Então, reiniciei ele, dei o boot por

esse NVME. Como eu já falei, ele é um

i5, né? Um X86. Então, rodou

tranquilamente. Instalei todos os

drivers e funcionou. Inclusive, se não

me engano, o vídeo que eu fiz aqui pro

canal sobre a Arc B70 foi 100% rodando

no Zimacube. Você ver quão potente é

esse device, além do lama CPP. E aí eu

vou fechar ele aqui, ó. Para eu fechar,

só vem aqui, ó, stop. A gente vai ver

essa barra aqui diminuir, ó. Descarregou

já o modelo, já fez tudo. Não dei um

comando. Olha só que legal, né? Isso

daqui é de fato democratizar IA. Que

basicamente eu fiz uma configuração aqui

nos settings, uma vez e acabou. Para eu

iniciar isso aqui, é só eu dar um

clique. Mesma coisa, Confi Confi. É uma

aplicação que ajuda a gente a rodar

modelos de imagem, de áudio, de vídeo. E

para eu iniciar é muito fácil, é só eu

dar um clique aqui, esperar ele carregar

e pronto, tá carregado. Eu tenho aqui já

os meus workflows. Deixa eu pegar esse

aqui, por exemplo, ó. Esse daqui é um

modelo de geração de música. Vou rodar

aqui. Ele tá carregando o modelo. A

gente consegue ver lá pelo Zima também,

ó, que aqui tá começando a subir. Tá

vendo, ó? Tá subindo lá, tá carregando o

modelo. Assim que terminar de carregar,

ele vai rodar aqui pra gente, vai gerar

uma música 100% gerada por inteligência

artificial. Deixa eu diminuir essa

janela aqui pra gente enxergar um pouco

mais do workflow. Ó, tá gerando aqui pra

gente já. Tá vendo a barrinha subindo,

terminou de rodar aqui, ó. Vamos ouvir

a

>> cidades grandes, luzes que não dormem.

Correndo sem rumo, sem saber quem somos.

O barrio da rua tenta calar a voz, mas

no silêncio da noite eu finalmente

escuto.

Tá bom, tá bom. Só uma palinha, uma

música 100% gerada localmente. Mas legal

é que esse modelo ele ocupa 4 GB só. É

um modelo bem pequenininho. A gente tá

rodando na 5060 Ti, mas como o Zima Cube

ele tem 16 GB de memória, daria para

rodar ele direto da memória RAM.

Obviamente seria muito mais lento, né?

Porque a gente perderia todas as

vantagens de uma placa de vídeo, mas

tecnicamente daria para rodar. Eu não

sei exatamente qual seria a velocidade,

mas acredito que daria para gerar uma

música por hora, por exemplo, nesse

cenário aqui, mesmo se a gente não

tivesse placa de vídeo, mas com placa de

vídeo fica um pouquinho melhor. Mas isso

é só metade da história, porque tinha

uma coisa desse sistema operacional que

eu não fazia ideia que se eu já tava

gostando Zimacube me fez gostar dele

mais 300%. Mas para te explicar eu vou

ter que ir lá para fora. Essa aqui é a

parte mais legal. Ó, eu tenho aqui o

aplicativo do Zima client. Se eu clicar

ali, ó,

a gente começa a conexão com o Z Pro que

tá rodando lá na minha casa. Mesmo eu

tando aqui, ó,

no meio de Vancouver,

tá conectando lá. E aí ele cria uma VPN,

né, uma conexão direta aqui entre o meu

celular, ó, já conectou lá. Agora se eu

for aqui embaixo, ó,

eu consigo ter acesso às aplicações,

inclusive CPP. Eu

consigo carregar um modelo aqui. Deixa

eu tentar carregar um pequenininho.

Carregar aqui, ó, 3.5 0.8 bilhões de

parâmetros.

Enquanto ele tá carregando, eu consigo

sair aqui e ver todos os status da minha

máquina. Então aqui eu já vi, ó, que ele

começou a carregar, tá vendo? Já tá com

15% ocupado da 5060 Ti que tá lá. Então

posso voltar aqui. Lama CPP. Ó, o modelo

já tá carregado ali, já consigo ver ele

verdinho ali. E eu posso mandar uma

mensagem, oi, como se eu tivesse lá na

minha máquina.

Aí enviei e ele responde aqui, ó, 276

tokens/ segundo, porque isso aqui não tá

rodando no meu celular, só que tá

rodando na RTX 5060, que tá conectada ao

Zima Cube lá na minha casa. Isso daqui é

a parte mais impressionante, porque eu

não esperava que fosse tão fácil fazer

algo desse tipo, tudo graças aos.

Inclusive, daria para eu usar a internet

no meu celular, conectar um computador

ou um iPad e acessar o Zima Cube. Não só

o a LLM, mas todos os aplicativos, todos

os arquivos de qualquer lugar, qualquer

lugar que eu tenha acesso à internet.

Pode ser via Wi-Fi ou via conexão 5G,

né? através da conexão, por exemplo, do

meu celular. Isso é simplesmente

bizarro. Eu sabia que eu ia conseguir

substituir serviços como Dropbox, Google

Drive, até Google Photos enquanto eu

tivesse em casa. Mas o fato de eu

conseguir acessar de qualquer lugar para

mim é simplesmente assustador. Eu não

tinha ideia disso, principalmente que ia

ser tão fácil, não precisei fazer nada,

nenhuma configuração. Basicamente é uma

das funcionalidades do sistema

operacional do Zimo tem noção que daria

para eu viajar pro Brasil e ainda ter

acesso à minha 5060 T? Tem noção disso?

Consigo fazer basicamente tudo, gerar

imagens de forma privada, dá até para

criar as próprias aplicações para dar

suporte aqui aos nossos negócios. A

gente tem algumas aplicações que a gente

hospeda na nuvem, porque a gente precisa

que esteja disponível em qualquer

device, a qualquer hora com os mesmos

dados. E eu já tô planejando tirar isso

de lá e colocar aqui no Imacube, porque

afinal de contas eu vou ter os mesmos

benefícios com a vantagem de ser tudo

privado, completamente privado, tudo

armazenado local, se eu quiser com

redundância e sem ter que pagar nenhuma

mensalidade para isso. Eu tenho

basicamente a minha nuvem privada. Então

hoje aqui no meu negócio, no meu canal,

na minha estrutura de A, o Zimacuba é

como se fosse o seu Madruga, né? Quando

a gente pensa em Chaves, talvez ele não

seja a primeira cara que vem na tua

mente, mas se você tirar ele, fica tudo

meio sem graça, muito mais difícil de

assistir. Além disso, outra semelhança é

que com ele eu posso cancelar o meu

pagamento de aluguel para alguns

serviços na nuvem. E isso por si só já é

incrível. E eu queria agradecer a W

porque eles me mandaram aqui o Zacube

sem nenhuma exigência, tá? Então, se eu

falasse, ó, para mim não serviu, não

gostei nisso, nisso, nisso, não foi bom

nisso, tava tudo certo, eles não

exigiram nada. E eu vou te falar se isso

tá vazio, mas vou te falar, se quebrasse

hoje o meu cube, eu ia sair correndo

para comprar um outro, porque eu não

consigo mais imaginar o meu setup sem

isso aqui. Eu acho que para mim,

especificamente, talvez a parte mais

importante seja o Thunderbolt, que

permite que eu consiga transferir esses

arquivos gigantescos muito rapidamente.

Quer dizer, a PCI também para eu ligar

uma placa de vídeo também é muito legal.

Eu não sei qual que é a minha parte

preferida, não, mas vou te falar, eu

gosto muito desse device e pode ter

certeza, se eu não gostasse, eu não ia

estar falando aqui. Aqui embaixo vai ter

um cupom de desconto, tá? Vou botar pro

Zima Cuube, vou colocar um cupom também

pro Zimabard. O Zim Board também tem

acesso ao Zimos. Dá para fazer muitas

das coisas que eu falei aqui, só que é

uma outra classe de produto, né? Você

não vai ter tanto espaço para HD lá.

Você tem até duas entradas SATA que você

consegue colocar algum armazenamento,

mas aqui é se você precisa de

armazenamento massivo mesmo, esse daqui

vai fazer mais sentido. E aqui você tem

um processamento melhor também. Lá você

tem um N150, aqui você tem um i5. Na

minha versão é um i5, 1 2 3 5 U, tá? Tem

uma versão um pouco abaixo dessa que é o

Zima Cube 2, que não é Pro. A diferença

é que ele vem com i3, esse vem com i5,

ele vem com 8 GB de memória DDR5, esse

vem com 16 GB. Esse aqui vem comentada

de rede de 10 GB, aqui ele não vem. Acho

que essas são as grandes diferenças. Se

você quiser ver o vídeo sobre o Zima

Board, dá uma olhada nesse card aqui,

onde eu rodei alguns modelinhos pequenos

diretamente nele. Se você quiser ver um

vídeo rodando modelos de LLM diretamente

no Zimacube aí, deixa aqui nos

comentários. Vou ficando por aqui, até o

próximo vídeo.