Transcription
Fazer uma pergunta aqui, um parêntese rapidinho, ó. Eu entendi o lance do modelo grande que com tempo que o contexto diminui. Legal. Eh, rapidinho, um um modelo pesado de 30 GB e um modelo de 15 GB, qual a diferença prática entre eles?
>> A quantidade de parâmetros é a quantidade de parâmetros, >> tá? E aí ele vai mais ser mais ou menos inteligente. >> Vou explicar também.
Então, vamos lá. Só para só para terminar, o que que precisa nesse nesse ano dos agentes? Você precisa de pensamento profundo, você precisa ter eh tool calling. O modelo precisa ser treinado para chamar, desculpa, você tem que ter o cave cash, você tem que ter o prompt cash, que é não só guardar o cash daquela requisição, mas de todas as requisições do seu contexto para você não ter que recalcular o histórico todo toda hora >> e e desperdiçar token. >> E desperdiçar token.
Aí você precisa ter eh que que era então pr e o to calling. Exatamente. É, você precisa ter treinamento no tool calling para que que no pensamento profundo chame tool calling. Então são não é duas coisas separadas, ele tem que estar junto. O deep si ele não tem prompt cashing, então nos meus testes ele foi mais lento porque ele ele tem que ficar recalculando tudo toda hora, >> mais perdulário também, né? Desperdiça a coisa. >> Ele tem deep thinking que não tem treinamento com o tool Colin, então o deep thinking dele é raso e inútil. O Tool Colin dele é super defasado. É o modelo 2024 de Tool Colin, sendo que já evoluiu para caramba em 2025, todo mundo já foi pod direção.
Então o que o o GPT e o Antropic, Open e Antropic fizeram foi melhorar essas três coisas no modelo que já existia. Então, em vez de ficar fazendo mais parâmetro, eles pararam a guerra dos parâmetros e começaram a melhorar o cashing, começaram a melhorar tool, treinamento de tool calling e começaram a melhorar a profundidade do pensamento e tornar isso mais customizado. Tem vários modelos para cada situação. E também uma outra coisa que o Deepsic tinha e todo mundo já tem agora que é o mixture of experts.
Então, se você tem um modelo de 200 bilhões de parâmetros, a grosso modo, vamos dizer que dá 200 GB. Só air 200 GB não cabe em 32 GB da Nvidia, mas ele não precisa carregar os 200 GB de uma vez. Aí a grossíssimo modo, faz de conta que você vai só fazer trabalho de tradução de texto de português para chinês. Você não precisa carregar os parâmetros de inglês, de francês, de italiano. Então, dos 200 bilhões, eu só preciso ter, sei lá, 15 ativos na memória para fazer o cálculo, entendeu? Então é uma é uma decisão de uma estrutura de arquitetura desse modelo para que eu possa, não é? bonitinho assim a inglês, chinês, eh, dentro do modelo de parâmetro, ele consegue particionar uma quantidade menor para manter ativa na memória.
Então, tudo isso é para você otimizar o compute, que é o a computação em cima desse modelo, e a memória que você tá usando para você melhorar a rapidez, a latência e gastar menos recurso. O DPC ele parou em 2025, no começo. Todos os outros avançaram já. A gente tá nesse ponto onde tem mixture of experts, você tem tool calling, você tem deep thinking integrado, prompt cashing.
Bom, aí agora tem a ideia que o Google lançou também e já tá se evoluindo, que é a compactação desse casing de contexto, que é o tal do cave cash, a gente faz quante. Quantização é o método de compactação que você consegue compactar de sei lá, 10 GB para 2 GB para você conseguir esticar ainda mais, espremer ainda mais e caber. E aí você tem Polar Quant e o Turbo Quant que usa esse Polar Quant para fazer isso. tradeoff de compactação é que você consegue colocar em menos memória, mas vai gastar cinco ou seis vezes mais processamento depois para calcular tudo. Então nunca é mágica. Nunca é mágica.
Ah, toda vez tem vários projetos que saíram besteira por um chamado, acho que era Air LLM ou Air Max, alguma coisa assim, que a ideia é nossa, se a gente consegue pegar um modelo que não caberia no 132 GB e a gente compacta para caber. Não é que compacta para caber, ele ele faz o equivalente a um swap, sabe? memória swap da sua máquina, que você não tem RAM e ele faz um swap no seu disco. O que que acontece se você faz um swap no seu disco quando você não tem RAM?
>> Cara, eu crio uma memória, uma memória RAM virtual ali e fica lento pr caramba. >> Fica lento para caramba. Exatamente. A, a, o tradeoff é esse. Quando você faz caber coisas numa memória que não cabe, você tá trocando para ficar alerto, porque ele vai ficar >> não tem mágica. >> É, quando ele precisa na RAM, ele tem que tirar alguma coisa da RAM, pegar do seu HD e devolver pra RAM. Então ele fica fazendo o tempo todo swap, suap. Ele chama swap. Então ele fica trocando na memória o tempo todo. Isso é lento funciona. Mas ou seja, não compensa, não compensa fazer isso.
Então o problema, a gente juntou agora, chegamos chegamos no limite do problema. O limite do problema é que guerra de parâmetro não vai legar levar a lugar nenhum. As a GI não vão aparecer nas LL. A gente já sabe disso. É uma coisa que eu falei que a gente já sabia há 2 3 anos atrás. Todo pesquisador sabe disso. Só pessoal desiludido achava que ia sair Skynet dessa [ __ ] Não vai sair Skynet dessa [ __ ] Ah, o Jeffrey Hinto >> da LLM ou das IAIS de uma forma >> da LLM. Da LLM. A gente não descobriu ainda a IA que vai chegar lá. Não estamos nessa nessa categoria.
Bom >> aí os discípulos dele tudo vazaram. O Elias Skiver que saiu da Open brigado com Sultiman. Ganhou os bilhões e sumiu. Não tem nada para mostrar. É uma desgraça isso. O Ian Lecun, que é o melhor de todos, ele era o o líder de da meta, saiu da meta, foi fazer as coisas. O o IQ é o que mais fala que, cara, se você tá apostando, se você quer participar do futuro das IS, para de mexer com LLM, porque ali já é um teto, já não vai avançar al disso.
Então, a gente já tá nesse ponto. Então, as LLMs não vão ficar muito melhores do que elas já são hoje. Vai melhorar um pouquinho. Elas continuam sendo burras, entre aspas, no sentido que nenhuma LLM é feita para te dar resposta. correta. Ele é feito para dar uma resposta, a probabilisticamente mais que você talvez gosteado no seu contexto. Inclusive, muita gente não sabe disso, mas se você tá no na interface web, acho talvez na aplicativo web também, tenta experimenta fazer isso depois no chat GPT. Pergunta assim: "Ah, base primeiro prompt num chat novo, baseado nos meus últimos chats, como que eu sou?" E ele vai te descrever. Eu já rolei, já fiz saiu um tempo atrás na hora de fazer de novo.
>> Tem gente que não sabe disso porque ele ele vai compactando a a memória dos últimos chats e tipo, ele faz um resumo dos seus chats e ele usa isso como personalidade. Então toda vez que você acha que tá num chat novo e pergunta: "Ah, será que esse negócio é certo?", ele vai te responder o que você tende a aceitar como certo, não que o que é o certo. >> Então, >> mas tem, mas eles são, mas eles são bastante eficientes nessas inferências que eles fazem eh, sobre quem você é, pela maneira como você se comunica com eles. Ó, o Claud, por exemplo, descobriu que eu sou o Igor. >> Sei, porque ele é na no seu chat vai ter informação para eles uma ideia com ele, pá, e ele entendeu em algum momento, de algum jeito que eu sou o Igor, tá >> ligado? Viagem, né? Sim, porque ele tá sempre buscando coisa lá dentro.
Então o o as LLMs eles não foram feitos para dar resposta correta. E até hoje se você pegar só um modelo bruto sem o harness e você fizer pergunta para ele, ele vai te devolver muitas vezes a resposta, entre aspas errada. No caso de programação, ele vai devolver um código que não roda, vai devolver uma coisa que não roda. O que o harness faz? Ele pega esse código quebrado, roda na sua máquina, vê que dá uma mensagem de erro e devolve a mensagem de erro, que era o que antes a gente fazia manualmente. E aí com a mensagem de erro como contexto, agora ele fala: "Ah, eu tenho o meu código quebrado, ele dá este erro, portanto eu consigo fazer este outro código que conserta este erro". Então ele fica fazendo várias rotações enquanto você não tá, você não tá nem fazendo nada, tá só acompanhando. Ele tá lá, tá, tá, tá, tá, tá, tá fazendo, por isso tá gastando com token para caramba, entendeu?
Então, a a LLM ela não ficou mais inteligente. A gente fez um bom harness que pega a burrice dele e nas uma vez em cinco que ele dá certo, eu consigo fazer ele repetir mais vezes e dar mais informação do meu ambiente. Essa que é a parte, essa que é a parte importante. Quanto mais informação do ambiente que tá rodando ele tem, melhor vai ser inferência, obviamente, porque ele já sabe, este código dá este erro, portanto vamos tentar o próximo código. Então ele não vai ficar repetindo o mesmo código 500 vezes.
>> Eu descobri tudo isso que assim hoje eu tô hoje você tá pondo o nome numa porrada de coisa que eu fui sacando. Isso por isso que eu falei que é o novo vocabulário. >> É exato. Que assim e eu fui sacando, por exemplo, e quando eu tava brincando lá na minha primeira tentativa com o aplicativo do chat EPT web e tal, eu percebi, por exemplo, que ele não passava, quando dava 25 minutos, ele me entregava um zip, [ __ ] Entendeu? Aí aquele zip ali, ele vinha vinha todo quebrado. Eu fui sacando que era que era o tempo. Quando dava um determinado tempo, ele acabava fechava a sessão e ele me só que ele nunca falou isso. Eu fui sacando. Eu [ __ ] porque quando dá esse tempo aqui, tu me entrega um zip quebrado toda vez. Aí ele não dá uma desenrolar um causão lá, não sei o que. Depois ele fala: "Não, tenho limite de sessão que não sei o quê". Ah, tem uma coisa pior para te [ __ ] ainda mais.
>> Então, até complementando o negócio que eu falei dos planos, tá? Tropic que não permite que você usa fora dos planos outra ferramenta, certo? Você tem que pagar por token. O problema disso que você paga mais caro. Quanto mais caro? Aí eu fiz os testes para contar no benchmark deu, eu peguei o price, o total de tokens, etc. H, o preço por token separado é o dobro dos tokens da mensalidade. Então, para cada dólar que você paga de token na mensalidade, tá pagando dois se for token avulso. O da OPAI é pior. Eles mudaram o price em semana passada, mas antes dessa mudança, o plano deles de 100 ou 200, se você fosse pegar aquele equivalente de token e e fazer e avulso, ia dar 900 de token avulso. tipo seis, sete vezes mais do que é o token na mensalidade, entendeu?