📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

O SEGREDO para Não Acabar Seus Tokens no Claude

Anderson Adelino | IA e Automações13:14

Transcription

Você contratou o plano pro do Cloud, todo animado, que vai estar lá construindo seus projetos. Passou alguns minutos construindo algo, conversando lá com o Cloud, e aí do nada, tu toma um bloqueio aí de algumas horas, sendo que você fez pouca coisa. Pois bem, isso é muito mais comum do que você imagina. Eu vejo esse relato com bastante frequência no Twitter, na comunidade. Até um amigo meu chegou até mim, falou que tava torrando muito rápido os tokens, né? Depois de conversar com ele, eu percebi ali alguns problemas que ele estava usando. Mas enfim, não se preocupe, que nesse vídeo eu vou estar te apresentando aí oito hacks que você pode estar usando para diminuir significativamente os seus gastos com tokens. Então, eu tenho certeza que após esse vídeo, você vai conseguir usar duas, três, cinco vezes mais do que você usa normalmente. Então, vamos embora pro vídeo.

Então, pessoal, eu separei aqui oito dicas que você pode estar utilizando, que pouca gente sabe, né? Pode ser coisas aqui que pareçam algo simples, mas se você aplicar, você vai ver que faz uma grande diferença, tá? Então, antes de eu mostrar aqui os hacks, eu quero que primeiramente você entenda como que funciona os custos dos tokens, tá bom? Você pode imaginar que, ah, eh, cada mensagem que eu mando pro Cloud, eu vou estar gastando uma quantidade de tokens, uma quantidade de tokens fixas, de acordo com a mensagem que eu mandei, a mensagem que eu recebi. Só que não é bem assim que funciona, não é algo linear. Na verdade, a curva de gasto é parecido com essa curva aqui, né? É algo exponencial. Ou seja, a cada nova mensagem, o Cloud ele relê todo o histórico. O consumo não é linear, é acumulativo. Isso é o que a gente chama de crescimento exponencial. O que é isso, Anderson? Observe e imagine que cada número desse que eu coloquei no gráfico seja uma mensagem que você mandou pro Cloud. E essa curva, ela significa o gasto de tokens. Então, tu mandou uma mensagem, gastou um pouquinho de tokens, duas mensagens, três mensagens. Aí tá aí, beleza. Mas chega o momento aqui, ó, que você começa a ver um crescimento gigante. Então, sei lá, você mandou ali 30 mensagens, tu gastou 31 vezes mais tokens, porque ele é acumulativo. Ele vai pegar todo o contexto do histórico da conversa para poder processar a resposta, e todo aquele histórico vai gastar token, certo? E isso já consigo ligar diretamente com o primeiro hack, que tem a ver com usar o barra clear, tá? O barra clear, ele serve para limpar a sessão, então ele vai limpar todo ali o histórico, certo? Ele zerou o histórico da conversa. E o que que isso significa aqui na prática? Que aí quando você for mandar mensagem depois, o contexto tá zerado. Então, é como se tu tivesse começando uma conversa do zero, tá bom? Isso aqui, pessoal, vocês devem estar fazendo isso sempre que vocês forem mudar de filtro, mudar de algo que tu vai fazer ali no Cloud Code, né? Por exemplo, você tá lá, por exemplo, criando uma skill para o seu projeto no Cloud Code. Então, tu abriu o chat, tá conversando com o Cloud e tá construindo essa skill. E aí você finalizou a skill, completou. Só que aí o que acontece é que você geralmente vai continuar a conversa para outras coisas, né? Por exemplo, depois de fazer a skill, você decidiu melhorar o design do front-end do site. Isso na mesma conversa, tá vendo que não faz sentido, né? Elas não são relacionadas. Essas duas tarefas que tu tá pedindo pro Cloud fazer, não tem uma ligação, né? Uma coisa não vai impactar com a outra, sendo que você vai estar gastando muitos tokens só pra estar fazendo isso, sendo que o ideal seria você dar um barra clear para aí sim mexer na parte do front-end, tá? Então, começar do zero é exponencialmente mais barato, tá? Então, primeira coisa que tu deve fazer é isso.

Segunda coisa, desconecte os MCPs que você não está utilizando naquele momento. Uma coisa, pessoal, que eu percebi é que os MCPs, quando vocês conectam eles lá no no Cloud Code, mesmo que você não use aquele MCP, ele tá gastando muitos tokens só em estar ligado. Então, às vezes você tá lá com o MCP, por exemplo, Super Base conectado, sendo que você nem tá trabalhando com o banco de dados naquele momento, só que tá gastando tokens. Se você for lá no seu Cloud Code, dar um barra context, você vai ver lá todo o contexto de custos que tu tá tendo e provavelmente vai estar lá vários MCPs e você vai ver o tanto de de tokens que você tá gastando só por esses MCPs estarem ligados, tá? Então, desligue isso, certo? Eh, faça essa higiene de ferramenta e você vai economizar mais seus tokens e ligue só quando você realmente for utilizar aquele MCP, tá bom?

Terceiro hack, a group prompts. O erro comum que as pessoas têm na hora de estar conversando com o Cloud é enviar as instruções mensagem por mensagem, tá? E faça isso aí. Ele vai lá e faz. Aí depois tu agora faça isso. Agora faça isso. Isso aqui tem uma correlação com esse problema que eu falei aqui dos custos tokens serem exponenciais, tá? Então, a cada mensagem que tu vai fazendo, ele vai fazer uma interação junto com as outras mensagens anteriores, sendo que se você já mandasse tudo junto, você iria desperdiçar menos tokens, tá? Então, só o fato de você, ao invés de estar mandando coisa por coisa, você mandar logo um contexto completo dentro das coisas que tu quer que ele faça, vai e eh gastar menos tokens, porque isso vai evitar o custo de histórico.

Hack 4, play mode, né? O modo de planejamento, cara. O modo de planejamento lá no Cloud Code, ele é um modo que vai fazer com que a IA ela planeje, ela pense mais antes de executar. Consequentemente, ele vai gastar bem mais tokens com esse modo ativo. E por gastar mais tokens, as pessoas geralmente não ativam ele. Não vou deixar no modo normal mesmo para economizar tokens. Sendo que muitas vezes isso vai gastar mais ainda. Por quê? Beleza? Você não vai, você vai gastar menos os tokens conversando diretamente, só que a chance dele acertar de cara o que você quer sem o modo planejamento é menor. A longo prazo, ele vai estar gastando muito mais tokens. Se você tivesse planejado, você teria gastado menos, que você já gastou muito poder de processamento, muitos tokens para planejar, depois é só executar. Então, planejar é economizar, tá? Então, sempre quando você for iniciar um projeto ou então você vai criar uma nova função, algo novo, ativa o modo play, né? Até porque a IA ela vai te fazer perguntas que às vezes você nem pensou naquelas possibilidades. E essas perguntas que ele vai fazer para você já vai até ajudar você a evitar que você tenha que se preocupar com isso depois na frente. Então, você vai estar economizando tokens por isso.

Hack do número cinco é usar sempre o cloud.md, tá? É um arquivo markdown que você deixa ali na raiz do seu projeto, né? Falta o ponto MD. E o recomendado é que você mantenha esse arquivo abaixo de 200 linhas, certo? Mas enfim, o que que é esse cloud.md, tá? O cloud.md, ele é um prompt para o seu, para sua IA, sendo que ele é o ponto de partida para tudo. Então, sempre antes da IA ela fazer alguma ação do seu projeto, ele ela vai ler o arquivo cloud.md. Então, nesse arquivo cloud.md, você vai explicar o que que é o projeto e você vai deixar lá todos os caminhos, né, todos os índices de caminhos do seu projeto, tá? Igual coloquei aqui, ó, trato como índice de caminhos. Ou seja, lá tu vai dizer que existe essa pasta X, a pasta Y, a pasta Z, que dentro da pasta X tem isso aqui, tem esse arquivo aqui. Ele vai explicar o que se trata desses arquivos. Se tem muito, se tem várias skills no projeto, você vai explicar no cloud.md o que cada skill faz. Por quê? Porque o Cloud ele vai abrir esse arquivo e já vai direto na página que ele quer mexer, já sabe exatamente o que precisa fazer. Sem o cloud.md, ele vai ficar lendo todos os arquivos do seu projeto, todos. Vai ler tudo, um por um, vai testando até saber o que realmente precisa fazer, tá? Então, você vai reduzir muito os tokens se você tiver ali um cloud.md. Isso aqui, cara, o próprio Cloud faz para você, tá? Você fez o projeto, pede pro Cloud, olha, eh, analise o projeto, cria um cloud.md para mim, ele vai criar. Aí você limpa o histórico e nas próximas conversas você vai perceber que vai estar gastando muito menos tokens.

E número seis, usar o barra compact de forma manual, tá? O compact, ele é uma coisa que já tem automaticamente no no Cloud, que é tipo assim, quando já tem muito contexto acumulado no chat e você quando ele passa 50%, tu consegue ver lá, né, que fica aparece a porcentagem, que é o tanto de contexto que aí ela vai conseguir acumular na conversa. E aí quando chega em 95% mais ou menos ali, ela faz uma compactação manual, fosse um resumo de toda aquela conversa, resumindo nos pontos importantes. E aí a ela vai se lembrar apenas a parte disso. Só que normalmente as pessoas fazem o quê? Deixa chegar no 95% para poder fazer o compact. Mas não faça isso. Chegou em 60%, usa essa regra. Chegou em 60%, você vai lá e já dá o barra compact de maneira manual e já faça essa compactação, tá? Isso vai preservar instruções críticas antes da degradação natural. Então, isso vai fazer com que você gaste mais tokens também, porque não precisa esperar chegar em 95%, tá? Já vai estar muita coisa já acumulada.

Hack número sete, você precisa entender as funções de cada modelo do Cloud e evitar. Cara, isso aqui é uma das coisas que mais gasta tokens. É, tem gente que, tipo, usa o Opus para coisas corriqueiras, tá? E isso gasta muito tokens. Porque vamos lá, pessoal. O Cloud ele tem três modelos, tem o Haiku, Sonet e o Opus, certo? Haiku, Haiku, enfim, vou falar Haiku, tá? Eh, que é o modelo mais barato e o mais rápido. O Sonet é o equilibrado, é o padrão, tá? Que ele serve para a maioria dos casos. E o Opus é o mais top que tem uns modelos aqui, é o mais poderoso do Cloud, tá? E consequentemente ele é mais lento e mais caro. Então, você tem que entender aqui quando usar cada modelo, certo? O Sonet você vai usar modo padrão, beleza? É, é o default, você vai usar de maneira padrão para fazer suas coisas. Só que se você quiser que o o Cloud ele mude, sei lá, uma linha no projeto, um arquivo MD, tu quer que ele faça algumas, executa um script, faça algumas ações no terminal, eh, automações rápidas, sabe? tipo tarefas repetitivas de baixo custo, cara, tu não precisa usar o Sonet para isso. Tu usa o Haiku, ele executa muito bem essas coisas, ele é velocidade e tem um ótimo custo-benefício, tá? Se eu não me engano, ele tem ali três vezes menos custo de tokens do que o Sonet. Então, olha só, tu vai conseguir usar muito mais, entendeu? E o Sonet você usa realmente para construir códigos, para ter um pensamento melhor, entendeu? a a parte de realmente pode ficar algo, né, de fazer ali um construir um script, tu vai usar ele. Ah, para executar o script que já está pronto, ah, eu vou construir um skill, usa o Sonet. Ah, eu quero que ele execute aquele script que faz parte daquele skill. Pode usar o Haiku para fazer isso, entendeu? Já o Opus, cara, raramente tu vai usar esse Opus aqui. Você só vai usar ele se você realmente quiser montar um planejamento muito complexo, com a estrutura muito grande, sabe? É um projeto assim de nível muito complexo que você percebeu que o seu não vai dar conta de planejar isso, sabe? Então, assim, é mais para isso. Aí ele vai planejar algo muito complexo. O Opus vai fazer isso muito bem. Aí depois tu pode mudar pro Sonet, pro Sonet e executar o planejamento do Opus, tá? Então, tu vê como a gente vai fazer esse jogo de modelos, isso vai economizar bastante tokens também, tá?

Último, mas não menos importante hack aqui dessa minha lista, que é evitar o pico de tráfego no Cloud, né? O que acontece, pessoal, que existe horários de pico onde tem muita gente ali acessando ao mesmo tempo, os servidores vão ficando mais lotados e consequentemente ele se torna mais caro de usar, tá? Eu trouxe aqui o horário, trazendo pro nosso horário aqui no Brasil, tá? Mais especificamente horário de Brasília, GMT-3, que é das 9 da manhã até às 15 horas. Esse horário é o horário de pico, é o horário que você vai mais gastar tokens, tá? Você vai perceber isso. Quer dizer que eu não devo trabalhar nesse horário? Eu preciso trabalhar, não, você trabalha. Se realmente tu precisa trabalhar nesse horário aqui, né? Então, tu vai trabalhar, beleza? Só que tu tem que entender que eh nesse horário aqui vai gastar mais. Então, se for, tu vai fazer alguma coisa muito mais complexa, espere eh fazer na tardinha, durante a noite, se tu puder fazer, tá? Eu realmente já percebi isso, que durante a noite ali barra madrugada eu consigo fazer muito mais coisas usando Cloud do que fazer durante o almoço, por exemplo. Certo?

Então, é isso, pessoal. Essas eram as dicas que eu queria trazer aqui para vocês. Espero que tenham gostado desse conteúdo que abriu sua mente, tá? Siga essas dicas, depois deixa aqui nos comentários o que que você achou e aproveite, já se inscreve aqui no canal e deixa o seu like. E se você usa o Antigraft e não usa o Cloud Code, ou você usa os dois, enfim, eu também tenho um vídeo sobre a economia de tokens falando lá sobre o Antigraft, beleza? Então, ó, vou deixar o vídeo aqui, acessa lá também, tá muito bom. Então, é isso, fico por aqui, se vejo os próximos vídeos. Valeu.