Transcription
Aprendi a construir agentes de IA para você. Passei centenas de horas construindo agentes de IA e, na verdade, administro um programa chamado Lonely Octopus, onde ensinamos às pessoas habilidades de IA e lhes damos a oportunidade de construir agentes de IA para empresas também. Então, neste vídeo, vou tentar destilar tudo o que aprendi para lhe dar um guia abrangente com estruturas e uma variedade de ferramentas diferentes para construir qualquer tipo de agente que você desejar. Seja você alguém que não sabe codificar e quer usar ferramentas sem código, ou se você é um engenheiro de software experiente procurando construir sua próxima startup de IA, também mostrarei exemplos reais de agentes de IA construídos usando diferentes ferramentas. Como de costume, haverá pequenas avaliações ao longo deste vídeo para ajudá-lo a reter as informações à medida que avançamos. Agora, sem mais delongas, vamos começar.
Uma parte deste vídeo é patrocinada pela HubSpot. Aqui está a estrutura exata do vídeo. Primeiro, vou apresentar os componentes cruciais que compõem um agente de IA. Falarei sobre o que são, algumas das ferramentas para cada categoria e como escolher qual ferramenta você deseja usar para cada categoria. Em seguida, vamos entrar nos detalhes e falar sobre alguns dos fluxos de trabalho de agentes comuns que as pessoas estão usando hoje. Também incluirei um curso intensivo sobre engenharia de prompts especificamente para agentes, porque o prompt é literalmente o que vai fazer ou quebrar seu agente. Em seguida, mostrarei exemplos completos de agentes de IA implementados usando ferramentas sem código e código completo. Mas qual é a utilidade de construir esses agentes de IA se eles não servem realmente a um propósito? É por isso que também abordarei como descobrir que tipos de agentes de IA, que tipo de startups ou negócios de IA você deve construir, bem como sugestões específicas habilitadas para tecnologia sobre o que construir. O progresso feito em agentes de voz, vídeo e imagem possibilitou muitos casos de uso interessantes. Os agentes estão chegando. Agentes, olá, pessoal.
Vamos primeiro definir o que é um agente de IA. Um agente de IA é um sistema que percebe seu ambiente, processa informações e toma ações autonomamente para atingir objetivos específicos. Agora, de uma perspectiva mais humana, muitas vezes tendemos a pensar nos agentes de IA como uma contraparte de IA para um papel humano ou uma tarefa que um humano executa. É por isso que você frequentemente ouve falar de agentes de IA no contexto de um agente de IA de codificação como Cursor ou Windsurf, que são editores de código alimentados por IA que possuem um modo de agente que pode realizar tarefas de codificação autonomamente, seja com Claude Sonnet 3.7 ou Gemini 2.5 Pro. Outro caso de uso muito comum de agentes de IA são os chatbots de atendimento ao cliente. Muitas empresas estão agora experimentando agentes de atendimento ao cliente que são capazes de fazer coisas como lidar com consultas, comunicar-se com o cliente, registrar uma reclamação para eles ou resolver problemas específicos.
Agora, esta é a definição e a experiência de um agente de IA. Mas quando se trata de implementação, existem, na verdade, muitas maneiras diferentes de implementar esses agentes, e há muitas nuances nisso. Vou lhe dar uma pequena prévia do que quero dizer com isso. Agora, entrarei em muito mais detalhes sobre isso quando abordar a implementação exata de diferentes agentes. Mas, por enquanto, quero apenas que você observe que, quando dizemos "agente de IA", não estamos apenas falando de, sabe, uma IA sentada lá fazendo suas coisas de agente de IA sozinha. Muitas vezes, são vários subagentes que fazem coisas específicas e, em última análise, se unem em sistemas multiagentes para formar o que percebemos como o agente completo real.
Por exemplo, uma implementação clássica de um agente de atendimento ao cliente é frequentemente dividida em primeiro um subagente que lida com as consultas do cliente, como interage com o cliente, descobre qual é o problema e, em seguida, o marca para ser passado a um subagente mais especializado, como, por exemplo, meu recente problema de pagamento de fatura de telefone. Isso seria marcado como um problema de faturamento e pagamentos e passado para outro subagente que será especializado em lidar com faturamento e pagamentos. Também haveria outros subagentes especializados em TI e vendas e outras coisas que o atendimento ao cliente em empresas de telefonia faz. A propósito, esse tipo de fluxo de trabalho de agente é chamado de roteamento e provou ser muito, muito eficaz para esse tipo de problema.
De qualquer forma, entraremos em mais detalhes sobre roteamento e outros tipos de fluxos de trabalho de agentes em breve. Mas sim, espero que isso lhe dê um pouco de compreensão sobre como os agentes realmente funcionam por baixo do capô, o que é muito importante saber ao construí-los. Além disso, apenas para responder a esta pergunta, na qual você pode estar pensando, por que temos que ter esses sistemas multiagentes, esses diferentes tipos de implementações? E a razão para isso é, na verdade, bastante intuitiva. Se você pensar em agentes da mesma forma que pensa em humanos em uma empresa, os humanos têm diferentes papéis. Você não tem apenas um humano tentando fazer tudo ao mesmo tempo. Esse humano ficará muito confuso e não será capaz de priorizar o que deve fazer e não será muito bom em nenhuma coisa específica. E é o mesmo para agentes. Quando temos diferentes agentes especializados em diferentes coisas, os resultados de tudo isso se unindo serão muito melhores do que ter apenas um único agente de IA tentando fazer tudo.
Certo, então agora quero dar um passo atrás e lhe dar uma estrutura para entender os componentes dos agentes de IA. É como se você estivesse fazendo um hambúrguer, um hambúrguer é feito de diferentes componentes. Há um pão, um hambúrguer, vegetais e condimentos. Você pode trocar o tipo de pão, o tipo de vegetais, o tipo de hambúrguer e o tipo de condimentos. Mas você precisa ter todos esses componentes para que seu hambúrguer funcione como um hambúrguer, em vez de um sanduíche estranho ou um cachorro-quente. O mesmo para agentes. Existem diferentes componentes e você pode trocar os diferentes componentes por coisas diferentes, mas, em última análise, você precisa ter esses componentes para que seja um agente.
Agora, ao contrário dos componentes de um hambúrguer que foram estabelecidos há muito tempo, os componentes que compõem um agente de IA ainda são relativamente novos. Então, as pessoas meio que têm definições diferentes e variadas, mas a mais abrangente e bem definida vem da OpenAI. Como eles explicam, a construção de agentes envolve a montagem de componentes em vários domínios, como modelos, ferramentas, conhecimento e memória, áudio e fala, guardrails e orquestração. E a OpenAI fornece primitivas composíveis para cada um. Sim, você sabe, obviamente a OpenAI vai listar suas próprias coisas primeiro, mas para cada um desses componentes, existem, na verdade, muitas outras ferramentas disponíveis também. Dependendo do tipo de agente que você deseja construir, alguns são melhores que outros. E entrarei em mais detalhes sobre cada um desses componentes.
Mas primeiro, quero apenas fazer uma observação de que, se você se sentir super sobrecarregado porque há uma nova ferramenta ou nova tecnologia surgindo a cada dia, não entre em pânico. Não se sinta sobrecarregado. Está tudo bem porque, seja qual for essa nova inovação ou ferramenta que está revolucionando os agentes de IA, apenas perceba que ela ainda fará parte desta estrutura. É como um novo tipo de condimento na categoria de condimentos que por acaso é um pouco mais picante ou algo assim. Espero que isso faça sentido. Espero que você entenda o que quero dizer com isso. De qualquer forma, vamos agora realmente passar para cada um desses diferentes componentes.
A OpenAI tem esta pequena e prática tabela. Então, primeiro você tem o componente de modelos. Estes são seus modelos de IA, seus grandes modelos de linguagem que são a inteligência central capaz de raciocinar, tomar decisões e processar diferentes modalidades. Claro, os exemplos que a OpenAI nos dá são o 01, 03 mini, GPD 4.5, GPD 40, etc. Agora, dependendo do tipo específico de agente que você está construindo, você vai querer escolher um tipo diferente de modelo dentro do ecossistema da OpenAI. O GPD 40 é o seu modelo principal. É um modelo de pensamento que é realmente ótimo em raciocínio, resolução de problemas em várias etapas e tomada de decisões complexas, ótimo para responder à maioria das perguntas. Agora, se você quer algo mais intensivo, a desvantagem é que será mais lento e mais caro. Você tem o GPT 4.5. É bom para escrever e explorar novas ideias, você também tem o 03 mini que possui recursos avançados de raciocínio, mas também é mais rápido. E o 03 Mini High que é particularmente bom para codificação e lógica. Fora do ecossistema da OpenAI, o Claude 3.7 Sonnet é geralmente o modelo preferido para pessoas que fazem muita codificação, raciocínio e coisas baseadas em assuntos STEM. Embora o Gemini 2.5 Pro esteja desafiando isso agora, mas honestamente, em um mês ou quando quer que você assista a este vídeo, provavelmente os rankings já terão mudado de qualquer forma. Mas, de modo geral, se você se importa mais com o custo, então provavelmente vai querer usar um modelo de código aberto e hospedá-lo você mesmo. E se você quer que as coisas sejam rápidas, você vai querer usar modelos menores. E a maioria dos modelos do Google, pelo menos no momento desta filmagem, também possui janelas de contexto mais longas, se você se importa muito em manter uma janela de contexto alta. De qualquer forma, existem muitos sites por aí que realmente classificam o desempenho desses diferentes modelos, como o Vim, por exemplo. Não sei se é assim que se pronuncia, Vellum. Então, dependendo do seu caso de uso, você pode realmente verificar os rankings e ver qual modelo melhor se adapta às suas necessidades.
Em seguida, está a categoria de ferramentas. Agora, não subestime a importância das ferramentas. Seu modelo é simplesmente seu modelo base. Mas o que realmente começa a tornar os modelos poderosos é adicionar diferentes capacidades, como a capacidade de usar ferramentas. As ferramentas permitem que os agentes interajam com o mundo. Como ser capaz de pesquisar na web, por exemplo, e todos os diferentes aplicativos que você vê por aí, estes podem potencialmente ser transformados em ferramentas para a IA. Como você pode dar a ele acesso a produtos do Google como seu Gmail, seu calendário. Você pode dar a ele acesso às coisas que estão em seu disco rígido. Você pode dar a ele acesso ao que está acontecendo em sua tela. Você pode dar a ele acesso aos seus aplicativos favoritos como Slack ou Discord, YouTube, Salesforce, Zapier, o que for. Você também pode construir suas próprias ferramentas personalizadas que pode dar ao agente de IA também.
Se você usar o SDK de agentes da OpenAI, uh, você precisa saber como codificar para poder usá-lo. Eles lhe dão a capacidade de definir suas próprias ferramentas, bem como algumas ferramentas integradas, como pesquisa na web, pesquisa de arquivos e uso do computador. Você também pode ter ouvido falar de algo chamado MCP, que está meio que em alta hoje em dia e foi construído pela Anthropic. Significa protocolo de contexto de modelo e é um protocolo que padroniza a forma como você pode fornecer coisas como ferramentas ao seu grande modelo de linguagem. Isso é um grande avanço porque, anteriormente, era bastante difícil para os desenvolvedores fornecerem a seus agentes diferentes ferramentas, pois diferentes softwares configuram seus serviços de maneiras diferentes. Então, como desenvolvedor, você meio que tinha que descobrir e juntar as peças. Mas, basicamente, o MCP tornou tudo muito mais fácil. Agora, não se preocupe se você não é uma pessoa de código. Também existem muitas ferramentas sem código ou de baixo código que possuem embutida a capacidade de você fornecer ferramentas aos seus modelos. Alguns dos exemplos que mostrarei mais tarde, como o N8N, por exemplo, permitem que você arraste e solte diferentes ferramentas e as conecte aos seus grandes modelos de linguagem com muita facilidade. Por exemplo, se você estiver tentando construir um agente de pesquisa de mercado, ele precisaria ter uma ferramenta para poder pesquisar na internet, uma ferramenta para poder analisar os dados que coleta. E talvez se você quisesse enviar um relatório por e-mail para você, também precisaria de uma ferramenta para poder acessar seu e-mail.
Agora, passando para conhecimento e memória. Então, existem dois tipos diferentes. O primeiro é chamado de base de conhecimento ou memória estática. Isso permite que você forneça ao seu modelo de IA fatos estáticos, políticas, documentos, apenas informações que ele pode referenciar e acessar e que permanecem relativamente estáticas ao longo do tempo. Isso é importante se você estiver construindo algo como um agente de IA que realiza tarefas legais. Ele pode precisar ter documentos legais específicos para um caso particular para uma empresa particular e talvez certas políticas que sejam relevantes para essa empresa específica também. O outro tipo de memória é a memória persistente. Então, esta é uma memória que permitirá que um agente de IA rastreie históricos de conversas ou interações do usuário além de uma única sessão. Isso é realmente importante para muitos casos de uso de chatbots, como, por exemplo, se você tiver um assistente pessoal de IA, você quer ter certeza de que o assistente pessoal ainda se lembrará do que aconteceu, tipo, ontem.
Novamente, a OpenAI fornece seus próprios serviços hospedados, como armazenamentos de vetores, pesquisa de arquivos e embeddings. Também existem versões de código aberto disso, onde você pode hospedar seus próprios bancos de dados e, em seguida, também pode realizar diferentes maneiras de fazer RAG, que é a geração aumentada por recuperação. Não vou entrar em muitos detalhes sobre isso. Mas algumas soluções que as pessoas procuram seriam Pinecone, que é nativo da nuvem e otimizado para pesquisa de vetores, ou Weaviate, que é de código aberto. Novamente, se você está mais inclinado a uma solução sem código, você realmente não precisa se preocupar com isso, pois geralmente já é cuidado por essa solução. Como o N8N, por exemplo, já permite que você lide com isso sem ter que descobrir todas as coisas complexas de código.
Em seguida, está áudio e fala. Então, é bastante interessante porque a OpenAI divide isso em sua própria categoria separada, enquanto muitos outros tipos de frameworks não incluem este especificamente. E acho que a razão pela qual eles fazem isso é porque houve inovações tão grandes recentemente em formatos de áudio. Mas, basicamente, dar ao seu agente a capacidade de ter áudio e fala permite que ele interaja com a linguagem natural. Isso é realmente importante para agentes de IA de chatbot, porque ter a capacidade de se comunicar diretamente usando linguagem natural pode ser uma experiência de usuário muito melhor. Dentro do ecossistema da OpenAI, eles têm suas próprias maneiras de implementar isso. Enquanto fora desse ecossistema, o que as pessoas parecem usar muito, pelo menos agora, é o 11 Labs, que é usado para clonagem e geração de voz. Ah, e para transcrição de áudio, como áudio para texto, as pessoas realmente usam o Whisper, que é um modelo de IA aberto. Atualmente, como eu disse, essas coisas mudam muito. É mais importante que você entenda o tipo de categoria geral, o componente geral, em oposição às ferramentas específicas dentro dele.
O próximo componente são os guardrails. Então, os guardrails são realmente importantes para prevenir comportamentos irrelevantes, prejudiciais ou indesejáveis. Você sabe, depois de criar este agente, você precisa ter certeza de que ele está realmente fazendo o que deveria fazer e não fazendo outra coisa. Se você tem um agente de atendimento ao cliente, você quer ter certeza de que ele está, de fato, falando sobre coisas de atendimento ao cliente e não lhe dando haicais ou algo assim. Fora do ecossistema da OpenAI, o que é popular agora são os guardrails de IA e os guardrails de LangChain. Honestamente, existem muitas opções diferentes nesta categoria. Mas, novamente, se você está usando ferramentas sem código, acho importante que você entenda esta categoria, este componente, mas muitas ferramentas sem código já têm soluções integradas em sua plataforma.
Finalmente, há a orquestração. E isso é algo super negligenciado. Lembre-se de como estávamos falando sobre diferentes subagentes, como você encadeia diferentes subagentes para chegar a um resultado final para algo. Também envolve a implantação, para que ele possa fazer suas coisas em produção, monitorá-lo e melhorar o agente. Tipo, depois de implantar o agente, você não simplesmente foge e depois não o olha mais, certo? Como, com o tempo, os modelos continuam mudando. Muitos dos pensamentos dessas tecnologias também mudam, assim como os dados continuam mudando. Então você precisa continuar monitorando e garantindo que seu agente esteja se comportando da maneira que deveria se comportar. Também existem muitas ferramentas diferentes nesta categoria. Muitas vezes, geralmente há uma estrutura e, em seguida, a parte de orquestração é incorporada a essa estrutura. Como a OpenAI tem seu próprio sistema. Há também o CrewAI, que é outra estrutura para implementar sistemas multiagentes. Ele também tem seu próprio tipo de sistema para orquestrar e, finalmente, implantá-lo. LangChain também é muito popular para gerenciar diferentes interações de agentes e implantá-lo, assim como o LlamaIndex, que é particularmente útil se você estiver criando um agente de IA que tem muito a ver com documentos e memória estática e bases de conhecimento.
Aqui também está um pequeno mnemônico para você se lembrar dos diferentes componentes que compõem um agente de IA, o que será imediatamente útil porque agora faremos nossa primeira pequena avaliação. Vou colocar na tela algumas das perguntas. Comente abaixo suas respostas para ter certeza de que você reteve todas as informações que abordamos.
Ok, então este é um guia muito prático para construir agentes de IA. A HubSpot nos oferece um guia gratuito muito prático para construir agentes de IA de uma perspectiva de negócios. Acho que este recurso gratuito é um ótimo complemento para tudo o que estamos abordando hoje, porque ele aprofunda em como agora pegar esses agentes de IA e garantir que eles impulsionem o máximo sucesso nos negócios. O playbook explica como os agentes de IA estão sendo usados em empresas hoje, com exemplos reais e casos de uso, armadilhas comuns, e também discute o futuro do trabalho. Ele inclui uma lista de verificação que ajuda sua organização a pensar em cada fase da implementação de agentes de IA, desde a identificação das oportunidades de maior retorno sobre o investimento até a definição de métricas de sucesso, bem como integração e escalonamento. Eu recomendo fortemente que você confira neste link aqui, também linkado na descrição. Muito obrigado, HubSpot, por criar esses recursos práticos gratuitos e por patrocinar esta parte do vídeo. Agora, de volta ao vídeo.
Certo, agora que conhecemos os componentes que compõem os agentes de IA, vamos passar para as implementações. Se você se lembra do que eu disse um pouco antes, os agentes de IA muitas vezes não são apenas uma entidade singular. Eles são, na verdade, divididos em diferentes subagentes que interagem entre si. Meu recurso favorito que aborda esses fluxos de trabalho e sistemas de agentes comuns é o guia "Building Effective Agents" da Anthropic. Então, vamos passar por ele primeiro.
Em primeiro lugar, você tem o bloco de construção básico dos sistemas de agentes. Isso é o que a Anthropic chama de LLM aumentado. Nesta imagem, você pode ver que há uma entrada, o LLM e a saída. O LLM aumentado é capaz de gerar suas próprias consultas de pesquisa, selecionar ferramentas apropriadas e determinar quais informações precisam ser retidas através da memória. Se você estava prestando atenção antes, verá que há sobreposições entre os componentes neste LLM aumentado e os componentes da OpenAI. Esta versão é um pouco mais básica, como não aborda coisas como guardrails ou orquestração, mas você pode ver que há definitivamente uma sobreposição. Tudo bem. Quando se trata de coisas como testes e implantação, apenas lembre-se dos componentes da OpenAI para essas coisas específicas. Apenas para sua informação, em termos, esses blocos de construção de LLM aumentados são frequentemente chamados de subagentes também.
Então, agora vamos realmente ver como esses blocos de construção, esses subagentes, se encaixam e trabalham uns com os outros para formar seu agente de IA maior. Começaremos com os fluxos de trabalho de agentes mais simples até os mais complexos e verdadeiramente autônomos.
Certo, então o fluxo de trabalho de agente comum mais simples é chamado de encadeamento de prompts. O encadeamento de prompts decompõe uma tarefa em uma sequência de etapas onde cada subagente processa a saída do anterior. Em sua forma mais simples, isso é como uma linha de montagem, mas você também pode adicionar pequenas portas onde pode dividi-lo em coisas diferentes, mas a lógica é a mesma. Você terá uma entrada, um subagente faz algo com essa entrada, passa para outro subagente que faz outra coisa, e talvez para outro, etc., etc., até que você finalmente obtenha uma saída. Esse tipo de implementação é o mais ideal para situações em que a tarefa pode ser facilmente dividida em subtarefas e decomposta.
Um exemplo de quando o encadeamento de prompts pode ser útil é se você quiser que seu agente de IA gere um relatório. A entrada poderia ser a descrição do que o usuário deseja e então o subagente pegaria isso, talvez geraria um esboço, passaria para outro subagente que poderia verificar o esboço quanto a critérios específicos e então passaria para um subagente escritor que realmente escreveria o relatório e então talvez para um subagente editor que realmente editaria o relatório. E a saída final seria o relatório que segue os critérios especificados.
O roteamento é outro tipo de fluxo de trabalho onde você teria uma entrada chegando e um subagente dedicado a direcionar essa entrada específica para uma tarefa de acompanhamento específica. E cada uma dessas tarefas é governada por um subagente específico para essa tarefa. Então, finalmente, você obtém a saída após o processamento. O roteamento funciona muito bem para tarefas complexas onde existem categorias distintas que são melhor tratadas separadamente. Um exemplo clássico de quando o roteamento é útil é se você tem um bot de atendimento ao cliente. Você tem um bot de atendimento ao cliente que receberá diferentes tipos de consultas, como perguntas gerais, solicitações de reembolso, suporte técnico, o que quer que as pessoas perguntem ao atendimento ao cliente. Com base na natureza da consulta, o primeiro subagente deve ser capaz de rotear a tarefa mais relevante para o subagente especializado nessa tarefa. Como se for uma solicitação de reembolso, então seria roteado para o subagente especialista em reembolsos. Como se for uma consulta de suporte técnico, então seria roteado para o subagente de IA que é especialista em lidar com perguntas de suporte técnico.
Outro caso de uso comum é rotear diferentes perguntas para diferentes tipos de modelos. Alguns modelos são melhores em fazer certas coisas do que outros. Como se for uma pergunta difícil relacionada a STEM, você pode estar roteando-a para Claude Sonnet 3.7. Ou se for uma pergunta fácil onde você valoriza a velocidade, você pode estar roteando-a para Gemini Flash.
O próximo fluxo de trabalho é a paralelização. Paraleliza... Oh Deus, não consigo pronunciar isso. O fluxo de trabalho de agente específico geralmente tem duas variações principais. Isso é quando você tem subagentes que estão trabalhando simultaneamente em uma tarefa e, em seguida, têm todas as suas saídas agregadas. A primeira é a seccionamento, que é dividir uma tarefa em subtarefas independentes que são executadas em paralelo, ou a votação, que é executar a mesma tarefa várias vezes usando diferentes subagentes para obter diferentes saídas diversas que você agrega.
Um exemplo de seccionamento é se você está tentando avaliar o quão bom é o desempenho de um novo modelo para um determinado prompt. Cada subagente poderia estar avaliando um aspecto diferente do desempenho do modelo. Como um deles poderia estar avaliando a velocidade e outro a precisão, etc., etc. Um exemplo de votação é revisar um pedaço de código em busca de vulnerabilidades. Você tem diferentes subagentes que estão avaliando o código e, em última análise, você os agrega para votar e decidir se isso é, de fato, uma vulnerabilidade ou não.
O próximo fluxo de trabalho, e estamos ficando cada vez mais complexos, são os trabalhadores orquestradores. O trabalhador orquestrador na verdade parece bastante semelhante à paralelização, mas o que é diferente nele é que você não tem uma lista predeterminada de subtarefas que serão realizadas. Então, isso é especialmente útil para problemas mais complexos, onde você não pode prever exatamente quais subtarefas serão necessárias no final. Como, por exemplo, se você está construindo agentes que envolvem codificação, muitas vezes você não sabe o número exato de arquivos que precisam ser alterados e a natureza exata da própria alteração. Então você precisa estar fazendo alterações dinamicamente em vários arquivos diferentes. Outro exemplo são as tarefas de pesquisa. Como se você tiver um agente assistente de pesquisa, isso envolveria a coleta e análise de muitos tipos diferentes de informações de muitas fontes diferentes que não podem ser predeterminadas com antecedência.
Ainda mais complexo é o fluxo de trabalho otimizador avaliador. Isso se aproxima de situações mais autônomas, onde você está dando ao subagente, ao agente de IA, muito mais autonomia e liberdade para determinar o que ele deve fazer. Você tem algum tipo de entrada e o primeiro subagente geraria uma solução baseada nisso e a passaria para um subagente avaliador. O subagente avaliador a avaliaria e, se fosse aceita, essa seria a saída. Ou, se sentir que não é bom o suficiente, o enviaria de volta ao primeiro subagente, dizendo que foi rejeitado e com algum feedback para melhorar. E isso é como um loop circular que você continuaria fazendo até que o subagente avaliador achasse que a solução é boa o suficiente e a passasse para a saída.
Este fluxo de trabalho é particularmente útil se houver um critério de avaliação claro e quando você pode ver refinamento e melhoria iterativos ao longo do tempo. Um exemplo onde o fluxo de trabalho otimizador avaliador é útil é se, digamos, você está fazendo algum tipo de tradução literária para algo. Pode haver nuances que o subagente tradutor não consegue capturar na primeira vez. Então, o subagente avaliador estaria enviando feedback e dizendo para continuar fazendo até que ele seja capaz de capturar todas as nuances na linguagem. Outro exemplo é se você está tendo uma tarefa de pesquisa complexa que está tentando agregar em alguma forma de relatório final. Você pode estar fazendo pesquisa e o subagente avaliador diria que a pesquisa não é profunda o suficiente, é como continuar fazendo isso, continuar fazendo, continuar fazendo até que você seja capaz de reunir todas as informações necessárias que ele sente que é capaz de capturar, sabe, seu relatório super complexo completamente.
E finalmente temos a implementação de agente verdadeiramente autônomo. Então, este é complicado porque é, na verdade, o mais simples em termos de implementação, mas pode resultar em tipos muito diferentes e soluções potencialmente muito complexas. O agente começará seu trabalho com alguma forma de interação humana. E uma vez que essa tarefa esteja clara, o agente será completamente independente. Ele realizará algum tipo de ação ou ações que terão alguma forma de reação ao ambiente. E o agente tem que, de alguma forma, descobrir por si mesmo, a partir do ambiente, o que é considerado o resultado do que ele está fazendo. Como, por exemplo, se ele decidir usar uma ferramenta onde decide executar algum código, ele precisa descobrir por si mesmo se está progredindo em direção à conclusão final da tarefa ou não, e continuará fazendo isso, obtendo o feedback do ambiente, julgando como está progredindo até que, finalmente, sinta que concluiu a tarefa que lhe foi atribuída.
Esse tipo de implementação, o tipo de implementação de agente que dá muita liberdade autônoma, é geralmente usado para problemas muito abertos, onde é muito difícil prever o número de etapas que ele deve seguir ou o caminho exato para chegar ao resultado final. Você está basicamente apenas dizendo a um agente, ei, tipo, faça isso e ele meio que tem que descobrir por si mesmo como fazer a coisa, como quais são as tarefas envolvidas, se está progredindo ou não em direção à coisa e, em algum momento, decidindo que, de fato, concluiu a coisa e volta para você.
Você pode obter resultados realmente incrivelmente bons com isso, mas às vezes, muitas vezes, você também obtém alguns resultados realmente loucos em geral que podem vir disso. Alguns exemplos do artigo da Anthropic incluem um agente de codificação capaz de resolver diferentes tarefas de bancada de engenharia de software, o que envolve a edição de muitos arquivos diferentes em uma descrição de tarefa ou sua implementação de uso de computador, onde Claude foi capaz de usar um computador e ter acesso a todas as diferentes funcionalidades desta máquina de computador muito complexa para realizar tarefas específicas.
Aqui está um diagrama que ilustra o caminho que um agente de IA de codificação percorreu para completar sua tarefa. Você pode ver que há muitas interações de ida e volta em ambientes, voltando e refinando e tudo mais, antes de retornar a um humano.
Como o artigo sugere, esse tipo de implementação verdadeiramente autônoma não é algo que você geralmente deseja fazer, porque na maioria das situações, você pode realmente optar por um fluxo de trabalho de agente mais predeterminado e ele produziria resultados mais previsíveis e seria muito mais barato. Este artigo continua dizendo repetidamente que você deve sempre optar pela implementação mais simples possível. Como se você puder atingir seus objetivos de agente de IA através do encadeamento de prompts ou roteamento, não faça coisas mais complexas. Apenas uma regra geral quando você está construindo seus agentes de IA e, na verdade, apenas engenharia e construção de coisas em geral. Não superengenheire.
Ok, então cobrimos todos os diferentes fluxos de trabalho. Agora, quero primeiro fazer um pequeno curso intensivo sobre engenharia de prompts para agentes de IA, de uma perspectiva prática para esses agentes de IA. A engenharia de prompts, os prompts importam muito. É realmente o que mantém tudo junto. Como você pode ter seus agentes e ele tem todas essas ferramentas e acesso a todas essas coisas realmente legais, mas se você não tiver um bom prompt, você não consegue juntar tudo isso. É por isso que vou enfatizar esta parte.
Quando você está criando um prompt para um agente de IA, você precisa ter o prompt completo, tudo ali. Como você não pode corrigi-lo interativamente e adicionar mais informações ao longo do processo. Então, há seis componentes que você deve considerar incluir no prompt do seu agente de IA. A primeira coisa a especificar é o papel. Então, é aqui que você diz a ele que é um assistente de pesquisa de IA, mas você também quer incluir coisas como o tom e como ele deve se comportar. Então, por exemplo, você poderia escrever: "Você é um assistente de pesquisa de IA encarregado de resumir as últimas notícias em inteligência artificial. Seu estilo é sucinto, direto e focado em informações essenciais".
Em seguida, está uma tarefa e você pode escrever: "Dado um termo de pesquisa relacionado a notícias de IA, produza um resumo conciso dos pontos-chave". Então temos a entrada. É aqui que você pode especificar o que o assistente de pesquisa de IA estará recebendo. Neste caso, você pode simplesmente escrever que a entrada é um termo de pesquisa especificado relacionado à IA fornecido pelo usuário. Mas você pode imaginar que poderia haver outras entradas que o assistente de pesquisa de IA poderia estar recebendo, como certos gráficos e diferentes documentos. Você quer especificar e deixar o assistente de IA saber exatamente o que ele estará recebendo.
Quarto é a saída. É aqui que você quer entrar em detalhes sobre o que você quer que o assistente de pesquisa de IA produza. Como deve ser a aparência final? Qual é o produto final? Neste caso, você pode escrever: "Forneça apenas um resumo sucinto e denso em informações, capturando a essência das notícias recentes relacionadas à IA relevantes para o termo de pesquisa. O resumo deve ser conciso. Aproximadamente dois a três parágrafos curtos, totalizando não mais de 300 palavras". Ele sabe exatamente o que deve produzir.
Agora, o quinto passo da estrutura é a restrição. Esta é uma parte realmente, realmente, realmente importante que você deseja incluir em seu prompt. Não apenas o que ele deve fazer, mas também o que ele não deve fazer. Você poderia escrever: "Concentre-se em capturar o ponto principal de forma sucinta. Frases completas e gramática perfeita não são necessárias. Ignore o excesso de informações, informações de fundo e comentários. Não inclua sua própria análise ou opiniões. Não nos importamos com os agentes de IA. Queremos apenas focar nos fatos". Finalmente, você tem capacidades e lembretes. É aqui que você quer dizer à IA o que ela tem acesso, como certas ferramentas que ela pode ter, bem como fornecer lembretes para coisas que ela deve realmente, realmente, realmente manter em mente, coisas que são realmente importantes. Neste exemplo, demos ao agente de IA a capacidade de fazer pesquisa na web. Então, podemos dizer a ele: "Você tem acesso à ferramenta de pesquisa na web para encontrar e recuperar artigos de notícias recentes relevantes para o termo de pesquisa". Além disso, queremos lembrá-lo de que ele precisa estar muito ciente da data atual. Um problema comum que muitos LLMs têm é que eles não estão realmente cientes de qual data ou hora é atualmente. Então, como estamos interessados apenas em pesquisar coisas que são relevantes agora, queremos ter certeza de que ele está ciente de que horas são e qual é a janela de pesquisa. Então, podemos escrever: "Você deve estar profundamente ciente da data atual para garantir a relevância das notícias, resumindo apenas informações publicadas nos últimos sete dias". Uma dica geral é que, quanto mais importante algo for, mais para baixo no prompt você deve lembrá-lo. É apenas a maneira como a IA é capaz de processar essa informação. Ela tem um viés para as coisas mais recentes primeiro.
Esse foi o curso intensivo sobre engenharia de prompts para agentes de IA. Espero que vocês também não estejam bravos comigo por fazerem vocês realmente aprenderem os fundamentos primeiro, porque eu percebo que muitas pessoas que estão fazendo "vibe coding" hoje em dia e que não conhecem os fundamentos, acabam, sabe, construindo algo que simplesmente não é tão bom. É meio que assim, ou se é algo que você quer ajustar um pouco, você acaba, sabe, cometendo muitos erros estúpidos porque não entende os fundamentos. Então, agora você está equipado com as informações para realmente ir construir algo com o conhecimento e a confiança de que é, de fato, a melhor implementação para fazê-lo.
Aqui está agora. Agora, um pequeno quiz que vou colocar na tela. Por favor, responda a estas perguntas na seção de comentários para ter certeza de que você está retendo todas essas informações que estou apresentando.
Agora, na próxima seção, vou mostrar as implementações reais de agentes de IA. Incluí alguns exemplos sem código e de baixo código, bem como exemplos totalmente codificados. Então, deve haver algo para todos aqui.
Este é um agente de IA de suporte ao cliente e o implementamos usando N8N. Então, este era o N8N. É uma plataforma. É uma plataforma sem código, de baixo código, super fácil de usar que você pode usar para criar diferentes agentes de IA. Neste caso, implementamos este agente de IA usando um sistema multiagente que segue o padrão de roteamento de agente que discutimos anteriormente. A forma como funciona é que um cliente enviará uma consulta por e-mail e, em seguida, temos um classificador de texto que é alimentado, neste caso, por um modelo de IA aberto que é capaz de rotear a consulta como suporte técnico, faturamento ou consulta geral. E cada um deles tem seus próprios fluxos de trabalho específicos depois disso.
Vamos ver como funciona, na verdade. Vamos para o meu e-mail aqui e vou escrever um e-mail para o suporte ao cliente. Este caso vai para cloud@lontopus.com. Vou dizer "reembolso" porque estou com raiva. "Olá, quero um reembolso." Sim. Clique em enviar. Você pode ver que os e-mails estão aqui. Ele classifica como uma situação de faturamento. Temos o agente de IA e o agente de IA é capaz de usar o e-mail para responder à consulta. E se verificarmos nosso e-mail novamente, vimos que o agente nos respondeu. "Olá, obrigado por entrar em contato sobre uma solicitação de reembolso para ajudá-lo de forma eficaz." Blá blá blá, sabe, dê todas essas informações e então você pode enviar essas informações para o agente para que ele processe seu reembolso.
Se for classificado como suporte técnico, ele também tem este fluxo de trabalho. Se ele decidir que pode responder à sua pergunta de suporte técnico diretamente usando a documentação, ele também pode enviar a resposta por e-mail diretamente para você. Mas aqui também temos uma opção onde, se eles não conseguirem descobrir como apoiá-lo de uma perspectiva de suporte técnico, ele realmente escalaria isso e enviaria no Discord assim: "Olá equipe, o cliente precisa de ajuda. Por favor, investiguem mais a fundo. O ID do e-mail é este ID aqui". Então, um agente real seria capaz de intervir e começar a ajudar o cliente neste caso. Realmente importante ter isso aqui porque você sempre quer ter alguma forma em seu agente de IA de poder escalar para um humano real. E, claro, se for uma consulta geral, ele rotearia para este ramo aqui, e então enviaria um e-mail geral solicitando informações adicionais.
Este é outro agente de IA. É um agente agregador de notícias de IA. A forma como funciona é que ele é agendado para as 7:00 da manhã todos os dias, e vai coletar informações, coletar notícias de diferentes newsletters, bem como do Reddit. Então, ele agregará todas essas informações e, finalmente, criará um resumo que me enviará no WhatsApp. Este é um exemplo de um padrão de fluxo de trabalho de paralelização. Então, não são 7 da manhã, mas vou apenas acionar o fluxo de trabalho agora e deixá-lo fazer sua coisa. Ele vai estar executando tudo por aqui. Então, quero realmente fazer uma observação de que, embora seja um fluxo de trabalho de paralelização, a limitação do N8N é que ele ainda executa sequencialmente. Se você implementar isso usando uma ferramenta codificada como o SDK de agentes da OpenAI, por exemplo, do qual mostrarei um exemplo em breve, ele realmente seria executado em paralelo. Mas sim, neste caso, apenas para que você saiba, tecnicamente é paralelização, mas ele não consegue fazer isso devido às próprias limitações da plataforma.
Ok. Então, depois de rodar, ele vai me enviar uma notificação no WhatsApp onde me dá informações agregadas de todas as diferentes fontes de notícias. Então, a OpenAI lança GP5 alpha, ética de IA, ética de IA do Google, desenvolvimentos regulatórios, blá blá blá, como todas essas coisas diferentes que estão acontecendo por aqui. E no prompt eu especifiquei para garantir que ele cite as fontes. Então, se eu quisesse realmente entrar e aprender mais sobre cada um desses diferentes relatórios de notícias, eu poderia simplesmente clicar e ser capaz de ver a fonte real em si. Este é, na verdade, um agente de IA muito útil para ter, porque neste prompt aqui, você pode ver que eu posso especificar exatamente o que me interessa, como um termo de pesquisa relacionado à IA fornecido pela newsletter, por exemplo, certo? Onde, tipo, o que quer que eu queira, como quero que seja resumido, como quero que tudo seja agregado. Então, é uma ferramenta muito útil. Acho que seria muito útil para você também, se você é alguém que também tem que passar por muitas informações todos os dias.
Último exemplo de N8N. Este é um agente de IA de rastreamento de despesas diárias com múltiplas entradas. Isso é um bocado. Então, a forma como funciona é que você interage com ele usando o WhatsApp. Você pode enviar fotos ou recibos de tudo o que gastou. Você pode enviar texto também. Como se você gastar, tipo, $10, você pode dizer a ele que gastou $10 também. Ele é capaz de pegar todas essas informações e, em última análise, agregar tudo para lhe dar um relatório final de acompanhamento de despesas todos os dias. Ele também armazena na memória no Google Sheets e também lhe dará esse relatório e o enviará para você no WhatsApp também. E, finalmente, às 21:00 todos os dias, ele enviaria no WhatsApp um resumo de quanto dinheiro você gastou.
Por exemplo, aqui eu disse que gastei $10 em uma batata. Não sei por que $10 em uma batata é muito caro. Então ele seria capaz de colocar isso no meu rastreador de despesas. Então, batata aqui, $10 uma batata. Aqui estão todas as outras coisas que comprei. Veja que comprei muitas coisas ultimamente. E à noite, ele me diz que meu consumo se concentrou em despesas de vida, especificamente com a compra de batatas, totalizando $10. Isso indica um padrão de gasto direto e essencial, sem nenhuma outra compra detalhada registrada para o dia. Em alguns dos meus dias anteriores, quando comprei mais do que apenas uma batata, diz aqui que, em 7 de abril de 2025, os gastos agora mostraram uma ênfase significativa em alimentos, com grandes compras como bife e chocolate totalizando $4.000, tornando a comida a categoria mais dominante. Pequenas despesas, despesas de vida também foram registradas com a compra de amendoins. Ok, isso não está exatamente correto, como você pode ver. Talvez ainda precisemos modificar este prompt um pouco. Hum, mas sim, este é um exemplo de como você pode rastrear suas despesas com base na minha explicação de como isso funciona. Que padrão de design de fluxo de trabalho de agente você acha que o agente de IA de rastreamento de despesas diárias com múltiplas entradas é implementado? Coloque isso nos comentários.
Eu queria mostrar um exemplo que é implementado usando código. Agora, especificamente, isso foi implementado usando o SDK de agentes da OpenAI. É feito usando Python e o que é é um assistente de pesquisa financeira que é capaz de receber uma consulta e é capaz de pesquisar na internet, coletar informações sobre ela, agregá-las e também possui funcionalidades de voz e também funcionalidades de linguagem e tradução. E isso segue o padrão de fluxo de trabalho de design de agente de roteamento onde temos um gerente principal. E, na verdade, em vez de apenas mostrar o código para explicar isso a você, vou realmente usar o Cursor para mostrar como o agente de IA funciona e também para executá-lo. Apenas uma pequena prévia do meu vídeo de "vibe coding" que vai acontecer talvez em umas duas semanas. Então, fique ligado para isso.
Ok. Então, vou dizer: "Você poderia, por favor, explicar como funciona o agente assistente de pesquisa financeira?" Então, temos um orquestrador principal que é o gerente de pesquisa financeira e as etapas principais do fluxo de trabalho são que ele planeja pesquisas, realiza pesquisas, escreve relatórios e verifica o relatório. A forma como ele faz isso é que, depois que o gerente inicia o programa, ele o passaria para um agente planejador. Então ele usa um agente planejador para dividir a consulta do usuário em termos de pesquisa específicos. Cada termo de pesquisa contém uma consulta e o motivo da pesquisa e retorna um plano de pesquisa financeira com vários itens de pesquisa. Então ele passa os termos de pesquisa para um agente de pesquisa que então realiza cada uma dessas pesquisas e que então coleta e agrega todos os resultados da pesquisa. Então passamos para a fase de análise. Ele usa agentes especializados para diferentes aspectos. Então, temos dois agentes que estarão aqui. Primeiro, ele passa para os agentes financeiros que analisariam as principais métricas financeiras, bem como para o agente de risco que identifica potenciais bandeiras vermelhas. E ambos os agentes retornarão resumos de análise. Então eles passariam todos esses resumos de análise para a fase de redação do relatório, onde você tem um agente escritor capaz de sintetizar todas essas informações, combina os termos de pesquisa com a análise financeira e de risco, e gera um relatório estruturado usando markdown, um breve resumo e perguntas de acompanhamento. Então temos um agente verificador, que então verifica a precisão e a completude do relatório. Também incluímos uma funcionalidade de interação por voz para que você possa se comunicar e fazer perguntas com base no relatório que é gerado usando áudio. E, finalmente, você obterá sua saída e seus resultados para seu relatório financeiro.
Você pode ver que ele é implementado com base no fluxo de trabalho de agente de encadeamento de prompts, onde o gerente orquestrador principal inicia a consulta e a passa para o agente planejador, o agente de pesquisa e muitos outros agentes até que, finalmente, você consiga um relatório financeário.txt com todo esse resultado contido no relatório financeário.txt. Vamos realmente executar isso agora. Vamos executar o agente de pesquisa financeira, tanto faz. Não consigo soletrar. Tudo bem. A propósito, se você nunca viu um agente de codificação de IA, um editor de código em ação antes, é mais ou menos assim. Honestamente, depois que comecei a usar Cursor, Windsurf e apenas agentes de codificação de IA em geral. Tem sido uma grande mudança para como as pessoas codificam e executam código também. Então, certo, vamos deixá-lo fazer a sua coisa. Ele diz para primeiro ajudá-lo a executar um agente de pesquisa financeira. Deixe-me verificar o espaço de trabalho rapidamente para garantir que temos tudo o que precisamos. Blá blá blá. Então deixe-o fazer isso. Ok. Ele está me dizendo que preciso instalar algumas coisas. Então faremos isso. Instalando dependências. Encontrando erros. Ok. Execute mais coisas. Cinco minutos depois. Ok. Depois de executar todas essas dependências, ele diz que temos o servidor funcionando. Vamos agora executar o agente de pesquisa financeira. Vou apenas escrever: "Quais são as principais métricas financeiras para a Tesla?" Então, vamos executar isso. Ah não, não funcionou. Honestamente, muito do "vibe coding" é apenas executar as coisas e depois deixá-lo instalar coisas e corrigir seus próprios problemas. Então, vamos esperar pacientemente para que funcione. Ok, ele diz para inserir uma consulta de pesquisa financeira. Enter. Ah, parece que não temos uma chave da OpenAI. Deixe-me colocar isso nas métricas chave para a Tesla. Ele está iniciando a pesquisa financeira e começando a fazer sua coisa. Realizaremos sete pesquisas, pesquisando, planejando a estrutura do relatório. E lá vamos nós. Parece que temos o relatório. Certo. O agente financeiro gerou com sucesso um relatório abrangente e podemos realmente encontrar esse relatório aqui. Então, em vez de ter que ler tudo, vou usar a funcionalidade de voz que foi implementada. Então, execute a funcionalidade de voz. "Fale-me sobre as principais métricas no relatório." "Claro. Aqui estão as principais métricas financeiras mencionadas no relatório. Um,"
receitas. A Tesla registrou receitas de US$ 24,93 bilhões. O valor substancial da receita é amplamente atribuído às vendas bem-sucedidas de seus veículos Modelo 3 e Modelo Y, bem como às expansões estratégicas nas fábricas de Berlim e Texas. Dois, para que você possa se comunicar diretamente usando a voz. E, finalmente, quero mostrar a vocês como podem traduzir seu relatório para o espanhol. Então, isso usa MCP. O que permite ter acesso a uma ferramenta que pode traduzir o relatório para o espanhol, o que fez aqui. Então, este é um exemplo de uma implementação codificada e, se quiserem verificar o código, vou realmente deixar o link na descrição para que possam verificar e brincar com ele também.
Lembrem-se de que existem, na verdade, muitas maneiras diferentes que vocês podem usar para implementar um agente de IA. Escolham o que faz mais sentido para o agente de IA que estão construindo, bem como para o seu próprio nível de habilidade.
A propósito, se estiverem interessados em aprender mais sobre agentes de IA e como construir agentes de IA, queria avisar que lançarei um bootcamp de agentes de IA nas próximas semanas. É um programa de quatro semanas, muito prático, onde vocês construirão seus próprios agentes de IA, como os que veem neste vídeo, bem como outros que serão mais avançados e mais personalizados para casos de uso específicos. Então, se estiverem interessados, por favor, verifiquem o link aqui, também na descrição.
Em vez de apenas terminar o vídeo agora e dizer: "Tudo bem, pessoal, vão construir seus agentes de IA." Na verdade, quero incluir esta seção final onde quero compartilhar com vocês como devem pensar sobre que tipo de agentes de IA querem construir em primeiro lugar, porque, em última análise, estamos tentando construir agentes de IA não apenas por diversão, espero, ou talvez seja, não sei, então tudo bem, mas para muitos de nós, estamos tentando construir agentes de IA para que possam ser úteis para nós, úteis para um negócio, úteis para uma empresa, o que for, certo? Talvez alguns de vocês também queiram iniciar seus próprios negócios ou startups de agentes de IA. A propósito, se ainda não o fizeram, por favor, verifiquem o canal do YouTube da Y Combinator. Aprendi muito em termos de descobrir que tipo de agentes de IA construir, que tipo de startups fazer, que tipo de coisas estar ciente ao explorar o espaço da IA, e os vídeos deles realmente valem muito a pena assistir.
Mas vou compartilhar com vocês a principal percepção que tive ao assistir a este vídeo, que é como encontrar suas ideias de startup de IA. A maneira mais fácil de descobrir um agente de IA útil para construir é começando por você mesmo. O que você está fazendo atualmente que, se fosse transferido para um agente de IA, tornaria sua vida muito mais fácil? Novamente, não se preocupem com que tipo de ferramentas, frameworks e pilha de tecnologia são agora, ok? Apenas pensem no que, se fizessem, tornaria sua vida muito mais fácil.
Por exemplo, trabalho com uma equipe e agência muito adoráveis que cuidam dos patrocínios que faço. E uma das pessoas da equipe realmente me mandou uma mensagem no Slack dizendo que queria construir um agente de IA capaz de acessar seus e-mails e ser capaz de filtrar o que são considerados bons leads versus maus leads e responder apenas a e-mails que são considerados bons leads. Achei que era uma ótima ideia e disse: "Sim, você deveria fazer isso totalmente." E você pode fazer isso totalmente sem código usando nan também. Você pode usar o prompt que compartilhei anteriormente para descobrir qual é o fluxo de trabalho de agente mais aplicável nesta situação específica. E então você pode construí-lo usando uma ferramenta sem código.
Mas e se você for alguém que não está trabalhando atualmente e resolvendo problemas todos os dias? Como talvez você tenha acabado de se formar ou ainda seja estudante. Não se preocupe, a YC também tem ótimos conselhos para isso. Neste caso, o que você quer fazer é ir disfarçado. Visto que você mesmo não tem a experiência para entender o que pode ser automatizado em vez de apenas pensar em algo na sua cabeça. A melhor abordagem para fazer isso é ir e encontrar alguém que esteja de fato trabalhando, como alguém que possui seu próprio negócio ou tem um emprego ou algo assim. Apenas pergunte se você pode acompanhá-los. Tente descobrir os problemas deles. A questão é que muitas vezes eles podem nem mesmo conhecer seus próprios problemas porque estão tão profundamente enraizados no que quer que estejam fazendo no dia a dia. Eles nem percebem que poderia haver maneiras de fazer as coisas que são muito mais fáceis e muito melhores se incorporassem a IA em seu fluxo de trabalho. Mas você, você está chegando com um novo par de olhos. Então, olhe para o que eles estão fazendo e tente identificar onde você pode construir um agente de IA e descarregar algumas de suas tarefas, automatizar parte do que eles estão fazendo para que possam atingir seus objetivos ainda melhor.
Uma vez que você começa a fazer isso e a desenvolver isso, muitas vezes você começa a perceber que qualquer problema que você teve ou que você sabe que outra pessoa teve é algo que muitas, muitas pessoas têm. E pronto. É assim que você pode começar a trabalhar em algo que pode eventualmente se transformar em um negócio ou uma startup também.
E, finalmente, se você quiser apenas uma orientação de alto nível, o objetivo absoluto que obtive de um dos vídeos da YC também é que, para cada empresa SaaS que você vê por aí, empresa de software como serviço que você vê por aí, haverá um equivalente de agente de IA. Literalmente, cada empresa que é um unicórnio SaaS, você poderia imaginar que há um unicórnio de IA vertical equivalente. Então, aí está. Isso é literalmente uma orientação tão clara e abrangente. Olhe para todas as empresas SaaS que estão disponíveis agora. Pense em qual é o equivalente de agente de IA para essa empresa e crie-o.
Finalmente, quero falar sobre as inovações específicas habilitadas pela tecnologia nas quais você pode estar trabalhando agora. Como sempre, a indústria da IA está se movendo muito rapidamente e há tantas novas tecnologias sendo desenvolvidas todos os dias. Mas os principais desenvolvimentos fundamentais que podemos ver agora em 2025 são os enormes avanços em termos de voz e áudio. A geração de áudio é simplesmente inacreditável agora. Aqui está um pequeno trecho para eu mostrar o que quero dizer de Sesame. Isso é, na verdade, de um amigo que me mostrou isso e eu fiquei simplesmente chocado. Hobbies para conhecer pessoas. Bem, entrar em um clube ou comunidade online pode ser muito divertido, especialmente se você gosta de jogos ou artesanato. O voluntariado também é uma ótima maneira de se conectar com pessoas incríveis que se importam com as mesmas coisas que você. E ei, se você está assistindo a isso, não se esqueça de se inscrever no canal da Tina para mais dicas incríveis.
É também por isso que a própria OpenAI e seu SDK têm uma categoria inteira dedicada a agentes de voz, porque há muitos casos de uso habilitados a partir disso. Há também desenvolvimentos massivos em modelos de imagem como Rev, geração de imagem Gemini Flash, bem como geração de imagem GPD40. E também há modelos de vídeo como Sora. Então, qualquer coisa relacionada a imagem e vídeo. Todas essas são coisas que também estão maduras para a disrupção.
Agora, encerrando este vídeo com um conselho geral final. Sempre há tanta coisa acontecendo nesta indústria. Se você se sentir sobrecarregado com o que está acontecendo, tente relaxar, acalmar-se e pensar de volta nesses frameworks e componentes que apresentei hoje. Há uma razão pela qual criei este vídeo onde não estou apenas mostrando tutoriais de coisas e apenas falando sobre as novas coisas que as pessoas estão construindo e os novos agentes que as pessoas estão construindo também. É porque, com tudo isso acontecendo, se você apenas se concentrar em entender os componentes fundamentais, os frameworks fundamentais e as tecnologias fundamentais, tudo o que vem por cima disso, você é capaz de categorizar em sua mente como sendo realmente importante para você aprender ou não importante.
Então, mantenha-se atualizado com a verdadeira grande inovação nesta categoria. Coisas como inovações reais de modelos. O Gemini 2.5 Pro foi lançado recentemente, por exemplo, MCP que permite um melhor uso de ferramentas e muitas outras coisas. Você realmente não precisa prestar tanta atenção a esse hype. Continue aprendendo. Continue fazendo seus próprios projetos. Construa seus próprios agentes de IA. E quando chegar a hora, quando surgir a oportunidade em que seu conjunto de habilidades e seu interesse se alinham com o que está em demanda no mundo agora. Você estará construindo um negócio ou startup de agente de IA de sucesso, ou apenas um trabalho extra ou projeto divertido também. Seja paciente, meu amigo.
Certo, como prometido, aqui está a pequena avaliação final. Por favor, escrevam nos comentários suas respostas para estas. Agora, muito obrigado por assistir até o final deste vídeo muito longo e muito intensivo. E eu realmente espero que tenha sido útil e vejo vocês no próximo vídeo ou transmissão ao vivo.