Transcription
É, pessoal, a OpenAI acabou de lançar o GPT 5.5 e isso só colocou mais lenha na fogueira da briga entre Antropic e OpenAI para saber se o Opus 4.7 ou GPT 5.5 é o melhor. E mais do que isso, saber qual dos dois vale mais a pena, porque a Antropic agora entrou numa moda de ficar subindo o preço. Ela desativou o cloud code das contas pro e a OpenAI segue melhorando e ela não tá nem aí porque é tropic pensa com preços muito mais competitivos. Então vamos entender o que que está acontecendo. Vem comigo. É isso aí.
Vamos lá pessoal, sempre agradecendo a todo mundo que deixou seu like, a todo mundo que se inscreveu. Um agradecimento especial a todos os membros do canal que patrocinam esse canal aqui de inteligência artificial. Sempre lembrando que os membros têm acesso a vídeos exclusivos de agentes inteligentes, em que eu faço integração com WhatsApp, MCP, leitura de PDFs, planilhas e muito mais e também tem acesso a vídeos exclusivos.
Bom, gente, então a notícia de hoje é essa aqui, ó. O GPT 5.5 saiu. A Open tá dizendo que é uma classe de inteligência para trabalho real. Então, a coisa aqui subiu a régua. Vocês devem lembrar que a partir do final do ano passado, a Open A entrou num declínio absurdo, todo mundo passou ela, só faltou realmente o Grock conseguir passar ela. Mas por outro lado eles focaram em desenvolvimento e agora estão tentando ali tirar o atraso. Vamos ver se esse negócio vai dar certo dessa vez.
O que que eles estão falando? Que ele é mais inteligente e intuitivo até o momento. É uma nova maneira de trabalhar no computador. O que eles estão tentando fazer com esse modelo é que você seja bastante espontâneo. Peça aquilo que você quer pedir, mesmo que você não seja muito ali preciso e o modelo vai tentar se adequar o máximo possível àquilo que você pediu, incluindo as coisas que você nem sequer pediu, mas que ele vai tentar acertar. Isso porque eles estão dizendo aqui, ó, que o GPT 5.5 é entende o que você está tentando fazer mais rapidamente e consegue realizar mais tarefas por conta própria. Ele é bom em escrita, depuração de código, pesquisa online, análise de dados, criação de documentos, planilhas, operação de software e transição de ferramentas até a conclusão de uma tarefa. Essa parte aqui não é nenhuma novidade. Ele só faz exatamente o que ele já vinha fazendo. Então ele continua fazendo.
Mas eles dizem aqui, ó, em vez de gerenciar cuidadosamente cada etapa, você pode delegar o GPT 5.5, uma tarefa complexa e dividida em várias partes, confiando que ele planejará, utilizará as ferramentas, verificará seu trabalho e lidará com a ambiguidade e continuará executando a tarefa. Eu diria que hoje em dia quem não faz isso que eles estão falando simplesmente são as inteligências artificiais que ninguém tá utilizando. O mínimo que eu espero um sistema de inteligência artificial agora, nesse período de 2026, é que você vai dar uma série de ferramentas, você vai pedir para ele fazer a tarefa, vai pegar um cafezinho e quando você voltar a coisa já vai est pronta. É o mínimo que eu espero. E se você não quiser tomar café, você dispara uma tarefa em paralelo ali e enquanto ele faz uma, você começa a outra e você continua nessa até não ter mais tempo para conseguir gerar uma nova tarefa. É assim que eu espero. É o mínimo que eu espero de quem tá assistindo esse vídeo aqui hoje.
Ele é expressivo em programação enganjada, uso de computador, trabalho intelectual e pesquisa científica inicial. Então, presta atenção que eles estão falando aqui, ó. Em pesquisa científica inicial, vocês já perceberam que eles fizeram muita propaganda de que eles fazem pesquisa científica, mas surgir essa palavra inicial na pesquisa científica significa que eles baixaram um pouco a bola, já não tão mais achando que eles vão encontrar a cura de todas as doenças do mundo em 5 meses. E isso é interessante, né, ó, o avanço em inteligência sem comprometer a velocidade. A princípio, a coisa é para ser rápida. E já antecipando o que eles vão falar lá na frente, é que esse modelo ele é mais caro, mas ele é mais inteligente e, portanto, ele precisa de menos tokens para chegar na mesma resposta. E isso acaba equilibrando as coisas, porque o outro que é mais barato gasta mais tokens e esse que é mais caro gasta menos tokens, que a matemática final dá tudo igual.
Eles continuam aqui insistindo nessa questão de segurança, principalmente porque depois do mitos todo mundo começou a falar de segurança, eles não foram diferente. E eles adicionaram alguns testes direcionados para recursos avançados de segurança cibernética e biologia. E essa parte de biologia, lembra quando eu falei no vídeo do Cloud? Olha aqui, ó. O próprio Cloud também tá investindo aqui em biomolecular. Eles fizeram uma melhoria do 4.6 por 4.7 de 30% para 74% ali na pontuação. Então tá todo mundo ali de olho no biológico. Fiquem bastante ligados em relação a isso. O meu palpite é o seguinte: eles vão tentar encontrar a cura de alguma doença, seja lá qual doença for, e fazer muito marketing em cima disso, dizendo que a inteligência artificial agora encontra cura para doenças. Escreve o que eu tô dizendo, porque essa melhoria aqui em biologia, ela não é por acaso não.
Hoje tá sendo disponibilizado para usuários Plus, Pro, Business e Enterprise no site GPT e no Codex. E o GPT 5.5 Pro está sendo disponibilizado para usuários Pro, Business, Enterprise no chat GPT. A API ainda não foi liberada, ela tá precisando de algumas revisões aqui de segurança, mas ela em breve será disponibilizada no 5.5 e no 5.5 Pro na API. Lembrando que essa parte de API é para quem tá desenvolvendo projetos, né, que faz o projeto para um cliente e acaba utilizando chat GPT na desenvolvimento.
Nos benchmarks aqui, gente, eu já vou fazer um resumão dos valores que eu vi. Existe uma briga muito forte entre GPT 5.5 e Cloudopus 4.7. Tem vezes que o 5.5 ganha, outras vezes o 4.7 ganha e algumas outras vezes é o 5.5 Pro. Então, por exemplo, aqui, ó, na bancada de terminal, que essa é uma das coisas mais importantes para quem usa OpenCloud, para quem faz automação ali no Linux, o 5.5 tá fazendo 82%. E nesse resultado ele foi bem melhor que o Opus 4.7, que fez 70%. E eles estão comentando aqui que no PIB Vales fizeram 84,9 e o Cloud fez 80. Mas esse PIBAL aqui, eu não gostei da forma como eles mostraram os dados. Eles mostraram na forma de percentual. E em geral, o dado que eu tô esperando ver aqui é a quantidade de dinheiro que ele ganhou ali nas vending bent, nessas coisas assim e não ficar vendo percentual de acerto aqui de vitórias e empates. Então isso sugere que esse teste aqui tá sendo ou avaliado de forma diferente ou tão mostrando dados diferentes que fica difícil de avaliar.
Em alguns outros cenários, por exemplo, no Brows Comp, o campeão foi o 5.5 Pro com 90%, com o 5.5 com 84 e o Cloud Opos com 79. E aqui na Cybergan, que é aquele benchmark de segurança, ela ganhou do Opus 4.7 com 81% de acerto, sendo que o Opus fez só 73.
Tem bastante gente reclamando da Antropic dizendo que aquele papo de mitos lá, que é um super modelo, que ela não pode liberar porque ele é super poderoso, vai colocar todo mundo em risco. E muitas pessoas criticaram falando assim: "Cara, a Antropic tá exagerando, esse modelo não é tão bom assim, ele é melhor, mas nós ainda não chegamos nesse nível super poderoso, super avançado, de super inteligências". Então isso fica bem claro que a Openai tá fazendo modelos muito bons em segurança e ela tá disponibilizando sem frescura nenhuma, sem ficar falando que vai ser uma catástrofe mundial. Então de certa forma a Openei tá mostrando escraashadamente que a Antropic tá exagerando. Mas vamos deixar o tempo dizer, né? Vai saber.
Nesse índice de inteligência de análise, uma das coisas interessantes que tá acontecendo e tá acontecendo com bastante frequência é que, por exemplo, o GPT 5.5 Extra High, que é esse modelão novo aqui, que é o mais poderoso deles atualmente, ele não só tá com percentual de acerto maior e ele também tá consumindo menos tokens. Vocês conseguem entender que quanto mais pra direita gastou mais tokens. Então, 4.7 gastou mais tokens, o 5.4 Extra High gastou mais tokens, o Opus 4.6 gastou mais tokens e quanto mais paraa esquerda aqui são os mais baratos. Então G. Pro continua gastando menos aqui, porém em nível de inteligência o 5.5 tá ganhando. Então essa é a assinatura desse modelo que tá lançando agora. Ele é mais inteligente, gasta menos tokens e é um pouquinho mais caro. É isso que eles estão tentando mostrar dessa vez.
Nos testes de agentes aqui, utilizando terminal e fazendo engenharia de software, é exatamente a mesma coisa que tá acontecendo. Maior qualidade, maior desempenho e menos tokens. É isso que eles estão mostrando nessa comparação do 5.5 com o 5.4. O score subiu e os tokens baixaram. E eles compartilham aqui essa geração da Ártemis deles fazendo uma simulação do lançamento ali da nave com a lua chegando, a nave fazendo toda aquela trajetória ali com a lua chegando. Inclusive, eu fiz um vídeo específico mostrando esse tipo de simulação aqui da Artemis 2, em que a gente fez a comparação do Gemini, do GPT Pro e do Cloud.
Uma das coisas mais interessantes que a gente tá vendo e que tá aparecendo aqui também é que nessa parte de uma precisão mais científica, de uma coisa mais certeira, a Open vem trabalhando com isso há mais tempo, porque ela começou fazendo muita coisa voltada paraa ciência. Então, os modelos dela tão mais maduros nisso e os modelos da Antropic estão mais maduros para as tarefas de trabalho. Na parte de pesquisa científica chatt enquanto, ele supera o 5.4 em geração de documentos, desempenho superior em pesquisa operacional, modelagem de planilhas e transformação de dados empresariais complexos em planos. E eles comentam aqui uma coisa que eu já falo há bastante tempo. Solicitações de baixo risco, eles podem ser tratados automaticamente e quando tiver risco alto, você continua ali fazendo revisão humana, colocando o ser humano no loop.
Eles fazem uma demonstração aqui em que o cara faz um pedido de investimento bancário, né, fazer uma análise. Ele começa a fazer essa análise, ele gera planilhas e mesmo que ele gere mais de uma planilha, ele consegue cruzar os dados entre essas planilhas, que é uma das coisas essenciais para quem tá fazendo análise de dados, né? Em geral, você tem várias planilhas que você precisa relacionar. Eles comentam também para utilizar o browser User, né, que é colocar inteligência artificial para navegar por você para fazer testes automatizados. Você coloca um site para ela e fala assim, ó, navega nesse site para fazer os testes para ver se esse site tá funcionando. E aí a sai usando o computador ali, clicando no site para fazer os testes para ver se ele tá funcionando. Isso é bastante útil e poupa bastante tempo de quem tá fazendo desenvolvimento na prática, que em geral precisa fazer uma pessoa fazer essa tarefa. Aí nessa hora dá para colocar a inteligência artificial.
Eles tm o GPT 5.5 Finking, que é uma ajuda mais rápida para problemas mais complexos. E também tem o GPT 5.5 Pro, que tem um aumento significativo tanto na dificuldade quanto na qualidade do trabalho que o GPT consegue fazer. Em geral, a versão Pro ela leva uma eternidade para rodar e nem sempre vale a pena. Você tem que pensar muito bem se a sua pergunta vai ser feita pro pro, porque se a sua pergunta não for difícil, ele vai levar uma vida para responder para uma pergunta que não vale a pena. Então pensa bem.
Nos benchmarks e tarefas com valor agregado importantes aqui de tarefas relevantes, a linhazinha tracejada ao expert humano que é colocado como referência e as cores mais escuras é quando a Ia ganhou e as cores mais claras quando ela empatou. Quando você suma empates com vitórias, a Open tá fazendo 84,9% contra 80% do Cloud 4.7, que como eu falei são 4.9 pontos percentuais. Não é tanta coisa de diferença, mas ainda assim é diferença. Dá para considerar que eles estão muito próximos de um empate técnico aqui.
Na parte de pesquisa científica, ele tem ganhos em fluxos de trabalho de pesquisa científica e técnica mais do que simplesmente responder a uma pergunta complexa. E eles estão colocando esse gen bent aqui, que é uma nova avaliação focada na análise de dados científicos em múltiplas etapas na área de genética e biologia quantitativa. E então aqui volta naquela coisa que eu já falei, né, gente? Eles estão focando bastante nessa parte de genética, biologia, biologia molecular, porque provavelmente eles estão querendo fazer um case ali de sucesso, de alguma descoberta na área biológica que, principalmente consiga avançar a cura de alguma doença e alguma melhoria da saúde das pessoas, porque isso vai gerar um case de sucesso para eles muito bom. vai ser um dos melhores marketings possíveis, criar uma inteligência artificial que consegue encontrar a cura para uma doença. Já pensou? Esse tipo de notícia, se ela acontecer, aí até aquelas pessoas que estavam discrentes vão querer saber o que que tá acontecendo. E aí o desempenho nesses bancos de genes aqui, ó, tá em torno de 25%, tá bem baixo, tá bem inicial, o negócio tá começando agora, mas o 5.5 já tá fazendo pontuações melhores que o 5.4.
Um outro benchmark aqui, ó, de bioinformática é esse BXB aqui, ó, que ele tá fazendo 80%, aqui já é um resultado de respeito. 80% é quando ele já tá começando a dominar ali a ferramenta. Eu tentei utilizar o modelo, mas para mim por enquanto ainda não apareceu. Tá no 5.3 e no 5.4 ainda, apesar de que deve aparecer, porque eles estão falando, ó, que o 5.5 está sendo disponibilizado para Plus pro Business Enterprise, Chat GPT. E no Codex, no Codex também para mim não apareceu, mas pessoas já falaram para mim que apareceu no Codex para eles. E o 5.5 Pro está sendo disponibilizado para Pro business e Enterprise no chat GPT e em breve na API, né, o 5.5 e o 5.5 Pro. A versão Finking é a mesma coisa, Plus, Pro, Business e Enterprise. Não está liberado pro gratuito. E no Codex também a mesma coisa, no Plus, no Pro e no Business Enterprise Edu e Go. Então se você for assinante Go, tem na versão do Codex também. Esse ponto é importante, hein? Porque a assinatura GO é baratinha e dá para utilizar no Codex. Então, de repente vale a pena, hein?
Janela de contexto de 400.000 tokens. Os preços para quem vai utilizar API. Lembrando que a API não tá disponível ainda, mas quando tiver vai custar 5 1 milhão de tokens na entrada e 30 1 milhão de tokens na saída com uma janela de contexto de 1 milhão de tokens. E aqui aquela conclusão que eu já tinha falado, preço mais elevado, mas porém mais eficiente em termos de tokens.
Quando a gente olha no Ark, a versão 5.5 extra high é a mais inteligente de todas, fazendo 85% ali de acerto e as tarefas custando 1,87. Vocês estão percebendo a diferença? Por exemplo, o melhor resultado da Antropic do 4.7, ele fez 75%. Só que para uma tarefa ele gastou $7,48. Então essa ideia de que a inteligência do cloud vem embutido um preço alto, já faz parte ali de quem tá utilizando o cloud. As pessoas já aceitaram o preço alto dele e quem não aceitou fica pulando entre Gemini e Chat GPT.
E o que afinal que as pessoas estão falando? Por exemplo, esse Jan PD aqui comentou o seguinte, ó. O GPT 5.5 poderia eliminar completamente metade de todas as assinaturas do Cloud Code nos próximos 1 a 5 meses, preveuseu se eu da Tropic Dario modei. E aparece a carinha do Dário aqui meio triste, sem saber o que fazer, aparentemente tendo que enfrentar agora um adversário à altura.
Numa outra postagem, esse Dindra aqui, ó, compartilhou o que ele fez no 5.5 Pro. Lembrando aqui, ó, ele tá utilizando o Pro e ele mandou um prompt super simples. Faça um jogo no estilo Força Horizon aqui num jogo de carro no 3JS. E esse foi o joguinho que ele fez aqui no 3JS utilizando 5.5 na versão Pro. Aparentemente tá bem interessante isso daqui, né, gente? Não é o melhor jogo do mundo, né, ó, mas tá interessante. Tem carros de corrida vindo nas duas mãos, tanto pra frente quanto para trás. Tem os anéis ali. E a qualidade dos detalhes do carrinho aqui, aparentemente, tá bastante avançada. Os carros estão andando na mão inglesa, que parece contramão pra gente, estão andando na mão inglesa, mas tem o minimapa, tem a velocidade, tem os checkpoints, tem tudo certinho.
Numa outra postagem do Peter Gostev aqui, ó, ele comenta exatamente aquilo que eles estavam falando, ó. Ao usar o GPT 5.5, é instantaneamente perceptível o quão mais poderoso ele é. No Codex, dei a ele um prompt muito complexo para criar um London Toy Railway com marcos e estações. E ele fez um excelente trabalho em uma única tentativa. Na segunda metade do vídeo você vê o 5.4, que não foi ruim, mas claramente foi pior. E aí o videozinho dele tem a London Dream Rayway e ele tá fazendo ali as simulações. Tem o trenzinho andando ali, ó. Ele vai mudando as configurações, os trenzinhos vão se mexendo, os trenzinhos fazem um pouco de drift, fazem um ponco de drift. Ele utilizou o GPT 5.5 extra high e aparentemente ficou bastante interessante. Ó, quando ele comparou com o 5.4 extra high, né, vocês percebem que ficou até interessante, mas na qualidade das imagens, a versão do 5.5 ficou bem mais interessante. Comenta aqui embaixo qual das duas que você gostou mais, 5.5 ou 5.4.
Nessa postagem sobre água ultra realista na versão do 5. Pro, essa foi a versão da água ultra realista que ele acabou gerando. Eu acho bastante interessante, né, gente? Só de imaginar aqui hoje para fazer uma geração ultra realista, você pergunta pra IA e ela já faz uma versãozinha para você, tá top, né? O negócio tá muito bom.
E aqui para finalizar uma provocação. No Su Bent Pro, o 5.5 fez 58%, o Mimo 2.5 Pro fez 57, o Kimica 2.6 fez 58.6. E aí o cara colocou o Morphe aqui, ó, o GPT 5.5 por 30 e o Kim e o Mimo por 4 ou 3. E aí você que tem que fazer a decisão, afinal vai utilizar IA chinesa ou vai continuar no chat GPT? Comenta aqui embaixo o que que vocês estão preferindo, chinesa ou americana, hein? Qual vocês estão preferindo utilizar? Tem muita gente que eu tenho certeza que tá usando ya chinesa já faz bastante tempo e nem lembra mais o que que é Cloudopos, o que que é Gemini, o que que é chat GPT, porque no final das contas ali já que você vai ter que ficar conversando com essas IAS mesmo, se é para jogar conversa fora e gastar tokens que seja num preço mais barato, comenta aqui embaixo o que você tá pensando.
E uma coisa importante, os modelos não foram liberados para mim aqui, eu não consegui testar ainda, mas assim que eu conseguir testar, assim que eles forem liberados, eu vou fazer um vídeo testando e já libero e já mando para vocês verem o que que aconteceu. E se você quiser apoiar o canal para continuar vendo vídeos como esse, seja membro. Os membros têm acesso a vídeos exclusivos de agentes inteligentes e vídeos antecipados. É isso aí, deixa aquele like. Valeu.