Transcription
Prepárate para explorar los principales proyectos de agentes de IA de tendencia de esta semana que están superando los límites y redefiniendo las posibilidades. Nos sumergiremos en avances increíbles, desde agentes de voz que logran matices a nivel humano y socios de IA que escriben y prueban código de forma autónoma, hasta herramientas que mantienen saludable todo tu sitio web y transforman la forma en que los equipos colaboran. Quédate mientras desglosamos cada innovación, mostrándote cómo estas tecnologías están teniendo impactos reales ahora mismo. Bienvenido de nuevo a los tutoriales de Manu AGI. Aquí exploramos el emocionante mundo de la IA, las últimas herramientas de IA para ti. Así que no olvides presionar ese botón de suscripción y la campana de notificación para no perderte las últimas ideas de IA. Así que comencemos el video de hoy. Proyecto número uno, GPT Real Time. El agente de voz de próxima generación que habla, entiende y actúa, todo en un solo modelo. GPT Real Time redefine lo que los agentes de voz pueden hacer al ofrecer un habla fluida, natural e inteligente en tiempo real. Lo que lo hace destacar es su canal de voz unificado. En lugar de hacer malabares con herramientas separadas de voz a texto y texto a voz, todo pasa por un solo modelo y API. Eso significa menor latencia, matices vocales conservados y una experiencia que se siente más humana que nunca. El modelo demuestra mejoras notables en naturalidad y expresividad. Puede seguir claramente indicaciones detalladas como leer instrucciones palabra por palabra, cambiar sin esfuerzo entre idiomas a mitad de oración y mantener matices de tono, ya sea enérgico, profesional o empático. Y con la adición de dos nuevas voces, Cedar y Marin, la calidad general del habla es más realista y atractiva. En el frente de la inteligencia, GPT Realtime muestra una comprensión avanzada. Detecta señales no verbales como la risa. Maneja detalles alfanuméricos con precisión en idiomas como español, chino, japonés y francés, y realiza tareas de razonamiento con una puntuación mucho más alta en puntos de referencia como Big Bench Audio, 82.8% frente al 65.6% anterior. También es más confiable para seguir instrucciones. La precisión en puntos de referencia como multi-challenge, diseñado para manejar diálogos realistas de múltiples turnos, mejora significativamente del 20.6% al 30.5%. Y cuando se trata de llamar a herramientas o API a mitad de la conversación, su tiempo, relevancia y precisión de argumentos se mejoran enormemente con un mejor manejo de llamadas asíncronas que mantienen el flujo fluido incluso cuando los cálculos de respaldo tardan más. Más allá de las mejoras de voz, GPT Realtime trae integraciones potentes. Admite servidores MCP remotos para conectar herramientas al instante, acepta entradas de imágenes para un contexto más rico y se conecta sin problemas a través de SIP para conversaciones telefónicas. Este modelo no es solo una demostración tecnológica. Está listo para producción. Miles de desarrolladores ayudaron a refinarlo durante la beta, y está diseñado para alta confiabilidad en escenarios del mundo real. En resumen, la singularidad de GPT Realtime radica en su modelo de voz todo en uno que es rápido, expresivo, profundamente inteligente y altamente integrador, acercando la IA de voz a los matices y la robustez a nivel humano como nunca antes. Proyecto número dos, Open AI Codeex, tu socio desarrollador de IA que codifica, prueba, corrige y explica. Open AAI Codeex redefine cómo trabajan los desarrolladores al actuar no como una herramienta de autocompletado, sino como un colaborador activo que maneja tareas de codificación completas de principio a fin. Lo que lo hace verdaderamente único es su capacidad para operar en entornos aislados en la nube donde escribe funciones, corrige errores, ejecuta pruebas e incluso propone pull requests de forma autónoma basándose en tus instrucciones en lenguaje natural. Cada tarea que emprende se ejecuta en su propio entorno seguro, manteniendo tu código a salvo mientras se mantiene una transparencia total a través de registros y resultados de pruebas. Codeex está construido sobre Codeex 1, una versión del modelo 03 de OpenAI afinada mediante aprendizaje por refuerzo en flujos de trabajo de codificación del mundo real. Este entrenamiento asegura que el código que genera refleje el estilo humano y cumpla con los estándares del proyecto. A diferencia de las sugerencias estáticas, Codeex verifica su propia salida. Compila, ejecuta pruebas e itera hasta que el código pasa, por lo que ves resultados funcionales, no solo ideas. Lo que distingue a Codeex es su flexibilidad en entornos de desarrollo. Puedes usarlo dentro de ChatGPT a través de una barra lateral donde simplemente escribes una solicitud como "agrega esta función" o "corrige este error" y comienza a trabajar en su sandbox. Alternativamente, la CLI de Codeex le permite ejecutarse localmente en tu terminal, trabajando directamente con tu repositorio y preservando la privacidad y el control sin conexión. Codeex aporta transparencia y responsabilidad a la codificación con IA. Cada acción es rastreable a través de registros, diffs y resultados de pruebas, lo que facilita la comprensión de lo que cambió y por qué. Ya utilizado internamente por OpenAI y organizaciones como Cisco y Temporal, Codex se está demostrando como una herramienta para el desarrollo serio, no solo para demostraciones de juguete. En esencia, Codeex destaca porque es un socio de codificación autónomo y seguro que entiende el contexto, valida su propio trabajo, se integra sin problemas en todos los entornos y proporciona a los desarrolladores resultados reales y verificables. Proyecto número tres, O Dear, el guardián de salud y rendimiento todo en uno para todo tu sitio web. O Dear te brinda visibilidad completa del bienestar de tu sitio web y no solo para la página de inicio. Lo que lo distingue es su capacidad para monitorear todo lo que importa: tiempo de actividad global, certificados SSL, rendimiento, enlaces rotos, trabajos cron, salud del backend, SEO e incluso problemas de contenido. Obtienes una instantánea holística de la salud de tu sitio web, todo en un solo lugar. En lugar de depender de una sola ubicación, O Dear verifica tu sitio desde múltiples puntos en todo el mundo, detectando tiempos de inactividad, ralentizaciones o problemas de certificados tan pronto como ocurren. Este monitoreo de tiempo de actividad en múltiples ubicaciones te ayuda a detectar problemas reales mientras evitas falsas alarmas. Los certificados SSL tampoco pasan desapercibidos. O dear te alerta antes de que expiren para que puedas solucionarlos a tiempo, preservando la confianza y la seguridad. Luego está el rastreo completo del sitio. O dear escanea todo tu dominio en busca de enlaces rotos, contenido mixto y páginas de error, no solo la página principal, para que los usuarios no se encuentren con frustrantes 404 o extraños bloques de contenido mixto. El rendimiento tampoco se pasa por alto. Los tiempos de carga y la velocidad del sitio se rastrean con el tiempo, lo que te da una advertencia temprana cuando las páginas se ralentizan y potencialmente afectan la experiencia del usuario o el SEO. Si dependes de tareas programadas como trabajos cron o necesitas comprobaciones de salud internas como espacio en disco, colas o puntos finales de API, O dear también las vigila y te informa si algo falla. Además, ofrece páginas de estado públicas que lucen geniales y mantienen informados a los usuarios o partes interesadas durante las interrupciones, junto con entrega de alertas personalizables a través de Slack, SMS, correo electrónico, Discord, Teams, Pager Duty y más, justo donde tu equipo ya trabaja. Los usuarios elogian su diseño pulido y simplicidad. Es fácil de configurar, agregar una URL y obtienes monitoreo de disponibilidad, rendimiento, SSL y más al instante. Esa facilidad de uso combinada con un potente conjunto de verificaciones lo hace invaluable para desarrolladores, especialistas en marketing y agencias. En resumen, lo que hace que ODR sea verdaderamente único es su cobertura integral, desde el tiempo de actividad hasta las comprobaciones de salud profundas entregadas a través de una interfaz elegante, alertas confiables e integraciones amplias. Obtienes total tranquilidad sabiendo que cada parte de tu sitio está vigilada para que tú y tus visitantes puedan permanecer tranquilos, seguros y en línea. Proyecto número cuatro, Grocode Fast 1, un compañero de codificación agentico ultrarrápido y rentable. Grocode Fast 1 redefine cómo la IA maneja la codificación al combinar velocidad, asequibilidad y razonamiento profundo en un paquete ágil. Fue construido desde cero, comenzando con una arquitectura completamente nueva y entrenado con contenido de programación rico, seguido de datos de pull requests del mundo real para reflejar los flujos de trabajo de desarrollo reales. Este enfoque lo hace excepcionalmente receptivo en las tareas de codificación agentica cotidianas. Donde muchos modelos tropiezan en bucles de razonamiento lentos y llamadas a herramientas voluminosas, Grock Code Fast One brilla. Ejecuta múltiples llamadas a herramientas como GP, edición de archivos y comandos de terminal casi al instante, logrando respuestas refrescantemente rápidas incluso antes de que termines de leer el primer rastro de pensamiento. Gracias a técnicas de servicio inteligentes y caché de prompts con tasas de acierto de más del 90%, la experiencia se siente inmediata. Pero la velocidad no lo es todo. Este agente entiende y trabaja en una amplia pila que incluye TypeScript, Python, Java, Rust, C++ y Go, manejando creaciones de proyectos, correcciones de errores y consultas complejas basadas en código con una supervisión mínima. También ofrece un gran valor por tu dinero. Las métricas de costo muestran precios tan bajos como $0.2 por millón de tokens de entrada y 1x50 por millón de tokens de salida, con la entrada en caché cayendo a solo 0.2 por millón. Esa combinación de rendimiento y asequibilidad lo distingue. Los desarrolladores dicen que cambia las reglas del juego. Un usuario incluso bromeó diciendo que tuvo que cambiar su flujo de trabajo y cursor porque era simplemente muy rápido, lo que le permitió prototipar un simulador de batalla en menos de un día al dividir las tareas en pasos rápidos e iterativos. En esencia, Grocodefast 1 es más que otra IA de codificación. Es un socio de herramientas elegante, económico, que responde a la velocidad del desarrollador, maneja tareas del mundo real en múltiples idiomas y lo hace todo sin arruinarse. Proyecto número cinco, Bite Rover. La capa de memoria que permite a los agentes de codificación de IA recordar, colaborar y entregar. Bite Rover aporta algo verdaderamente único al mundo de la codificación impulsada por IA. Brinda a tus agentes de codificación, herramientas de ayuda como cursor, claude, Gemini y otros, una memoria compartida que abarca sesiones, IDEs e incluso equipos. Tu IA ya no olvida todas las reglas, peculiaridades o correcciones de tu proyecto en el momento en que termina la sesión. En su núcleo, Bite Rover captura lo que importa: correcciones de errores, decisiones de diseño, casos extremos, lógica de negocio, incluso pasos de razonamiento, y los guarda como recuerdos que pueden ser autogenerados a partir de tu base de código o curados manualmente a partir de archivos internos. Esta memoria permanece sincronizada en todos los entornos. Así que, ya sea que abras tu IDE la próxima vez o cambies de herramienta por completo, el contexto que necesitas te sigue. Donde Bite Rover realmente brilla es en su sistema de recuperación inteligente. Utiliza la comprensión semántica junto con señales conscientes del tiempo para recuperar el recuerdo más relevante dado en lo que estás trabajando ahora, no solo coincidencias de texto exactas. Eso significa menos fallos, resultados más frescos y menos momentos de repetición. Bite Rover no se detiene solo en recordar. Ofrece control de versiones completo para esos recuerdos. Al igual que Git, crea, actualiza, revierte. Cada cambio en tu memoria compartida se rastrea, se puede revisar y recuperar. Los equipos pueden colaborar de forma segura con controles de acceso basados en roles, lo que permite compartir mejores prácticas e ideas sin arriesgar la seguridad. En su lanzamiento 2.0, Bite Rover introdujo dos nuevas y potentes funciones: el compositor de contexto, que te permite construir contexto de agente a partir de documentos, imágenes, contenido web y fuentes MCP, todo curado por humanos para mayor precisión, y la versión de memoria similar a Git para transparencia y control. Esto significa que la ingeniería de contexto no es solo un prompt, sino que se elabora, revisa y refina meticulosamente. En resumen, Bite Rover convierte la memoria efímera de la IA en una base de conocimiento dinámica compartida por el equipo. Asegura que tus asistentes de codificación de IA sean conscientes del contexto, confiables y estén listos para construir, no para olvidar contigo. Proyecto número seis, MAI Voice 1 y MAI1 preview. Los primeros modelos propietarios de Microsoft que potencian la voz natural y la comprensión cotidiana. Microsoft ha abierto nuevos caminos al presentar dos modelos de IA internos que redefinen cómo funcionan sus asistentes de IA y hacia dónde se dirige el futuro de la IA de consumo. El primer MAI Voice 1 ofrece un habla impresionantemente expresiva y natural. Puede generar un minuto completo de audio en menos de un segundo utilizando solo una GPU. Un hito en rendimiento y eficiencia. A partir de ahora, ya está en acción a través de Copilot Daily y Podcasts. Y puedes jugar con él directamente en Copilot Labs. Crea tu propio audio como una historia personalizada o una meditación guiada eligiendo el estilo de voz y el contenido. Junto a eso, MAI1 Preview presenta el primer modelo fundacional completo de Microsoft construido completamente internamente, entrenado utilizando alrededor de 15,000 GPU Nvidia H100. Está diseñado para interacciones cotidianas de los consumidores, diseñado para seguir instrucciones y dar respuestas útiles a preguntas diarias. Ahora está abierto para pruebas públicas en LM Arena y Microsoft planea implementarlo en funciones de Copilot basadas en texto en las próximas semanas basándose en los comentarios de los usuarios. Lo que hace único a este dúo es la combinación de velocidad, accesibilidad e independencia. Microsoft ya no depende solo de socios externos de IA. Está construyendo sus propios modelos diseñados para el uso en el mundo real, optimizados para la capacidad de respuesta del consumidor e integrados profundamente en sus herramientas y servicios. Con un modelo de voz rápido y de alta fidelidad y un modelo de texto arraigado en el diseño centrado en el consumidor, esto señala un movimiento poderoso hacia la autosuficiencia en IA. En resumen, estos modelos destacan por dar a Microsoft la propiedad directa de la experiencia de IA, desde cómo hablamos hasta cómo interactuamos. Espera compañeros de IA más adaptables, eficientes e inteligentes fluyendo a través de Copilot y más allá. Proyecto número siete, Marbalism. Tu equipo de empleados de IA a demanda que lo maneja todo. Marbalism aporta algo verdaderamente único. Un equipo completo de empleados de IA, agentes especializados que gestionan roles comerciales clave como soporte al cliente, creación de contenido, generación de leads, asistencia legal y más. Estos no son bots genéricos. Son trabajadores digitales enfocados en roles que manejan tareas de forma independiente, aprenden de tus preferencias y ofrecen resultados consistentes y confiables a lo largo del tiempo. Lo que distingue a Marbalism es cómo transforma la idea de un asistente de abstracto a instantáneamente accionable. No necesitas habilidades de prompting ni conocimientos técnicos. Simplemente describe tu negocio y tus objetivos, y la plataforma se pone a trabajar. Los agentes de IA manejan tu bandeja de entrada, redactan correos electrónicos, gestionan tu calendario, planifican publicaciones en redes sociales, escriben publicaciones de blog SEO, califican leads, aclaran contratos e incluso responden llamadas. Todo sin microgestión. Estos empleados de IA trabajan 24/7, nunca se abruman y nunca toman vacaciones. Los usuarios informan ahorrar al menos 10 horas por semana, ver más de $5,000 en ahorros de costos en comparación con la contratación de agencias o freelancers, y disfrutar de una calificación promedio sobresaliente de 4.85 después de solo una semana. Se adaptan con el tiempo, mejorando según tus comentarios. Por lo tanto, cuanto más trabajes con ellos, mejor entenderán tu estilo y tus necesidades. Otra característica destacada es la facilidad con la que se integran con tus herramientas existentes. Gmail, Outlook, LinkedIn, CRM, plataformas sociales, lo que sea. La configuración lleva minutos y pronto estarás funcionando a plena eficiencia impulsada por IA. Marbleism brilla porque empaqueta precisión, automatización y adaptabilidad en una sola plataforma. En lugar de hacer malabares con múltiples freelancers o automatización DIY, incorporas una fuerza laboral de IA escalable y lista para usar que aprende, se adapta y trabaja incansablemente, todo con un simple resumen del negocio. Proyecto número ocho, Cusho AI. Pruebas de API e interfaces web sin esfuerzo impulsadas por IA. Cusho AI redefine las pruebas al permitir que un agente inteligente tome tus descripciones de API o interfaz web y genere instantáneamente un conjunto completo de pruebas listas para ejecutar. No más scripting manual ni dolorosos ensayos y errores, describe lo que necesitas y crea las pruebas por ti. Puedes alimentarlo con especificaciones de API como Open API, colecciones de Postman o incluso simples comandos curl, y lo convierte en suites de pruebas ejecutables completas en minutos. Lo que realmente distingue a Kusho AI es su flexibilidad en lenguaje natural. Más allá de los archivos de especificación, puedes darle instrucciones en inglés plano para crear escenarios de prueba personalizados. Se adapta a lo que necesitas sobre la marcha. Esto significa que puedes abordar casos extremos específicos o lógica de negocio única simplemente diciéndole a Kusho AI qué probar. Entiende el contexto, la semántica y el uso en el mundo real. Otra característica destacada es la sincronización en tiempo real. Kusho AI mantiene tus suites de prueba actualizadas a medida que tu código evoluciona. Cada vez que el código cambia, las pruebas también evolucionan, asegurando que siempre tengas una cobertura precisa y completa. No se requiere mantenimiento manual. La integración también brilla aquí. Kusho AI se integra sin problemas en los pipelines de CI/CD, permitiendo pruebas continuas junto con tu flujo de trabajo de desarrollo. Proporciona información instantánea y resultados de pruebas confiables analizados por IA para ayudar a detectar errores temprano y mantener implementaciones de alta calidad. En resumen, Kusho AI es único porque combina el poder de la IA con la flexibilidad y la automatización. Sin dolores de cabeza de configuración, solo ingresa, da instrucciones y listo. Entiende el lenguaje natural, se integra sin esfuerzo en los flujos de trabajo de desarrollo modernos, se mantiene al día con tu base de código en evolución y acelera las pruebas con un mínimo esfuerzo. Si buscas optimizar las pruebas sin sacrificios, este es el camino inteligente, eficiente y escalable a seguir. Proyecto número nueve, High Note. Tu segundo cerebro impulsado por IA para una toma de notas más inteligente. High Note se destaca porque convierte el proceso desordenado de capturar y organizar información en algo sin esfuerzo e inteligente. Ya sean audio, imágenes, texto, PDF, páginas web o videos de YouTube, HighNote lo maneja todo con facilidad. Puedes grabar una conferencia, tomar una foto de una pizarra, pegar un enlace de una página web o cargar un PDF, y lo convierte todo en notas limpias y buscables. Lo que realmente lo hace único es cómo hace más que solo almacenar contenido. Lo entiende. High ofrece transcripción en vivo con marcas de tiempo. Así, durante una reunión o conferencia, obtienes texto preciso en tiempo real que captura cada palabra y cada orador. Luego transforma todos esos datos brutos en resúmenes inteligentes, extrayendo ideas clave, elementos de acción y temas, lo que facilita la revisión sin tener que esperar a través de páginas de notas. Pero HighNote no se detiene en la resumen. Organiza todo por ti, autocategorizando notas por tema o fecha, agregando etiquetas y optimizando la búsqueda para que puedas encontrar exactamente lo que necesitas al instante. Y para mejorar la retención, genera tarjetas de memoria y cuestionarios basados en tus notas. Perfecto para estudiantes o cualquier persona que quiera reforzar el aprendizaje sin esfuerzo manual. Otra característica destacada es su versátil extracción de texto de imágenes OCR, HighNote puede extraer texto de capturas de pantalla, notas escritas a mano, imágenes o gráficos, todo con una precisión impresionante y resume el contenido de forma inteligente. También es elogiado por su enfoque en la privacidad y su capacidad para funcionar en todos los dispositivos, desde móviles hasta web, sin bots que rastreen tus grabaciones. En resumen, HighNote es único porque es un asistente digital de potencia completa que captura sin problemas información de cualquier formato, la organiza de manera inteligente, la resume claramente e incluso te ayuda a aprenderla, todo mientras mantiene todo accesible y eficiente. Proyecto número 10, Hivemind AI, automatización que se une a la precisión en la contratación. Hivemind AI transforma la contratación al convertir el reclutamiento tradicional en un proceso impulsado por habilidades, completamente automatizado y centrado en el flujo de trabajo. Lo que lo hace único es su automatización agentica. No espera a que actúes. En el momento en que un candidato se postula, Hivemind se encarga. Evalúa currículums, envía evaluaciones de habilidades, hace seguimiento automáticamente y programa entrevistas basándose en tu flujo definido. No más persecución manual del pipeline. Trabaja incansablemente 24/7. En lugar de depender de la intuición, Hivemind enfatiza la evaluación basada en habilidades con una vasta biblioteca de evaluaciones diseñadas por expertos en más de 1,200 roles. Estos son evaluados y calificados por IA, lo que te brinda información confiable basada en pruebas para hacer la contratación más objetiva. La comunicación es fluida a través de su bandeja de entrada de revisión unificada en tiempo real. Tu lista corta de los mejores candidatos llega lista para su revisión. Desde herramientas de evaluación por video hasta llamadas telefónicas asistidas por IA e incluso funciones de copiloto de entrevistas en vivo, captura información crítica y optimiza la programación para que puedas concentrarte en la evaluación en lugar de la logística. Los pipelines personalizables de arrastrar y soltar de Hivemind permiten a los reclutadores y fundadores adaptar flujos de trabajo sin código. Sencillo de configurar pero lo suficientemente potente para escenarios de contratación complejos. Añade a eso portales de candidatos de marca, puntuación de personalidad y comportamiento, además de enrutamiento sin problemas a tu equipo, y está claro que Hivemind combina la supervisión humana con la eficiencia automatizada. Ya está revolucionando la contratación con una identidad audaz. El primer coche en un mercado de caballos, valorado por su innovación y velocidad. Y ahí lo tienes, un vistazo a algunos de los proyectos de agentes de IA más innovadores que están causando sensación ahora mismo. Ya sea dando a la IA una memoria compartida, optimizando procesos de contratación complejos o potenciando los asistentes de próxima generación de Microsoft, estas herramientas son más que simples demostraciones tecnológicas, son soluciones listas para producción que son rápidas, inteligentes y altamente integradoras. Esperamos que esta descripción general te ayude a comprender el emocionante futuro que la IA está construyendo. No olvides dar me gusta, suscribirte y decirnos qué proyecto te impresionó más en los comentarios a continuación.