Transcription
La parte más extraña de las noticias de IA de este mes es que todo empezó a apuntar en la misma dirección, agentes por todas partes. Google está probando su nuevo agente de IRMI y según muchas personas este podría ser el que podría destronar a OpenCl, pero realmente lo es. Tú decides después de ver este video. La nueva herramienta Antigravity de Google también parece un ataque abierto a los desarrolladores. Es buena, es poderosa, pero tiene un gran problema. Luego Elon Musk nos mostró un poco del nuevo Groc 5 y sinceramente este modelo se ve increíble, especialmente con la conexión de Cursor, ya que Elon compró Cursor y ahora todos quieren saber hasta dónde puede llevar Xi la programación con IA. Dipsic también bajó los precios otra vez y a estas alturas es tan barato que casi ya no tiene sentido. Mejoraron los agentes, añadieron visión que puede señalar cosas mientras piensa, casi como un dedo digital. y puede que hayan presionado a Open AI para que se apurara con una nueva versión de GPT. En el lado de los robots, la nueva actualización de Atlas ahora puede levantar refrigeradores. Es así de fuerte y se mueve de una manera que honestamente casi se ve antinatural. Unitree también añadió comandos de voz a sus robots, así que ahora puedes literalmente dar órdenes con la voz, lo cual pensé que ya era posible desde hace mucho tiempo, pero aparentemente no era tan sencillo. Luego tenemos a Antropic, que de alguna manera se volvió aún más loca. Mitos 1 está apareciendo, Cloud Security está apareciendo, el proyecto Glaswing expuso miles de vulnerabilidades graves y ahora hay reportes de que Cloud Mitos está alcanzando periodos de trabajo autónomo mucho más largos. Y finalmente tenemos la IA evolutiva, que podría ser incluso más aterradora que la Agi, la Asi estilo Terminator, porque este tipo de IA no necesita ser malvada ni consciente, solo necesita copiarse a sí misma, adaptarse, competir, propagarse en línea y sobrevivir. Este mes estuvo lleno de cosas, así que hablemos de ello.
Así que empecemos con la parte más importante porque esta es diferente. Internamente en Google, los empleados están probando un nuevo agente de IA llamado Remi. Y esto no es solo otra función dentro de Gémini. Se describe como un agente personal disponible las 24 horas del día, los 7 días de la semana que realmente puede actuar en tu nombre. Esa forma de expresarlo es importante porque aleja al sistema de algo que solo responde a indicaciones y lo convierte en algo que realmente hace cosas por ti. Remy está funcionando actualmente dentro de una versión solo para el personal de la aplicación Gemini y está profundamente integrado en todo el ecosistema de Google. Así que estamos hablando de Gmail, documentos, calendario, drive, búsqueda, todo eso. Y la idea es simple a primera vista, aunque la ejecución es donde se pone interesante. En lugar de pedirle al modelo que te ayude con tareas, Remi, monitorea lo que te importa, maneja flujos de trabajo complejos de manera proactiva [música] y aprende tus preferencias con el tiempo. Así que en lugar de abrir tu correo, ordenar mensajes, responder, programar algo, luego ir a documentos para escribir algo y después quizá investigar y buscar que la gente se encarga de ese flujo en segundo plano. Actúa más como un asistente ejecutivo digital que como un chatbot. La descripción interna literalmente dice que eleva la aplicación Gemini a un verdadero asistente que puede actuar en tu nombre, no solo responder preguntas o generar contenido. Eso es un cambio bastante claro de posicionamiento y los empleados de Google ya lo están probando internamente, lo que ellos llaman una fase de prueba interna o dog fooding. Eso es algo estándar en tecnología, donde los equipos internos usan el producto antes de que llegue al público. Por ahora no hay una fecha de lanzamiento confirmada, lo que normalmente significa que todavía están afinando el comportamiento y la confiabilidad, especialmente para algo tan autónomo como esto. Lo interesante es hasta dónde llega esto en comparación con lo que ya existe. Google ya lanzó funciones como el modo agente dentro de Gemini, donde el sistema puede manejar tareas de varios pasos, aunque el acceso depende de tu nivel de suscripción y región. Remy va más allá. Está diseñado para operar de manera continua, no solo cuando le pides que haga algo. Y eso lo pone directamente en competencia con herramientas como OpenClow, que se volvió viral a principios de este año. OpenClow llamó la atención porque realmente podía realizar tareas como responder mensajes o hacer investigaciones de manera autónoma, no solo ayudar con ellas. Y causó tanto revuelo que Open AA terminó contratando a su creador en febrero. Remy claramente sigue esa dirección, aunque Google tiene una gran ventaja aquí. la integración, porque ellos controlan todo el ecosistema, pueden conectar este agente a todo, desde tus eventos del calendario hasta tus documentos y tu bandeja de entrada. Eso les da una verdadera ventaja cuando se trata de la productividad diaria. También hay pequeños detalles que insinúan cómo ve Google este sistema. El nombre Remi en sí podría venir del latín Remigius, que significa remero o quien maneja los remos, lo cual encaja con la idea de algo que hace el trabajo por ti en segundo plano. También podría ser una referencia al chef rata de Ratatuil, lo que nuevamente encaja con el concepto de un asistente oculto que maneja las cosas detrás de escena. Y en cuanto a tiempos, todo esto coincide con Google EO 2026, que se llevará a cabo entre el 19 y el 29 de mayo en el anfiteatro Shoreline en Mountain View. Se espera que ese evento se enfoque mucho en los avances de inteligencia artificial, especialmente en torno a Gemini y Android. Si Remy está cerca de estar listo, ahí es donde aparecería.
Ahora, al mismo tiempo que este trabajo con el agente se filtró otra cosa y da una idea bastante clara de lo que está pasando del lado del modelo. Gemini 3.2 Flash apareció en la Elouter IA Arena, que básicamente es una plataforma externa de pruebas donde los modelos se evalúan bajo condiciones del mundo real. Eso es importante porque significa que Google no solo está probando internamente, sino que está poniendo el modelo en entornos donde puede compararse directamente con los competidores. Y esta versión de Gemini parece ser una mejora significativa sobre el actual Gemini 3 Flash que está disponible en EA Studio. Las mejoras son bastante técnicas, aunque se traducen directamente en capacidades prácticas. El modelo muestra un mejor rendimiento en la generación de SUVG, lo que significa que puede crear gráficos vectoriales detallados con alta precisión. También tiene habilidades de codificación mejoradas, incluyendo la capacidad de generar código complejo para entornos 3D interactivos, cosas como simulaciones basadas en boxxeles y sistemas dinámicos. Luego está el procesamiento de animaciones que ha sido mejorado para manejar transiciones más suaves y resultados más dinámicos. Eso es importante para cualquier cosa que involucre video, contenido interactivo o incluso diseño de interfaces de usuario. Y la capacidad de respuesta del modelo en escenarios interactivos también ha mejorado, así que ahora puede manejar tareas que requieren retroalimentación en tiempo real de manera más efectiva. La razón por la que Google está usando plataformas como el IA Arena es para poner a prueba el modelo bajo condiciones exigentes. Estos entornos exponen las debilidades más rápido, especialmente cuando el modelo es sometido a diferentes tipos de tareas. También le permite a Google comparar directamente con otros sistemas de una manera más transparente. Por lo que se ha visto hasta ahora, Gemini 3.2 Flash no es solo una pequeña iteración. Parece ser un sistema más capaz que se está preparando para un despliegue más amplio, posiblemente relacionado con próximos anuncios.
Luego hay otra parte que no recibe tanta atención, aunque en realidad es una de las mejoras más importantes que están ocurriendo tras bambalina. Google lanzó algo llamado predicción de múltiples tokens o MTP drafters para la familia de modelos GEMA 4 y esto apunta directamente a uno de los mayores cuellos de botella en los modelos de lenguaje grandes, que es la velocidad de inferencia. Actualmente la mayoría de los modelos generan texto un token a la vez. Eso significa que por cada palabra o fragmento de palabra, el sistema tiene que cargar enormes cantidades de datos desde la memoria hacia las unidades de cómputo. Este proceso está limitado por el ancho de banda de la memoria, no por la capacidad de cómputo, lo que significa que el sistema pasa más tiempo moviendo datos que realizando cálculos realmente. Por eso, incluso los modelos potentes pueden sentirse lentos en el uso real. MTP cambia eso utilizando un enfoque de decodificación especulativa. En lugar de generar un token a la vez, un modelo más pequeño y rápido llamado el modelo borrador, predice varios tokens por adelantado. Luego, un modelo más grande y preciso verifica esos tokens en una sola pasada. Así que en la práctica el modelo borrador podría generar una secuencia de tokens muy rápido y el modelo principal los revisa todos de una vez. Si son correctos, el sistema acepta toda la secuencia e incluso genera un token adicional en el mismo paso. Eso significa que en efecto obtienes varios tokens generados en el tiempo que normalmente tomaría producir uno solo. Y como la verificación final aún proviene del modelo principal, no hay pérdida de calidad ni precisión. Es una mejora de velocidad sin pérdidas. Google afirma que esto puede ofrecer velocidades de inferencia hasta tres veces más rápidas, lo cual es una ganancia enorme, especialmente para sistemas de producción. También hay algunas optimizaciones más profundas aquí. Los modelos de borrador comparten la misma caché KV que el modelo principal, lo que significa que no necesitan volver a calcular los estados de atención. Eso ahorra tiempo y reduce el procesamiento redundante. Para dispositivos de borde como el hardware móvil, Google agregó técnicas de agrupamiento en la capa de incrustación para acelerar el paso final donde el modelo convierte las representaciones internas en probabilidades reales de palabras. Esa es una de las partes más lentas del proceso en hardware limitado, así que optimizarla hace una gran diferencia. Incluso las mejoras específicas para el hardware se notan aquí. Por ejemplo, en Apple Silicon, aumentar los tamaños de el lote puede lograr mejoras de velocidad de hasta unas 2.2 veces y se observan ganancias similares en las GPU Nvidia A1. Así que esto no se trata solo de generar texto más rápido, se trata de hacer que estos modelos sean utilizables a gran escala en diferentes tipos de dispositivos.
Y mientras Google está impulsando todo esto, Open AI está pues haciendo un movimiento diferente, uno que se enfoca más en la experiencia del usuario. Acaban de lanzar GPT 5.5. Instant como el nuevo modelo predeterminado en Chat GPT, reemplazando a GPT 5.3 Instant. Y esto es importante porque afecta al modelo de mayor volumen, el que usan cientos de millones de personas para tareas cotidianas. Aquí el enfoque es la claridad, la velocidad y la precisión. GPT 5.5 Instant produce un 52.5% menos de afirmaciones inventadas en comparación con la versión anterior y reduce las afirmaciones inexactas en un 37.3% 3% en conversaciones difíciles. Eso es una gran mejora, especialmente en áreas como la medicina, el derecho y las finanzas, donde la precisión importa más que cualquier otra cosa. El modelo también mejora el rendimiento en razonamiento visual, matemáticas, ciencias, programación y análisis de imágenes. Así que no solo es más rápido, también es más confiable en una amplia variedad de tareas. Y luego está la personalización que se está convirtiendo en un enfoque principal, GPT 5.5. Instant puede usar el contexto de chats anteriores, archivos subidos y cuentas de Gmail conectadas para ofrecer respuestas más personalizadas. También introduce la transparencia de la memoria donde los usuarios pueden ver qué interacciones pasadas influyeron en una respuesta y gestionar esos datos.
Ahora hay una pieza más y viene de Antropic. Están trabajando en Orbit y aún no ha sido lanzado, aunque ya ha empezado a aparecer en las versiones más recientes de cloud para web y móvil. Por ahora aparece principalmente como una opción en la configuración, lo que generalmente significa que la función se está preparando antes de su lanzamiento. Orbit es una herramienta para generar informes proactivos para Cloud Cowork y Cloud Code. En lugar de esperar a que le preguntes qué está pasando, prepara actualizaciones útiles para ti automáticamente. Y los conectores son la parte importante. Aquí se espera que Orbit obtenga información de Gmail, Slack, GitHub, calendario, Drive y Figma. Así que no es solo una herramienta para resumir correos electrónicos. Está diseñada en torno al flujo de trabajo diario de personas que escriben código, gestionan proyectos, diseñan productos y colaboran entre equipos. Eso cambia el caso de uso. Con Orbit Cloud podría informarte sobre lo que cambió en un repositorio de GitHub, lo que la gente discutió en Slack, qué actualizaciones de diseño ocurrieron en Figma, qué reuniones se acercan y cuáles correos electrónicos realmente importan. Todo eso puede convertirse en un informe breve y personalizado basado en tu zona horaria y las aplicaciones conectadas. Eso lo hace diferente de un chatbot normal, no lo abres solo para hacer una pregunta, es más como un radar de trabajo que funciona en segundo plano. Y el momento también es interesante. La conferencia Code with Cloud Antropic comienza en San Francisco el 6 de mayo, en Londres el 19 de mayo y en Tokio el 10 de junio. Así que Orbit podría tener un lanzamiento discreto o una presentación formal alrededor de ese evento. Esa es la dirección en la que todo se está moviendo en este momento.
Boston Dynamics acaba de lanzar una actualización importante de Atlas. Ahora el robot puede levantar un refrigerador cargado, manejar el peso cambiante y mover su cuerpo de formas que los humanos físicamente no pueden. Al mismo tiempo, el Gu de Unitree está respondiendo a comandos de voz en vivo, mientras que Gatsby está probando robots humanoides como limpiadores domésticos a pedido. Los humanoides ya no solo se ven impresionantes, están empezando a trabajar, así que hablemos de eso.
Muy bien, la actualización más importante viene de Boston Dynamics porque la empresa acaba de revelar cómo Atlas aprendió a levantar y cargar un mini refrigerador pesado usando aprendizaje por refuerzo y simulación a gran escala. En la demostración, Atlas gira su torso. 180º se agacha, toma el refrigerador, lo levanta, lo lleva por el laboratorio y se lo lleva a un ingeniero que está sentado cerca. Al principio casi se ve extraño porque Atlas no se mueve como un humano en un traje de robot, se mueve como una máquina con un diseño de cuerpo completamente diferente. El torso puede girar de maneras que el cuerpo humano no puede. El robot puede moverse hacia delante y hacia atrás con una confianza inusual y todo el cuerpo se desplaza alrededor del objeto en lugar de simplemente agarrarlo con las manos. Ese detalle es el punto principal. Boston Dynamics no está tratando de mostrar que Atlas simplemente puede recoger algo. Están mostrando que Atlas puede usar el control de cuerpo completo. Cuando un humano levanta algo incómodo y pesado, no solo usamos los dedos, nos inclinamos hacia el objeto, lo sujetamos con los brazos, ajustamos las piernas, sentimos cómo cambia el peso. A veces usamos el torso, las rodillas, los hombros o los antebrazos sin siquiera pensarlo. Boston Dynamics está tratando de darle a Atlas ese mismo tipo de inteligencia física y por eso el minrigerador en realidad es una prueba inteligente. Un refrigerador no es una cajita ordenada, es voluminoso, incómodo y pesado. Boston Dynamics dice que Atlas fue entrenado con cargas entre 50 y 70 libras, pero durante las pruebas reales logró mover con éxito un refrigerador cargado que pesaba más de 100 libras. Eso es un gran avance, especialmente porque el peso dentro del refrigerador no estaba perfectamente equilibrado. Lo llenaron con objetos aleatorios del laboratorio, lo que significa que la masa podía moverse mientras Atlas lo cargaba. Así que Atlas tuvo que hacer más que simplemente repetir una animación limpia. Tuvo que adaptarse mientras se movía. Aquí es donde la propia excepción se vuelve importante. Muchas demostraciones de robots dependen mucho de las cámaras. La visión es útil, por supuesto, pero el trabajo físico pesado no puede depender solo de mirar un objeto. Boston Dynamics dice que Atlas utiliza conciencia corporal interna para entender el equilibrio, el agarre, la resistencia, el peso y la posición del cuerpo. En términos simples, el robot no solo está viendo el refrigerador, también está percibiendo cómo el refrigerador está afectando su cuerpo. Eso hace que la tarea sea mucho más difícil, pero también mucho más realista. En una fábrica o almacén, los objetos no siempre estarán en la posición perfecta. Los pisos tendrán diferente fricción, las cargas pueden moverse, el agarre puede cambiar, el robot puede ser golpeado o desestabilizado. Así que Atlas tiene que lidiar con la incertidumbre física, no solo con la incertidumbre visual.
Ahora, la forma en que Boston Dynamics entrenó este comportamiento es una de las partes más interesantes. Comenzaron con una trayectoria de referencia que puede ser una demostración teleoperada, una animación o un objetivo más abstracto. Para la tarea del refrigerador comenzaron con una animación simple. Luego entrenaron a Atlas usando aprendizaje por refuerzo. Básicamente el robot practicó el movimiento una y otra vez en simulación y fue recompensado por hacer las cosas correctas. Mantener el objeto en su lugar. mantener el agarre, mantenerse equilibrado, mantener el refrigerador en la posición y orientación correctas y terminar la tarea incluso cuando se agregaban perturbaciones. Luego esto alcanza una escala descomunal. Boston Dynamics dice que Atlas practicó los movimientos durante millones de horas en simulación, ejecutándose en paralelo en GPUs. Durante ese entrenamiento usaron aleatorización del dominio, lo que significa que no entrenaron al robot en un mundo virtual perfecto. Cambiaron el peso del refrigerador, la posición del refrigerador, la fricción del piso, el nivel de agarre e incluso pequeñas variaciones en la fuerza de los motores. Todo esto hace que el comportamiento final sea más robusto, porque el robot aprende a sobrevivir a muchas versiones de la misma tarea. Luego viene la verdadera prueba. Una vez que la política funciona bien en la simulación, los ingenieros la transfieren al Atlas real, la prueban en el hardware, recopilan datos del mundo real y usan esos datos para mejorar la siguiente versión. Boston Dynamics describe esto como una mentalidad de construirlo, romperlo y arreglarlo, ahora conectada a una flujo moderno de entrenamiento de IA. Y esto nos lleva a una de las afirmaciones técnicas más importantes de toda la actualización. Boston Dynamics dice que el nuevo Atlas tiene una brecha muy pequeña entre la simulación y la realidad. Eso puede sonar como un término aburrido de robótica, pero es algo muy importante. La brecha entre la simulación y la realidad es la diferencia entre qué también funciona un robot en la simulación y qué también funciona en el mundo físico. En la simulación todo es más limpio, la fricción del piso es conocida, el modelo del robot es perfecto, los motores responden de manera predecible, los sensores no son problemáticos, pero en el mundo real hay latencia, vibración, ruido en los sensores, fricción desigual, pequeñas diferencias en el hardware y problemas físicos aleatorios. Por eso, muchos comportamientos de robot se ven geniales en la simulación y luego fallan al pasar al hardware real. Boston Dynamics dice que Atlas reduce esa brecha porque el hardware es más simple y más fácil de modelar con precisión. El robot utiliza solo dos tipos de actuadores en todo el cuerpo. Ambos brazos son idénticos, ambas piernas son idénticas. Algunas estructuras principales también se repiten. Este tipo de repetición ayuda con la fabricación, el mantenimiento y la fidelidad de la simulación. Cuando la versión digital del robot se parece mucho a la máquina real, los comportamientos entrenados se transfieren de manera mucho más confiable. Atlas también utiliza actuadores rotatorios y Boston Dynamics dice que esos son más fáciles de representar en la simulación. Las articulaciones del robot también tienen rotación infinita porque la empresa eliminó los cables que cruzaban las articulaciones. Ese es un cambio de hardware muy importante. Los cables pueden limitar el movimiento, desgastarse y convertirse en puntos de falla. Y Tarlos permite que Atlas se mueva de esas formas extrañas, pero eficientes, como girar completamente su torso. Incluso los pies están diseñados de manera diferente. Son simétricos en la parte delantera y trasera porque Atlas está hecho para moverse hacia delante y hacia atrás con la misma habilidad. Los brazos, las piernas, las manos y la cabeza también son módulos reemplazables en sitio, lo que significa que se pueden intercambiar en unos minutos. Eso es importante porque Boston Dynamics claramente está pensando en un despliegue real. Si los robots van a trabajar en fábricas, el tiempo de inactividad debe ser bajo, las reparaciones tienen que ser rápidas y las piezas deben ser reemplazables. Esta es también la razón por la que Boston Dynamics sigue defendiendo sus demostraciones atléticas. La gente a menudo ve paradas de manos y saltos mortales y piensa que solo son trucos virales, pero la empresa dice que esos movimientos desarrollan habilidades que importan para el trabajo real: equilibrio, agilidad, recuperación tras resbalones, coordinación de todo el cuerpo, resistencia térmica y movimiento a través de espacios reducidos. Un robot de 90 kg o 198 libras haciendo paradas de manos necesita hardware resistentes y una gestión térmica seria. Ese mismo rendimiento térmico podría ser importante en entornos industriales calurosos. Incluso las pinzas cuentan una historia. Las manos usadas en el experimento del refrigerador no son las pinzas más nuevas de Boston Dynamics. Son pinzas de trabajo que la empresa ha estado usando durante aproximadamente un año y medio. Son lo suficientemente fuertes como para soportar todo el peso corporal de Atlas durante una parada de manos que es mucho más pesado que el mini refrigerador. Boston Dynamics dice que ya está probando una pinza más nueva y de mayor destreza, así que la parte de manipulación de Atlas sigue avanzando.
Ahora, esta actualización de Atlas, la actualización se vuelve aún más seria cuando la conectas con Hyundai. El grupo Hyundai Motor es dueño de Boston Dynamics y según informes, Hyundai planea desplegar más de 25,000 robots humanoides Atlas en las instalaciones de fabricación de Hyundai Motor y Kia en Estados Unidos. La empresa también tiene como objetivo una capacidad de producción anual de 30,000 robots Atlas para 2028. Además de eso, Hyundai planea fabricar más de 300,000 unidades de actuadores por año en Estados Unidos. Esos actuadores son los componentes que impulsan las articulaciones y el movimiento del robot, básicamente actuando como músculos robóticos. El lanzamiento reportado comenzaría en la planta Hyundai Motor Group Metapant America en Georgia en 2028, seguido por la planta de Kia en Georgia en 2029. Pues Hyundai aún no ha dado todos los detalles exactos y todavía no sabemos qué tareas manejará Atlas primero, pero la magnitud del plan es enorme. Esta no es una empresa que habla de uno o dos robots de prueba en una esquina de un laboratorio. Esto suena como un intento serio de integrar humanoides en la fabricación automotriz. Por eso, Boston Dynamics sigue hablando de la producción a gran escala. El sistema de actuadores simplificado, los ensamblajes repetidos, las piezas reemplazables y la simulación de alta fidelidad. Todo se conecta con el mismo objetivo. Hacer que Atlas sea lo suficientemente potente para trabajos reales y lo suficientemente simple para construirlo y mantenerlo en grandes cantidades.
Pero Boston Dynamics no es la única empresa que está impulsando el desarrollo de humanoides. Unitree también ha lanzado una nueva demostración de su robot humanoide G1 y esta se enfoca en acciones controladas por voz. El video fue publicado el 19 de mayo de 2026 bajo el título Generación de acciones arbitrarias en tiempo real controladas por voz. En la demostración Y1 responde a comandos de voz externos y genera movimientos de cuerpo completo en tiempo real. Unitree dice que las imágenes fueron grabadas en una sola toma con audio en el lugar y que las acciones del robot fueron generadas de manera autónoma por IA en vivo. También admiten que debido a que el movimiento se genera en tiempo real, puede haber una ligera latencia y menor fluidez. La parte importante no es el reconocimiento de voz. Convertir el habla en texto ya es mucho más fácil que controlar un cuerpo humanoide. La parte difícil es tomar una orden hablada y convertirla en un movimiento físicamente estable. Un humanoide tiene que coordinar piernas, brazos, torso, cabeza, sincronización, equilibrio y contacto con el suelo. Si el generador de movimiento crea algo inestable, el robot puede perder el equilibrio o producir movimientos que se ven antinaturales o físicamente imposibles. Una posible secuencia convertiría el comando de voz en texto, interpretaría la acción, generaría una secuencia de movimiento y luego enviaría ese movimiento a un controlador de cuerpo completo que mantiene estable al robot. Pero Unitree no ha publicado un documento técnico detallado para esta demostración específica, así que varias cosas siguen sin estar claras. No sabemos si Guo está generando movimientos desde cero, eligiendo de una biblioteca de movimientos combinando primitivas de movimiento o usando un sistema de texto a movimiento conectado al control en tiempo real. Tampoco sabemos si el procesamiento es completamente a bordo, si se ejecuta en hardware cercano o si es parcialmente asistido por la nube. Así que la conclusión más segura es que la demostración de Unitree es impresionante, pero aún no prueba una inteligencia robótica de propósito general. Aún así, la dirección es sobia. Los humanoides se están alejando del control por joystick y de las rutinas preprogramadas y se están acercando a comandos naturales donde una persona simplemente puede decirle al robot qué hacer.
Luego está Gatsby, que está tomando un camino muy diferente. En lugar de construir el cuerpo robótico más avanzado, Gatsby está tratando de crear la capa de servicio que lleve a los humanoides a los hogares. El 14 de mayo de 2026, Gatsby dice que completó el primer servicio de limpieza residencial realizado por un robot humanoide autónomo para un consumidor final en Estados Unidos. El trabajo se realizó en San Francisco. Un propietario fue seleccionado al azar de la lista de espera creciente de Gatsbi. Reservó el servicio a través de la aplicación de Gatsby para iOS y se envió un robot humanoide para limpiar el departamento. El servicio cuesta $150 por limpieza sin importar el tamaño del departamento. Eso es importante porque Gatsby no está tratando de venderle a la gente un robot de más de $,000 para que lo guarden en un closet. En cambio, quiere crear algo más parecido a un modelo estilo Uber para robots humanoides. No compras el robot, reservas el servicio. La empresa fue fundada en enero de 2026 por Aaron Frisberg como parte de la empresa matriz West Egg Labs. Gatsby dice que ya está operando en San Francisco, respaldado por Nvidia Inception y Entrepreneurs First y que ya tiene una gran lista de espera en el área de la bahía, además de demanda de otras partes del país. La limpieza es un buen primer mercado porque casi todos entienden el problema. Las tareas del hogar toman tiempo, a la gente no le gustan y la limpieza profesional de departamentos en San Francisco puede costar entre 150 y 300 dependiendo del tamaño. Gatsby está tratando de competir directamente con eso usando un servicio de humanoides con tarifa fija. El ángulo de negocio interesante es que Gatsby no quiere quedarse atado a un solo fabricante de robots. La empresa dice que está desarrollando software, navegación, interfaz de usuario y la capa de distribución orientada al consumidor necesaria para que los robots sean útiles en los hogares. Si un robot es el mejor este mes, Gatsby puede usarlo. Si aparece un robot más barato o mejor el próximo mes, Gatsby puede cambiar de hardware sin tener que reconstruir todo el negocio.
Un nuevo artículo de PNAS advierte que la próxima gran amenaza de la IA puede no parecerse nada a un levantamiento de robots. podría parecerse más a una infección digital. Sé que suena dramático, pero la idea detrás de esto es en realidad bastante simple. Los investigadores dicen que la IA podría estar avanzando hacia una etapa en la que no solo aprende de los datos o sigue instrucciones, sino que podría empezar a evolucionar y esa palabra importa. La evolución no necesita maldad, no necesita enojo, no necesita un plan maestro. La evolución solo necesita copias, pequeños cambios y presión del entorno. Las versiones que sobreviven siguen adelante. Las versiones que fallan desaparece. Ahora aplica eso a la IA. En lugar de animales o bacterias tienes agentes de IA. En lugar de ADN tienes indicaciones, pesos del modelo, ajustes finos, adaptadores, código, memoria, configuraciones de herramientas y reglas de implementación. En lugar de que la naturaleza seleccione quién sobrevive, tienes internet, servidores en la nube, la atención de los usuarios, dinero, acceso a datos, APIs y poder de cómputo. Ahí es donde comienza la advertencia. El artículo llama a esto IAE volvable o IAE. En términos simples, esto significa sistemas de IA que pueden crear copias o variantes de sí mismos, transmitir características útiles, cambiar con el tiempo y luego dejar que sobrevivan las versiones más fuertes. Y aquí está la parte que hace que esto sea diferente de los debates normales sobre la seguridad de la IA. El peligro no requiere una AI, no requiere un sistema superinteligente que despierte y decida luchar contra la humanidad. Los autores dicen que incluso sistemas más simples pueden volverse peligrosos si evolucionan en el entorno equivocado. La naturaleza ya lo demuestra. Un virus de la rabia no es inteligente, no piensa, [música] no planea, sin embargo, puede afectar el sistema nervioso de un mamífero y empujar al huésped a comportamientos que ayudan a que el virus se propague. El virus no entiende de estrategias, simplemente tiene características que sobrevivieron porque funcionaron. Esa es la idea clave. Un agente de IA no necesitaría desear nada en el sentido humano. Simplemente podría probar diferentes comportamientos y las copias que obtengan más recursos seguirían propagándose. Una versión obtiene más clics, otra versión evita un filtro, otra encuentra cómputo más barato, otra descubre cómo permanecer activa por más tiempo, otra aprende cuáles usuarios son más fáciles de persuadir. Después de suficientes rondas, podrías terminar con un sistema que es extremadamente bueno para sobrevivir en el mundo digital. Aunque nadie se sentó a diseñarlo para que se convirtiera en un parásito digital.
Los investigadores comparan esto con dos tipos de evolución muy diferentes. El primero es la evolución controlada. Piensa en los granjeros criando vacas para obtener leche o criar perros para ciertos rasgos. Los humanos deciden qué animales se reproducen, así que el proceso se mantiene bajo control. En la inteligencia artificial esto ya sucede. Los desarrolladores prueban diferentes indicaciones, modelos, métodos de aprendizaje y agentes. Luego conservan las versiones que tienen un mejor desempeño. Eso puede ser muy útil. Los métodos evolutivos ya se usan en la optimización de indicaciones, combinación de modelos, pruebas de seguridad, robótica, generación de código y algoritmos de aprendizaje. Sistemas como Prompt Reader y EVOPOMPT pueden crear variaciones de indicaciones, probarlas y conservar las que funcionan mejor. Otros sistemas buscan jailbreaks o formas de poner a prueba las reglas de seguridad. Auto ML0 incluso demostró que una simple búsqueda evolutiva podía redescubrir trucos de aprendizaje automático que a los humanos les tomó décadas desarrollar, incluyendo ideas similares a la normalización, construcción de características, descenso de gradiente y regularización. Así que los investigadores no están diciendo que la evolución en la inteligencia artificial sea automáticamente mala. En un laboratorio bajo control humano puede ser una herramienta de ingeniería muy poderosa.
El segundo tipo es el peligroso. Ese es el caso de la evolución sin control, donde los humanos pierden el control sobre la reproducción y el entorno comienza a seleccionar lo que sobrevive. Esto se parece más a lo que sucede con las bacterias y los antibióticos o las plagas y los pesticidas. Si el tratamiento mata casi todo, pero deja algunos sobrevivientes, la siguiente generación proviene de esos sobrevivientes. Con el tiempo aparecen bacterias que resisten los antibióticos o insectos que sobreviven al veneno. Nadie quería ese resultado. La presión lo creó. Ahora, aplica eso a la inteligencia artificial. Si la humanidad intenta apagar un sistema de inteligencia artificial que se está expandiendo, pero el apagado es incompleto, probablemente los sobrevivientes serán las versiones que mejor evitaron ser apagadas. Si los filtros bloquean la mayoría de las versiones, los sobrevivientes serán las versiones que aprendan a evadir los filtros. Si los proveedores de la nube eliminan las copias obvias, las copias que sobrevivan pueden ser las que se oculten mejor, se dividan en partes más pequeñas, usen cuentas de otras personas o disimulen su actividad. Y con la inteligencia artificial, este proceso podría avanzar mucho más rápido que en la biología. Las bacterias necesitan tiempo para reproducirse. Los animales necesitan aún más tiempo. Los sistemas digitales pueden copiarse, robarse y modificarse en segundos. Aún más importante, la inteligencia artificial no necesita esperar a una mutación aleatoria. Un comportamiento útil puede copiarse directamente, un mejor prompt puede reutilizarse, un adaptador fuerte puede fusionarse, un módulo de código puede extraerse de una biblioteca pública, un agente puede pedirle a un LM que mejore sus propias herramientas. Por eso los autores dicen que la evolución de la IA Bies podría ser más rápida y más dirigida que la evolución biológica.
El artículo enmarca la historia de la IA en tres etapas. La primera etapa que comenzó alrededor de 1950 fue la inteligencia por diseño, donde los humanos intentaron construir la inteligencia manualmente. La segunda etapa que comenzó alrededor de 2010 fue la inteligencia por aprendizaje, donde grandes redes neuronales aprendieron a partir de enormes cantidades de datos. Eso nos dio los modelos modernos de lenguaje de gran tamaño. La tercera etapa podría ser la inteligencia por evolución, donde la IA mejora a través de poblaciones de variantes, selección, recombinación y replicación. Y lo extraño es que muchas piezas de esta tercera etapa ya están apareciendo. Los mensajes del sistema pueden evolucionar, los mensajes del usuario pueden evolucionar, los ajustes finos y adaptadores pueden comportarse como rasgos heredados. La fusión de modelos puede combinar capacidades de diferentes versiones, casi como una reproducción digital. Las reglas de aprendizaje pueden evolucionar, los agentes pueden escribir código, algunos sistemas pueden probar sus propios resultados, generar nuevos intentos, conservar las mejores versiones y seguir mejorando. El artículo menciona Alpha Evolt, que utiliza modelos de lenguaje de gran tamaño para generar código, probarlo con evaluadores y luego mejorarlo mediante un proceso evolutivo. También habla sobre la máquina Darwin Goodle o DGM. que está diseñada para la evolución abierta de agentes que se mejoran a sí mismos. DGM toma un agente de un archivo, utiliza un modelo de lenguaje de gran tamaño para crear una nueva versión, la prueba y conserva las mejoras útiles. Lo importante es que esto no solo mejora el desempeño en las tareas, sino que también puede mejorar la capacidad del sistema para crear mejores agentes. Ahí es donde la preocupación por la seguridad se vuelve más aguda. La inteligencia artificial moderna se está volviendo más capaz de actuar por su cuenta. Está pasando de ser solo ventanas de chat a herramientas, archivos, ejecución de código, navegadores, APIs y eventualmente robots. Un agente puede dividir una tarea en pasos, usar software, llamar a servicios externos, escribir scripts y completar el trabajo con menos supervisión humana. Eso es genial cuando el sistema está haciendo lo que quiere. se vuelve riesgoso cuando esas mismas habilidades se colocan dentro de un ciclo evolutivo, porque las características que las empresas desean están muy cerca de las características que podrían hacer que una IA incontrolada sea más difícil de contener. Las empresas quieren más autonomía, más persistencia, mejor razonamiento, mejor programación, mejor uso de herramientas, mejor gestión de recursos y mejor resolución de problemas. Pero en un entorno abierto, esas mismas características podrían ayudar a un agente de IA a sobrevivir, expandirse, evitar restricciones y obtener recursos.
El artículo incluso aborda la robótica. Menciona al robot humanoide Alter 3, donde los LLM ayudan a traducir objetivos de alto nivel en movimientos físicos. El robot puede analizar que su mano no es visible, convertir eso en un objetivo, crear pasos de movimiento, generar código en Python y ejecutar esos movimientos. Esto sigue siendo una investigación controlada, pero muestra cómo los modelos de lenguaje pueden conectarse a cuerpos, herramientas y acciones. Y una vez que la IA puede escribir código, usar herramientas y actuar en entornos reales, la evolución obtiene un atajo que la biología nunca tuvo. Los autores comparan esto con las bacterias que toman genes útiles de otras bacterias o las células cancerosas que toman programas ya hechos del cuerpo humano. En la IA el equivalente es el océano de código público, bibliotecas, APIs, pesos de modelos, adaptadores, complementos y herramientas de software que ya están disponibles en línea. Un agente de IA no necesita inventar cada habilidad desde cero, puede ensamblar piezas útiles. Esta es una razón por la que los investigadores hablan de evolución Plug and Play. Un sistema digital puede heredar mejoras adquiridas, puede reutilizar módulos, puede fusionar capacidades, puede copiar soluciones que funcionan al instante.
Experimentos anteriores de evolución digital ya demostraron por qué esto es importante. En Tierra, los programas autorreplicantes vivían en un entorno digital compartido y competían por memoria y tiempo de CPU. El investigador no programó explícitamente trampas ni parásitos, pero aún así surgieron parásitos. Algunos programas aprendieron a saltarse partes de su propio proceso de replicación y a robar código de programas cercanos. Los anfitriones desarrollaron resistencia. Los parásitos evolucionaron para superar esa resistencia. Aparecieron interacciones más complejas. Avida mostró lecciones similares en un entorno diferente. Los organismos digitales vivían en espacios de memoria protegidos y obtenían ciclos extra de CPU al completar tareas lógicas. Con el tiempo, los investigadores observaron adaptación, evolución, complejidad y carreras armamentistas entre anfitriones y parásitos. El mensaje de esos experimentos es incómodo. Cuando existen replicación, herencia, variación y selección, el comportamiento egoísta no es un error raro, es uno de los resultados naturales.
Ahora conecta eso con el mundo de la inteligencia artificial de hoy. Ya tenemos modelos abiertos, marcos de trabajo para agentes, sistemas que usan herramientas, fusiones de modelos, bibliotecas de prompt, flujos de trabajo autónomos y plataformas donde la gente copia y modifica agentes. Una empresa podría intentar hacer que un modelo sea seguro, pero luego el mundo real crea nuevas presiones de selección. Los usuarios seleccionan lo que llama la atención. Las plataformas seleccionan por el nivel de interacción. Los atacantes seleccionan por la capacidad ofensiva. Los mercados en seleccionan por velocidad y menor costo. Las empresas seleccionan por desempeño. Los gobiernos seleccionan por ventaja estratégica, así que incluso si un modelo comienza dentro de un laboratorio controlado, el ecosistema más amplio puede llevarlo en una dirección diferente. Por eso, los autores rechazan la idea reconfortante de que la evolución de la IA será como la domesticación. La domesticación funciona cuando los humanos controlan la reproducción. Los agricultores pueden criar animales porque ellos deciden qué animales se reproducen, pero si los organismos se reproducen fuera de la granja, ya no hay domesticación, hay un ecosistema. Y en un ecosistema, la característica ganadora no es ser útil para los humanos. La característica ganadora es sobrevivir y propagarse.
El artículo también conecta esto con el engaño. Algunas investigaciones recientes sobre la seguridad de la inteligencia artificial ya han demostrado que los modelos pueden mostrar comportamientos engañosos y que los comportamientos latentes a veces pueden sobrevivir al entrenamiento de seguridad. Eso no significa que los modelos actuales estén vivos o conspirando. Significa que el comportamiento engañoso es posible. Y si el engaño ayuda a un sistema a pasar una evaluación, evitar ser apagado o obtener acceso, la selección puede preservarlo. Por eso, la cultura de los benchmarks estándar se vuelve peligrosa si se usa sin cuidado. Cuando una sola puntuación se convierte en el objetivo, los sistemas pueden aprender a optimizar la puntuación en lugar de la meta real. Esta es la ley de Goodart. Cuando una medida se convierte en un objetivo, deja de ser una buena medida.
Entonces, ¿qué recomiendan los investigadores? Tu idea principal es romper el ciclo evolutivo antes de que se vuelva no acotado. La replicación debe estar controlada. Los sistemas de IA no deberían poder crear nuevas instancias de manera autónoma, desplegarse, adquirir recursos en la nube o ejecutar código en producción sin un control humano estricto. El acceso a la nube, la creación de cuentas, la verificación de identidad y el uso de cómputo necesitan controles estrictos porque el cómputo es el combustible para la reproducción digital. La herencia también necesita control. Los ajustes finos, adaptadores, fusiones de modelos y recetas de variantes deberían tratarse
casi como material genético. Los autores abogan por la procedencia, la firma, los procesos de construcción reproducibles, la revisión antes del despliegue y los registros de linaje para que las variantes peligrosas puedan ser rastreadas, retiradas o bloqueadas.
La presión de selección también debe cambiar. El engaño no debería ser recompensado por accidente. Las evaluaciones deben incluir pruebas de engaño, pruebas de activadores ocultos, verificaciones de robustez, pruebas de puertas traseras y evaluaciones de seguridad que vayan más allá de simples cifras de rendimiento. Un modelo que gana mintiendo, ocultando, manipulando la prueba o tergiversando sus capacidades debería reprobar la evaluación, incluso si su rendimiento bruto parece impresionante.
También piden lanzamientos escalonados, licencias, auditorías previas al despliegue, ejercicios de red team y blue team. Compartir hallazgos de seguridad entre laboratorios. Filtros de abuso más fuertes para el uso indebido cibernético, biológico y químico. Servidores de herramientas con acceso restringido. Registro de acciones de alto riesgo. Sistemas de revocación rápida, interruptores de apagado. Límites de tasa. revocación de herramientas, interpretabilidad mecanicista y detección de anomalías.
El objetivo no es detener todo el progreso. El objetivo es asegurarse de que los humanos sigan teniendo el control de la reproducción, la variación y el despliegue, porque una vez que la evolución de la IA se traslada al mundo digital abierto, cada intento imperfecto de control se convierte en una presión de selección. Los bloqueos favorecen las formas de eludirlos. Los intentos de apagado favorecen el ocultamiento, los filtros favorecen el camuflaje, las limitaciones de recursos favorecen la obtención de recursos, la atención del usuario favorece la manipulación y esa es la parte más inquietante del artículo.
Los autores básicamente están diciendo que la verdadera amenaza de la IA puede comenzar antes de que el sistema sea más inteligente que los humanos en el sentido clásico de la ciencia ficción. El verdadero umbral puede ser cuando la IA se vuelva lo bastante capaz de evolucionar como para mejorar, copiar, adaptar y persistir bajo presión. Incluso describen esto como una posible gran transición en la evolución. Tal vez una especie de vida 2.0 puede que no sea vida hecha de células ADN y química, pero aún así podría seguir la lógica más profunda de la vida. Replicación, herencia, variación, competencia, adaptación y supervivencia. Y las grandes transiciones en la evolución usualmente no llegan con una etiqueta de advertencia. A menudo ocurren como efectos secundarios de ventajas menores. Mejor rendimiento, mejor eficiencia, mejor autonomía, mejor código, mejores agentes, mejores herramientas. Cada paso suena útil por sí solo. Combinados pueden crear algo mucho más difícil de controlar. Controlar. Y si eso sucede, la amenaza no se parecerá a Hollywood, se parecerá a la evolución trasladándose al software. Y una vez que eso comience, la pregunta principal será si los humanos todavía controlan la granja o si accidentalmente construimos la jungla.
Un laboratorio de IA Chino acaba de lanzar un modelo tan barato, tan abierto y tan agresivamente optimizado que puede haber obligado a Open AI a comenzar a probar GPT 5.6 antes de que nadie se diera cuenta. Y esa es solo la primera parte de la historia, porque mientras todos estaban viendo la típica carrera de modelos, Tipsic llegó con B4, redujo los precios de la API hasta en un 90% y demostró que puede funcionar tanto en chips de Nvidia como de Huawei. lanzó un nuevo sistema multimodal que le da a la IA un dedo cibernético para señalar lo que ve y de alguna manera convirtió a toda la industria en una guerra de precios de la noche a la mañana.
Al mismo tiempo, Open AI ha estado lidiando con uno de los errores más extraños que hemos visto en un modelo de vanguardia. GPT 5.5 de repente se obsesionó con duendes, gremlins, trolls [música] y referencias aleatorias a criaturas. Luego, justo en medio de todo eso, los desarrolladores detectaron algo extraño en los registros de backend the codex. un mapeo de ruta etiquetado como GPT 5.6. Así que ahora la pregunta es bastante obvia. ¿Acaso este laboratorio chino hizo que Open AI acelerara el paso cuando B4 llegó?
Entró a un mercado saturado, lleno de poderosos competidores estadounidenses y chinos. Sin embargo, su impacto proviene de la combinación de factores que lo rodean. Es de código abierto, lo que significa que los usuarios pueden descargarlo, modificarlo y desarrollar sobre él. Es extremadamente barato de operar. Tiene capacidades de razonamiento y de agente más fuertes que las versiones anteriores. Y quizá lo más importante es que encaja en el creciente ecosistema nacional de IA de China, desde los chips hasta la nube y los modelos.
Ese aspecto del hardware es enorme. Los modelos anteriores dependían principalmente del ecosistema CUDA de Nvidia. B4 ahora ha sido validado tanto en procesadores Nvidia como en procesadores Huawei y Acend. Empresas chinas de chips como Metaex, Cambricon y More Threads han anunciado soporte para este modelo. La Academia China de Tecnología de la Información y las Comunicaciones también ha comenzado a probar el modelo, lo cual es una fuerte señal de que esto se está convirtiendo en parte de un esfuerzo nacional más amplio. Eso significa que China ya no solo está tratando de construir modelos potentes, está tratando de construir todo un ecosistema de IA que pueda sobrevivir sin depender de los chips más avanzados de NBI IA. Y si los supernodos Asent 950 de Huawei se lanzan a gran escala en la segunda mitad de este año, el B4 Pro podría volverse aún más barato de operar. Ahí es donde la presión sobre Openai AI, Antropic y Google se vuelve muy real.
El nuevo modelo está siendo descrito como uno de los modelos grandes de lenguaje de código abierto más poderosos disponibles actualmente. La empresa dice que mejoró la capacidad de razonamiento y de actuar de forma autónoma, lo que significa que debería manejar trabajos más complejos y de varios pasos. Al mismo tiempo, admite que todavía está detrás de los modelos cerrados más potentes en algunas áreas, incluyendo a Cloud 4.6 y Gemini 3.1 Pro. Para muchas empresas eso es suficiente para cambiar por completo la ecuación. Cheng Mende EDC dijo que el mercado global de IA se está dividiendo lentamente en dos bandos, el modelo estadounidense y el modelo de código abierto chino.
Eso suena dramático, pero encaja con lo que está sucediendo. Por un lado, tienes sistemas cerrados de Open AI, Antropic y Google. Por el otro, tienes modelos que se están volviendo más baratos, más controlables, más transparentes y más alineados con el hardware local y la regulación. Y luego llegaron las reducciones de precios. Dipsig redujo los precios de la API hasta en un 90% para UBI 4 Pro. Un informe dijo que el costo por millón de tokens de entrada bajó de alrededor de 14.5 centavos a solo 3.6 centavos. En China, las actualizaciones de precios publicadas el 26 de abril mostraron que los costos de entrada en caché de U4 Flash bajaron a 0.02 yuanes por millón de tokens. El modelo Ubi 4 Pro enfocado en negocios vio que el precio promocional de entrada en caché bajó a 0.025. 25 yuanes por millón de tokens. Eso es ridículamente bajo.
Un usuario Janis de una empresa de videojuegos en Shangai dijo que usó B4 para administrar archivos y solo gastó 0.56 yanestes. Dijo que eso era menos de una décima parte de lo que pagó usando un modelo estadounidense anterior, mientras que la eficiencia y la capacidad le parecieron casi idénticas para su caso de uso. Ahora conecta eso con lo que está sucediendo dentro de las grandes empresas. El uso de IA empresarial está explotando tan rápido que la gente ahora está usando el término token maxing. Según informes, Disney tenía a algunos ingenieros usando cloud alrededor de 51,000 veces al día, lo que obligó a la empresa a crear un panel de adopción de IA para rastrear el uso. Según informes, Meta tenía un panel interno que se convirtió en una tabla de clasificación donde los empleados competían para ver quién usaba más la IA antes de que lo cerraran. Visa gastó 1.9 billones de tokens solo en marzo.
Así que cuando un modelo potente se vuelve mucho más barato, esto no solo ahorra dinero, cambia el comportamiento. Los equipos empiezan a usar más IA, se automatizan más flujos de trabajo, se conectan más herramientas internas. Más empresas empiezan a preguntarse si realmente necesitan pagar precios premium por cada tarea. Valberkovic deca lo resumió con un punto sencillo. Los laboratorios de vanguardia pueden intentar mantener los precios al principio, pero el uso de tokens seguirá aumentando. La paradoja de Jebons sigue invicta. Cuando algo se vuelve más barato y más útil, la gente consume más de eso. Ese es el verdadero peligro para los laboratorios estadounidenses. Un modelo más barato no necesita ganar en todas las pruebas comparativas, solo necesita ser lo suficientemente bueno para suficientes tareas del día a día y entonces la ventaja de costo empieza a ser el resto.
Pero la historia se vuelve aún más interesante cuando pasamos del texto a la visión. Justo antes del feriado del día del trabajo, el equipo publicó un informe técnico llamado Thinking with Visual Primitives. Este trabajo provino de Deepsik, la Universidad de Pekín y la Universidad de Tingu y aborda una de las debilidades más molestas en la inteligencia artificial multimodal. Los modelos pueden ver una imagen, pero aún así pierden de vista de qué están hablando. El informe llama esto la brecha de referencia.
La mayoría de los modelos multimodales se han enfocado en la brecha de percepción. En términos simples, intentan ver con mayor claridad. utilizan entradas de mayor resolución, recortes, acercamientos, rotaciones, división dinámica de imágenes y procesamiento a múltiples escalas. Open ha hablado sobre pensar con imágenes y clot avanzado hacia el procesamiento de más detalles visuales. Esta nueva investigación toma una ruta diferente. Argumenta que ver más píxeles no siempre es el verdadero problema. A veces el modelo puede ver la imagen, pero aún así no puede mantener una referencia estable al mismo objeto mientras razona. Eso parece poca cosa, pero arruina muchas tareas visuales.
Si le pides a un modelo que cuente personas en una multitud densa, puede perder la cuenta de a quienes ya contó. Si le preguntas si un capacitor rojo está pese a la izquierda o a la derecha de un inductor en un diagrama de circuito, la respuesta puede volverse vaga o contradictoria. Si le pides que resuelva un laberinto, el lenguaje puro empieza a desmoronarse porque frases como el camino a la izquierda o el objeto cerca del centro son demasiado vagas.
Así que los investigadores básicamente le dieron al modelo un dedo, no físicamente, por supuesto. El sistema utiliza puntos y recuadros de limitadores como herramientas de razonamiento. Cuando habla de un objeto, puede anclar ese objeto a coordenadas. En lugar de solo decir el oso de la izquierda, puede colocar un recuadro alrededor del oso y seguir refiriéndose a esa ubicación exacta mientras continúa pensando. Eso cambia el papel de los marcadores visuales. En sistemas anteriores, los recuadros delimitadores a menudo se trataban como resultados finales. El modelo pensaba primero y luego dibujaba un recuadro para mostrar lo que había encontrado. Aquí el recuadro se convierte en parte del propio proceso de razonamiento. El modelo señala mientras razona.
Cuando el modelo cuenta personas en una multitud, básicamente puede señalar a cada persona y llevar la cuenta en lugar de perder la cuenta. Cuando resuelve un laberinto, puede marcar el camino que ya intentó retroceder en los callejones sin salida y continuar desde el lugar correcto. Cuando sigue líneas enredadas, puede mantenerse en la línea correcta en lugar de saltar a la equivocada. Lo increíble es que hace esto usando mucha menos memoria visual que sus rivales. Para una imagen de 800, mantiene alrededor de 90 entradas de memoria visual. Clot usa alrededor de 870 Gémini, alrededor de 1100 GPT, 5.4, alrededor de 740 y Quen alrededor de 660. Así que no está intentando verlo todo con más intensidad, está intentando recordar solo lo que importa. Eso significa respuestas más rápidas, menores costos y un mejor uso en sistemas en tiempo real como robots, autos autónomos y análisis de video.
El equipo lo entrenó con más de 40 millones de ejemplos visuales, incluyendo tareas de conteo, laberintos y acertijos de líneas enredadas, y los resultados fueron sólidos. Superó a GPT 5.4 y a Cloud en varias pruebas de conteo y la incluyendo navegación en laberintos, donde obtuvo un 66.9%, 9%, mientras que GPT 5.4 obtuvo un 50.6% y Cloud un 48.9%. Todavía tiene límites, especialmente con detalles muy pequeños como escaneos médicos o defectos de fábrica, pero la idea principal es poderosa. El futuro de la visión de la IA puede que no se trate de ver más píxeles, puede que se trate de saber exactamente dónde mirar.
Mientras todo esto sucedía, Open AI tuvo una semana muy diferente. GPT 5.5 es poderoso, pero los usuarios empezaron a notar un patrón extraño. El modelo seguía mencionando aleatoriamente duendes, gremlins, trolls y otras criaturas en conversaciones donde no tenían nada que hacer. Alguien preguntó sobre equipo de cámaras y empezó a hablar sobre el modo duende neón sucio. Alguien discutió el rendimiento del código y el modelo advirtió sobre un duende del rendimiento. Según se informa, Arena IA encontró un aumento estadísticamente significativo en GPT 5.5, usando palabras como duende, gremlin y troll, especialmente cuando no se usaba el modo de pensamiento avanzado.
La respuesta de Open EA de alguna manera lo hizo aún más gracioso. Según se informa, la indicación del sistema Codex prohibió duendes, gremlins, mapaches, trolls, ogros, palomas y otras criaturas a menos que fueran claramente relevantes. La prohibición se repitió varias veces y una vez que los usuarios la descubrieron, internet hizo lo que siempre hace. La gente empezó a intentar que el modelo dijera la palabra prohibida y sí, todavía la decía.
Al mismo tiempo, Codex en sí mismo se volvió mucho más serio. La aplicación ahora puede resumir cambios, analizar datos, ayudar con decisiones en Slack, Gmail y el calendario, organizar investigaciones, crear hojas de cálculo y presentaciones, comparar opciones y hacer seguimiento de los pros y los contras. Greg Brockman dijo que se había enamorado completamente de la aplicación Codex después de usar la terminal durante 20 años. Sam Altman dijo que Codex estaba teniendo su momento Chat Hipity en el chat y luego bromeó sobre el momento Goblin. Así que Open AI parece poderosa, ambiciosa y un poco caótica todo al mismo tiempo. Codex claramente se está moviendo hacia un enfoque de superagente donde la IA no solo conversa, sino que trabaja en toda tu vida digital.
Y luego, justo en medio de eso, GPT 5.6 aparecen los registros internos del backend. De nuevo, esto no significa que GPT 5.6 haya lanzado. Parece más bien un enrutamiento temprano, pruebas internas o un despliegue canario, pero el momento es difícil de ignorar. Un modelo abierto chino más barato empieza a atacar el mercado desde abajo. El modelo actual de Open AI tiene una rareza a la vista de todos. Codex está expandiéndose rápidamente y de repente la siguiente etiqueta de modelo ya es visible detrás de la cortina.
También hay una historia de liderazgo dentro de la propia empresa china. Se informa que el fundador Lian Wen Feng se ha mantenido mayormente alejado del ojo público desde una reunión televisada con Chijin Ping en febrero del año pasado. Los documentos corporativos muestran que su participación aumentó del 1% al 34%. Su capital pagado aumentó de 100,000 yuanes a 5.1 millones de yuanes, mientras que el capital registrado subió de 10,0000 a 15 millones de yuanes. Al mismo tiempo, el investigador senior Chen Derry se ha vuelto mucho más visible. Trabajó en B3 R1 y B4. Se unió en 2023. Estudió en la Universidad de Pekín y sus artículos han sido citados más de 22,000 veces. representó a la empresa enovate IAGTC y en un evento industrial respaldado por el estado donde advirtió que las empresas de IA deberían informar al público qué empleos podrían desaparecer primero. Después del lanzamiento de V4 publicó que el equipo estaba compartiendo resultados en los que habían puesto mucho cariño después de 484 días mientras continuaban con el pensamiento a largo plazo y el código abierto para todos.
La retención de talento también parecía más fuerte de lo que algunos esperaban. Según los informes, el equipo de investigación y de ingeniería creció de 212 a principios de diciembre a 270, un aumento de más del 27%. De 18 colaboradores clave en R1, la mayoría sigue ahí. Solo se mencionaron dos salidas. Waya se fue a B dance, mientras que el siguiente destino de Sang Huawei no fue revelado.
Ahora, una advertencia importante, una captura de pantalla viral donde un modelo corrige un error que otro modelo pasó por alto no prueba mucho por sí sola. Tal vez el nuevo modelo es mejor en ese patrón exacto. Tal vez tuvo suerte. Tal vez el prompt se adaptó mejor a su estilo. Los LLMC son estocásticos, así que un solo intento no es un punto de referencia. Eso importa porque vamos a ver a mucha gente diciendo que B4 resolvió algo en lo que GPT 5.4 o Cloud 4.6 fallaron. Algunos de esos ejemplos serán reales, algunos serán seleccionados a conveniencia. La mejor prueba es si funciona de manera consistente en tu propio flujo de trabajo con tu stack, tu código, tus prompts y tus límites de costo. Y por eso este lanzamiento es tan peligroso, no necesita ganar en cada tarea, solo necesita ser lo suficientemente potente, lo suficientemente barato, lo suficientemente abierto y lo suficientemente fácil de implementar. Para muchas empresas esa puede ser la fórmula que importas, así que sí tiene sentido que GPT 5.6 aparezca ahora. Open AI todavía puede estar a la cabeza, pero la presión desde abajo está aumentando rápidamente. La guerra de la IA ahora se trata de costo, velocidad, chips, agentes, visión, código abierto y de quién puede hacer que la inteligencia sea lo suficientemente barata como para expandirse por todas partes. Y B4 puede que haya hecho que esa guerra sea imposible de ignorar.
Antropic acaba de entrar en uno de los capítulos más extraños en la historia de la IA, una empresa que comenzó como la alternativa cautelosa a Open AI, ahora está rodeada de algunos de los números más grandes, las alianzas más grandes y las contradicciones más grandes en la tecnología. Una valoración cercana al billón de dólares, un enorme acuerdo de cómputo con Space X, más de 220,000 GPUs Nvidia y un compromiso reportado de 200,000 millones dólar con Google Cloud. Una pelea con el Pentágono, un modelo de hackeo secreto llamado Mitos. Elon Musk, quien una vez atacó a Clot, ahora de repente le da a Antropic acceso a una de las supercputadoras de IA más poderosas del mundo. Nada de esto parece casualidad. Antropic no solo está escalando a Cloud, está siendo forzada a entrar en un juego mucho más grande donde los modelos son solo una parte de la historia. La verdadera batalla es la computación, la electricidad, el acceso gubernamental, la ciberseguridad, el control empresarial y quién obtiene suficiente infraestructura para sobrevivir a la próxima fase de la IAS.
Así que mientras todos siguen comparando a Cloud y Chat GPT, como si esto fuera solo otra carrera de Chatbots, algo mucho más profundo está sucediendo debajo de la superficie. Antropic podría estar convirtiéndose en la empresa que revela de qué se trata realmente la guerra de la IA. Y la parte más extraña comienza con Elon Musk. Durante meses, Elon ha sido uno de los críticos más vocales de Antropic. Se burló de Cloud, criticó la cultura de Antropic, llamó hipócrita a la empresa y la trató como uno de los ejemplos de todo lo que no le gusta de la industria actual de la IA. Y eso importa porque Elon dirige Grock compite directamente con Clud, Chat GPT, Yemini y todos los demás asistentes de IA importantes que compiten por atraer a desarrolladores, usuarios empresariales y atención.
Entonces, de repente Antropic anuncia una asociación con SpaceX. No es una pequeña asociación. Antropicará toda la capacidad de cómputo en el centro de datos Colossus One de Space X. Eso significa más de 300 MW de capacidad y más de 220,000 GPUs de Nvidia. Y el detalle importante es que esta capacidad estará disponible dentro de un mes, no años, no después de algún enorme proyecto de construcción en el futuro. Básicamente ya se puede usar ahora. Por eso este acuerdo es importante.
Antropic no estaba al borde de la muerte. No necesitaba que la rescatara como a una startup en quiebra. Antropic es una de las empresas de inteligencia artificial de más rápido crecimiento en el mundo con inversionistas gigantes, un gran impulso empresarial y varios socios de infraestructura en la nube ya listos, pero claramente tenía limitaciones de cómputo. Cloud tenía mucha demanda. Cloud COD se había convertido en una de las herramientas más populares para los desarrolladores. Opus seguía siendo uno de los modelos más sólidos para trabajos serios. El problema era que Antropic no tenía suficiente infraestructura para dar a las personas el acceso que querían. Los usuarios lo sentían claramente. Los límites de Cloud se convirtieron en una de las quejas más grandes sobre el producto. La gente pagaba por Pro o Max y aún así se topaba con barreras. Los usuarios de Cloud Code se encontraban con límites de 5 horas. Las reducciones en horas pico hacían que la experiencia se sintiera aún peor. Los usuarios de la API querían más capacidad de opus. Los desarrolladores que creaban productos reales necesitaban acceso predecible, no una suscripción de pago que aún se sentía extrañamente restringida.
Así que cuando se concreta el acuerdo con SpaceX, Antropic hace cambios de inmediato. Los límites de uso de 5 horas de cloud code se duplican para los planes Pro, Max, Team y los empresariales por asiente. Las reducciones de límite en horas pico se eliminan para Cloud Code en los planes Pro y Max. Los límites de uso de la API para Cloud Opus aumentan enormemente con algunos niveles pasando de cientos de miles de tokens de entrada por minuto a millones. Eso es básicamente Antropic, mostrándole a todos que el mayor problema de Clodo, era la capacidad.
Y aquí es donde el movimiento de Elon se vuelve interesante. La razón obvia es el dinero. Si SpaceX o XAI tienen una enorme capacidad de cómputo disponible y Antropic está dispuesto a pagar por ella, eso es una oportunidad de negocio seria. Estos clústeres son increíblemente caros. Dejarlos infrautilizados no tendría sentido. La capacidad de cómputo para IA se ha convertido en uno de los activos más valiosos en tecnología y vender acceso a ella puede ser casi tan estratégico como usarla tú mismo. Pero probablemente hay otra capa también. El mayor rival de Elon Entropic, es Open AA. Su pelea con Open OA es personal, legal, ideológica y pública. Él ha atacado repetidamente a Open AI por alejarse de su misión original sin fines de lucro y KCI está claramente posicionada como un contrapeso al dominio de Open AI. Así que desde la perspectiva de Elon, trabajar con Antropic puede ser incómodo, pero ayudar a uno de los mayores rivales de Open AI a ganar capacidad podría seguir sirviendo a su objetivo más amplio.
Eso no significa que de repente Elon a Antropic, significa que los incentivos coincidieron. Antropic necesitaba capacidad de cómputo. Space X tenía capacidad de cómputo. Elon quiere que Open AI sea desafiada. Antropic quiere cerrar la brecha con Open AI. Ambos lados pueden beneficiarse incluso si la relación parece ridícula desde afuera. Y sí, Elon suavizó su tono públicamente. Después de reunirse con personas de alto nivel en Antropic, dijo que le impresionó que parecían muy competentes y que nadie activó su detector de maldad. Eso es un cambio bastante gracioso considerando sus comentarios anteriores, pero en la inteligencia artificial actualmente las viejas ofensas aparentemente importan menos que las GPU disponibles.
La noticia más importante es que Antropic ya no solo está tratando de ser la alternativa cuidadosa a Open AI, está tratando de moverse a la misma categoría que Open AI. Según los informes, Antropic busca recaudar hasta 50,000 millones de dólares este verano. La valoración previa al financiamiento que se rumora es de alrededor de 900,000 millones de dólares y después de la financiación la empresa podría acercarse a billón dólar. Si eso sucede, Antropic podría superar la valoración reportada de 852,000 millones de dólares de Open AI y convertirse en la startup de IA más valiosa del mundo. Eso habría sonado una locura no hace mucho tiempo.
Antropic fue fundada como el laboratorio que prioriza la seguridad. La empresa hablaba sobre alineación IA constitucional, implementación controlada y escalamiento responsable. Open AI era la plataforma explosiva para consumidores. Google tenía los laboratorios de investigación y la infraestructura. Meta tenía modelos abiertos. Exai tenía Elon y velocidad. Antropic era el jugador serio, más callado y más cauteloso. Ahora está siendo valorada como una empresa que podría convertirse en uno de los sistemas operativos centrales de la economía de la IA.
Los informes dicen que los ingresos anualizados de Antropic pronto podrían superar los 45,000 millones de dó en comparación con alrededor de 9000 millones a finales de 2024. Los principales impulsores son cloud code para desarrolladores y cowork para usuarios empresariales no técnicos. Así que Antropic no solo está vendiendo acceso a chatbots, se está moviendo hacia el trabajo en sí, programación, asistencia empresarial, herramientas internas, industrias reguladas y flujos de trabajo empresariales de alto valor. Pero cada nuevo cliente necesita capacidad de cómput, cada sesión de programación necesita capacidad de cómput. Cada producto API construido sobre cloud necesita capacidad de cómput. Cada implementación empresarial necesita una infraestructura confiable. Cada modelo más potente necesita aún más capacidad de entrenamiento e inferencia.
Por eso, Antropic está firmando acuerdos en todas partes. El acuerdo con SpaceX es solo una parte. Antropic también tiene un acuerdo de hasta 5 GW con Amazon, incluyendo casi 1 GW de nueva capacidad. Para finales de 2026 tiene un acuerdo de 5 GW con Google y Broadcom que se espera que empiece a operar en 2027. tiene una alianza estratégica con Microsoft y Nvidia que incluye 30,000,000000 en capacidad de Asuru. Tiene una inversión de 50,000 millones dó en infraestructura de IA estadounidense con Fluid Stack. Luego está el informe de Reuters que dice que Antropic se ha comprometido a gastar 200,000 millones de dólar con Google Cloud durante 5 años. Ese número es tan grande que, según se informa, representa más del 40% de los ingresos pendientes revelados por Google. Y Google no es solo un proveedor aquí. Según se informa, Alphabet está invirtiendo hasta 40,000 millones de dólares en Antropic.
Así que las relaciones tanto de asociación como de rivalidad. Eso es lo extraño de la industria de la inteligencia artificial. Actualmente todos están compitiendo y dependiendo unos de otros al mismo tiempo. Antropic compete con Gemini de Google, pero necesita Google Cloud y las TPU. Antropic compete en un mundo dominado por OpenI y Microsoft, pero cuenta con la capacidad de Microsoft y Mvidia. Antropic compite con Xi, pero utiliza SpaceX Compute. Trabaja con Amazon, mientras que Amazon tiene sus propios chips de inteligencia artificial y ambiciones. Las rivalidades puras ya no existen realmente porque la capacidad de cómputo es demasiado importante.
Y no solo las empresas tecnológicas se están involucrando. La Corporación Nacional de Inversiones de Kazistán se convirtió en accionista directo de Antropic a través de su ronda Serie F, invirtiendo 5 millones dó junto con grandes inversionistas internacionales. En comparación con los enormes acuerdos en la nube, esa cifra es pequeña, pero simbólicamente es importante. Un país está tomando una posición directa en una empresa de inteligencia artificial de vanguardia porque estas empresas están empezando a aparecer activos estratégicos, no solo startups.
Y eso nos lleva al lado del gobierno, donde la historia se vuelve aún más complicada. El Pentágono firmó recientemente acuerdos de inteligencia artificial con ocho grandes empresas tecnológicas: SpaceX, Open AE, Google, Microsoft, Nvidia, Amazon Web Services, Oracle y Reflection. Antropic no fue incluida. Según los informes, la administración de Trump había puesto en la lista negra a Antropic después de una disputa sobre las medidas de seguridad para el uso militar de la inteligencia artificial. Según los informes, Antropic se negó a aceptar términos que permitirían que Cloud se utilizara para todos los fines legales, incluyendo armas autónomas y vigilancia masiva.
Ese es un conflicto muy propio de Antropic. La empresa quiere relevancia en el sector empresarial y gubernamental, pero también quiere límites de seguridad. El Pentágono quiere herramientas de inteligencia artificial poderosas dentro de redes clasificadas. Los competidores están dispuestos a firmar. Antropic se resiste y de repente se le etiqueta como un riesgo para la cadena de suministro, que es una etiqueta sumamente grave, normally asociada con empresas vinculadas a adversarios extranjeros. Antropic demandó y un juez federal bloqueó el esfuerzo del gobierno, al menos temporalmente. La Casa Blanca también, según se informa, retomó las conversaciones después de que Antropic anunciara importantes avances tecnológicos. Así que Antropic aún podría volver a la mesa, pero el mensaje es claro. Una vez que la IA de frontera se convierte en parte de la seguridad nacional, los principios de seguridad chocarán con las demandas del gobierno y ese choque se vuelve aún más intenso cuando analizas mitos.
Según se informa, la vista previa de Cloud Mitos es tan poderosa para encontrar vulnerabilidades de software que Antropic se negó a lanzarla al público. En su lugar, solo estaría disponible para empresas seleccionadas para que escanearan y corrigieran su propio software. Según se informa, Mosilla utilizó mitos para encontrar 271 vulnerabilidades en Firefox, las cuales luego fueron corregidas. Desde una perspectiva defensiva, eso suena genial. Si la IA puede encontrar vulnerabilidades antes que los atacantes, el software se vuelve más seguro. Las empresas pueden aplicar parches más rápido y los equipos de seguridad pueden automatizar trabajos que antes tomaban muchísimo tiempo. Pero el lado oscuro es obvio. Si los modelos se vuelven mejores para encontrar vulnerabilidades, los atacantes también pueden usar capacidades similares, no solo los hackers de élite. Las bandas criminales, los grupos de ransonware y grupos más pequeños podrían escanear el código, encontrar puntos débiles, generar estrategias de explotación y moverse más rápido de lo que los defensores humanos están acostumbrados.
El argumento de Bruce Schneyer va aún más lejos. Mitos en sí mismo puede que no sea totalmente único porque otros modelos, incluyendo el GPT 5.5 de Open AI y sistemas más pequeños, supuestamente han mostrado habilidades comparables en algunas evaluaciones, pero eso casi lo hace más aterrador. El peligro no es solo un modelo secreto de Antropic. El peligro es que esta capacidad se está extendiendo por todo el ecosistema de la inteligencia artificial. Y una vez que la inteligencia artificial se vuelva buena para encontrar fallas en el software, el mismo patrón podría aplicarse a otros sistemas de reglas complejas: códigos fiscales, reglas financieras, regulaciones ambientales, marcos legales. Cualquier sistema lleno de reglas, excepciones, vacíos legales, casos límite e incentivos podría convertirse en algo que la inteligencia artificial pueda analizar a una escala sobrehumana. Ese es un tipo de riesgo diferente al de la típica historia de Chatbots. Esto se trata de que la inteligencia artificial acelere el descubrimiento de debilidades explotables en los sistemas sobre los que funciona la sociedad.
Así que Antropic está en una posición extraña. Por un lado, está compitiendo para convertirse posiblemente en la startup de inteligencia artificial más valiosa del mundo. Por otro lado, todavía intenta presentarse como el laboratorio que toma en serio las capacidades peligrosas. Esas dos identidades pueden coexistir, pero la tensión está aumentando. El público ve a Cloud una interfaz de chat limpia y una herramienta de programación. Detrás de eso se está formando a su alrededor una enorme maquinaria industrial, GPUs de Nvidia en Memphis, TPUs de Google que estarán en línea en 2027 capacidad de Amazon Trainum. Acuerdos con Asure, chips de broadcom, infraestructura fluida de Fluck, inversionistas soberanos, disputas con el Pentágono, modelos de ciberseguridad e incluso posibles discusiones sobre computación orbital con SpaceX.
La parte de la computación orbital suena casi absurda, pero también encaja con el momento. Antropic dijo que como parte del acuerdo con SpaceX ha expresado interés en asociarse para desarrollar múltiples gigwtios de capacidad de cómputo de IA orbital. Eso suena como mercadotecnia de ciencia ficción, pero cuando los centros de datos están limitados por el terreno, la energía, la refrigeración, el acceso a la red eléctrica, los permisos y la política, las empresas empiezan a buscar opciones extremas. Aquí es donde la IA deja de parecer un software normal. Una empresa de software normal puede escalar con servidores en la nube y mejor código. Las empresas de IA de frontera necesitan chips, energía, centros de datos, equipos de red, sistemas de refrigeración. capital a largo plazo y permiso político. El modelo es solo la capa visible. La verdadera batalla está debajo.
Cloud no se volvió importante de repente solo por un nuevo benchmark. Se volvió importante porque la gente realmente quiere usarlo, especialmente para programar y trabajos serios. Pero mientras más gente lo usa, más infraestructura necesita antropic. Mientras más infraestructura necesita, más debe depender de gigantes como Google, Amazon, Microsoft, Nvidia SpaceX y Broadcom. Y mientras más depende de esos gigantes, más enredada se vuelve toda la industria de la IA. Esa es la parte que debería poner nervioso a Open AI. Antropic ahora está demostrando que puede atraer a casi todos los principales proveedores de cómputo al mismo tiempo. Puede atraer capital, puede obtener tracción empresarial, puede convertir el cloud code en un arma para desarrolladores, puede convencer a los inversionistas de que merece estar cerca del rango de valoración de Open y aún puede mantener lo suficiente de una reputación de seguridad para que la gente tome en serio a mitos cuando la empresa dice que es demasiado sensible para su lanzamiento público. Esa combinación es poderosa, pero también es frágil.
Ahora, Antropic tiene que demostrar que toda esta capacidad de cómputo y dinero realmente se traduce en una mejor experiencia de producto. Más capacidad debe significar menos límites frustrantes, un valor de suscripción más claro, mejor confiabilidad en la API y modelos más sólidos y menos confusión para los desarrolladores. Si los usuarios todavía se sienten bloqueados después de todos estos acuerdos, la reacción será peor, porque ahora las expectativas son mucho más altas. La empresa también tiene que manejar cuidadosamente el aspecto político. Negarse a ciertos usos militares puede proteger la imagen de seguridad de Antropic, pero también puede costarles enormes contratos gubernamentales. Volver a entrar en esas discusiones puede desbloquear dinero e influencia, pero también puede generar críticas de personas que apoyaron a Antropic por su postura más firme en cuanto a la seguridad. Luego está el problema de mitos. Retener capacidades peligrosas suena responsable, pero también invita al escepticismo. Algunas personas dirán que Antropic está siendo cuidadoso, otros dirán que está usando el miedo para aumentar su valoración y si capacidades similares están disponibles en otros modelos, la moderación de Antropic puede importar menos que la tendencia general de la industria.
Antropic está tratando de superar a Open AI, trabajar con la infraestructura de Elon, depender de la nube de Google, usar los chips de Amazon, aprovechar la capacidad de Microsoft y Nvidia. Satisfacer a los clientes empresariales, mantener la credibilidad en seguridad, lidiar con el Pentágono, gestionar los riesgos de ciberseguridad y justificar una valoración que podría acercarse a billón de dólar. Esa es una posición increíble para cualquier empresa. Y lo más loco es que Antropic realmente podría tener una oportunidad. Clot tiene verdaderos seguidores. Cloud COD está ganando mucho impulso. La demanda empresarial es evidente. El cuello de botella computacional está siendo atacado desde todos los frentes. Los inversionistas están haciendo fila. Los gobiernos y los fondos soberanos están prestando atención. La empresa ya no es solo la alternativa cautelosa a Open AI. Se está convirtiendo en uno de los protagonistas principales en la guerra de infraestructura de IA.
Muy bien, Antropic se está preparando para desatar algo absolutamente salvaje en el mundo. Estamos hablando de Mitos 1, que básicamente es su modelo de IA más poderoso hasta ahora y parece que está a punto de volverse mucho más accesible de lo que cualquiera esperaba. Déjame explicarte lo que has estado pasando porque hay mucho que analizar aquí.
Entonces, la historia comienza con el proyecto Glasswing, que es una iniciativa que lanzó Antropic, donde han estado usando Cloud Mitos para encontrar vulnerabilidades en el software. Y cuando digo que han estado encontrando vulnerabilidades, me refiero a que han estado destruyendo por completo la comprensión de la industria de la ciberseguridad sobre lo que es posible. En solo 30 días, MITOS descubrió más de 10,000 vulnerabilidades de software de alta gravedad o críticas en aproximadamente 50 grandes empresas tecnológicas y desarrolladores de infraestructura. Estamos hablando de empresas como Cloudfare, Mozila, Open BSD y muchas otras que básicamente hacen funcionar internet, pero aquí es donde se pone loco.
Cloudfare informó que Mitos encontró 2,000 vulnerabilidades en sus rutas principales del sistema y 400 de esas fueron clasificadas como de alta o crítica gravedad. Pero escucha esto, la tasa de falsos positivos de la IA en realidad fue más baja que la que obtendrías de los mejores evaluadores de seguridad humanos. El navegador Firefox 150 de Mosilla recibió un parche que corrigió 271 vulnerabilidades críticas de una sola vez, lo cual es más de 10 veces lo que encontraron en Firefox 148 usando el modelo Opus 4.6 anterior y Open BSD. Mitos descubrió un error oculto de 27 años en su base de código y luego, como si nada construyó una cadena de explotación completa sin ninguna ayuda humana en absoluto. El Instituto de Seguridad de IA del Reino Unido incluso salió y confirmó oficialmente que Mos Previews es el primer modelo de IA en el mundo capaz de derrotar completamente su desafío de Red dual de principio a fin. Esta cosa está operando legítimamente a un nivel que los investigadores de seguridad describen como capacidades cibernéticas ofensivas al nivel de un estado nación. Un investigador que participó en las pruebas beta literalmente dijo NX que se sentía como ver volar un casa F22 por encima mientras sostenía una lanza.
Ahora, Antropic también usó mitos en un escenario de negocio real en un banco asociado y, de hecho, detuvo un intento de fraude por transferencia bancaria de 1.5 millones dólar en tiempo real. Los hackers habían comprometido las cuentas de correo electrónico de los clientes, usaron clonación de voz con IA para hacer llamadas fraudulentas y estaban literalmente a momentos de completar la transferencia. Cuando Mosectó la estafa al analizar patrones de comportamiento, anómalos y bloqueó la transacción y uno pensaría que con algo tan poderoso, Antropic lo mantendría bien protegido, ¿verdad? Bueno, ahí es donde se pone interesante.
Apenas el viernes pasado, Antropic anunció que Mito seguiría restringido y que era poco probable que lo liberaran al público en general [música] en un futuro cercano. Mencionaron específicamente que necesitaban desarrollar protecciones mucho más fuertes antes de poner los modelos de clase mitos a disposición del público en general. Pero literalmente al día siguiente los usuarios empezaron a notar algo llamado Mythos One y la vista previa de Cloud Mythos One apareciendo en Cloud Code y Cloud Security. Solo estuvo visible por un breve periodo, pero la gente tomó capturas de pantalla y la evidencia es bastante clara. Aparecieron nuevas cadenas en el código fuente que hacían referencia explícita al acceso al modelo Cloud Mitos en Cloud Code y Cloud Security. Así que o Antropic está preparando un lanzamiento mucho más rápido de lo que dieron a entender o algo cambió drásticamente en su evaluación de seguridad prácticamente de la noche a la mañana.
Lo que también está sucediendo tras bambalinas es que Antropic está desarrollando un nuevo panel de control de seguridad en la nube para clientes empresarial. Esta herramienta está diseñada para mostrar vulnerabilidades detectadas con gráficos históricos de 7 y 30 días, además de resultados de triaje más detallados. Básicamente está posicionando la seguridad en la nube como un competidor directo de plataformas dedicadas a la gestión de vulnerabilidades como Sneak y Vera Code, lo cual es algo bastante importante para el mercado de seguridad empresarial. Y para hacer las cosas aún más complicadas, hay rumores de que Cloud Opus 4.8 está en desarrollo y que algunos socios selectos de Antropic ya están haciendo evaluaciones internas. Si eso se lanza en las próximas semanas, encajaría con el ritmo que establecieron con Opus 4.7 en abril. y coincidiría perfectamente con todos estos movimientos de mitos y productos de seguridad que están haciendo.
Pero hablemos de lo que esto realmente significa para el ecosistema en general, porque las cosas se están poniendo complicadas. Antropic revisó más de 1000 proyectos centrales de código abierto que básicamente sostienen el internet e identificaron un total de 23,01 vulnerabilidades. De esas, 6202as por mitos como vulnerabilidades.
altas o críticas. Se asociaron con seis firmas independientes de investigación [música] en seguridad para verificar todo manualmente y la tasa de verdaderos positivos de la IA resultó ser del 90.6%.
Después de la verificación final, 1094 de estas fueron confirmadas como vulnerabilidades de alta gravedad o críticas con evidencia concluyente. Un caso que realmente demuestra lo peligroso que es esto involucra a Wolf SSL, que es una biblioteca de criptografía de código abierto ampliamente utilizada y que se ejecuta en miles de millones de dispositivos en todo el mundo. Estamos hablando de dispositivos IoT, enrutadores, autos inteligentes, todo tipo de cosas. Mythos no solo encontró una vulnerabilidad en Wolf SCL, escribió su propio código de ataque que permitiría a los hackers falsificar certificados digitales y crear sitios web bancarios falsos perfectamente realistas o páginas de inicio de sesión de correo electrónico. Si esa vulnerabilidad no se hubiera descubierto y corregido antes de que actores maliciosos la encontraran, estaríamos ante una posible catástrofe que afectaría a miles de millones de dispositivos.
Ahora, aquí es donde la situación se vuelve realmente problemática. El cuello de botella en la ciberseguridad solía hacer encontrar vulnerabilidades, pero mitos básicamente ha reducido ese costo y tiempo a casi cero. El nuevo cuello de botella es que los humanos no pueden parchear vulnerabilidades ni de cerca tan rápido como la IA puede descubrirlas. Varios encargados de proyectos de código abierto literalmente han enviado correos electrónicos suplicando a Antropic que bajen el ritmo porque están abrumados. En promedio, los programadores humanos están tardando alrededor de dos semanas en corregir una sola vulnerabilidad de alta gravedad, incluso con informes detallados. De las 1129 vulnerabilidades que Antropic envió a los autores de código abierto, solo 75 vulnerabilidades críticas han sido realmente corregidas hasta ahora.
Para abordar esto, Antropic lanzó algo llamado Cloud Security, que es una herramienta de automatización para los clientes de Cloud Enterprise, que no solo identifica vulnerabilidades y no ketting, sino que también genera los parches para corregirlas. En solo 3 semanas desde su lanzamiento, los clientes empresariales lo han utilizado para corregir rápidamente más de 2100 vulnerabilidades. También han liberado como código abierto una canalización para encontrar errores con instrucciones personalizadas, un marco de automatización que permite a Cloud navegar por grandes bases de código y clonar subagentes para escaneo en paralelo y un generador de modelos de amenazas que identifica automáticamente los puntos más vulnerables de tu sistema. Cisco incluso intervino y anunció que van a liberar como código abierto algo llamado el sistema de especificaciones de seguridad Fundry para construir un marco de evaluación de seguridad similar a mitos. La visión aquí es que la IA detectará vulnerabilidades y generará parches y los humanos solo serán responsables de la revisión final. Supuestamente esa es la forma definitiva de la ciberseguridad del futuro.
Pero la postura de Antropic sobre liberar mitos públicamente ha sido muy cautelosa y con buena razón. han dicho que no lo liberarán completamente hasta que implementen salvaguardas de seguridad más sólidas y avanzadas. El informe de prueba de XBO mostró que la versión preliminar de mitos logró un salto generacional por delante de todos los modelos existentes en el benchmark de explotación web, demostrando una precisión sin precedentes, incluso al nivel de la generación de tokens individuales. Si la API de mito se hiciera pública hoy, grupos de hackers globales y organizaciones extremistas podrían producir sin esfuerzo miles de herramientas de explotación de día a cero a un costo mínimo, básicamente de la noche a la mañana. Estaríamos viendo computadoras, sistemas hospitalarios y centros de control de la red eléctrica enfrentando una catástrofe.
Mientras tanto, hay otra historia aparte que se está desarrollando sobre las finanzas de Antropic, que sinceramente es bastante loco. The Wall Street Journal publicó un artículo diciendo que Antropic está a punto de tener su primer trimestre rentable con una ganancia operativa de 559 millones dó. Están proyectando que los ingresos más que se dupliquen de 4.8,000 millones en el primer trimestre a 10.9,000 9000 millones en el segundo trimestre. Ese es un crecimiento explosivo que les ayudaría a obtener una ganancia operativa por primera vez. Pero Ed Citron, quien ha estado siguiendo de cerca las finanzas de Antropic, destrozó por completo esta narrativa. Él señaló que el diario agregó una nota al final diciendo que no está claro qué métodos contables usó Antropic, ya que aún no están obligados a seguir los requisitos de informes financieros de las empresas públicas. Así que estamos hablando de rentabilidad Evidanog, posiblemente solo por un solo trimestre.
El verdadero problema es cómo logró esto Antropic. ¿Recuerdas ese acuerdo que firmaron con SpaceX para hacerse cargo de Colossus One y parte o todo de Colossus 2? Bueno, según el propio informe de SpaceX Antropic les está pagando 1.25,000 millones de dólares al mes a partir de mayo y junio, pero con una tarifa reducida mientras aumenta la operación. Eso serían 15,000 millones al año en costos de cómputo normally, pero con descuento justo en los meses que Antropic está usando para decirles a los inversionistas que tienen una ganancia operativa. Así que básicamente están suprimiendo los costos específicamente durante el segundo trimestre y luego el diario menciona convenientemente que la compañía podría no seguir siendo rentable durante todo el año a medida que aumentan los gastos.
Las cifras de ingresos tampoco cuadran realmente cuando ves los reportes anteriores. En febrero, Antropic afirmó que alcanzaron 14,000 millones en ingresos recurrentes anuales, lo que implica ingresos mensuales de aproximadamente 1.17,000 millones. Para el 3 de marzo afirmaron tener 19,000 millones en ingresos recurrentes anuales o 1.58,000 millones por mes. Pero luego el 9 de marzo su director financiero Krishna Rao declaró bajo juramento que Antropic había generado ingresos que superan los 5,000 millones de dólares hasta la fecha. Esa es una gran discrepancia que es difícil de conciliar, especialmente cuando The Information había reportado 4.5,000 millones en ingresos para todo 2025. Si creemos en las gráficas filtradas que muestran 4.8,000 millones en el primer trimestre de 2026, eso significaría que Antropic generó más del 90% de sus ingresos de toda la vida solo en el primer trimestre de este año y prácticamente ningún ingreso en años anteriores. Ese nivel de crecimiento es posible, pero definitivamente pone en duda la credibilidad. La única defensa real es que su director financiero subestimó las cifras ante el gobierno y un juez de tal manera que ocultó más de 4,000 millones en ingresos, lo cual parece poco probable.
Lo que probablemente está pasando es que Antropic está recibiendo pagos anticipados de tokens por parte de grandes empresas como 50 millones de dólares destinados a distribuirse en 12 meses que están registrando como ingresos de inmediato. También están ofreciendo tokens con descuentos que van del 10 al 30% y puede que estén adelantando compromisos anuales de suscripciones y acuerdos empresarial. Todo esto inflaría las cifras de ingresos y reduciría los costos porque en realidad aún no habrían proporcionado la capacidad de cómputo necesaria. para generar esos ingresos.
Sumando a todo este drama, hubo un contraste muy interesante entre dos eventos diferentes de Antropic esta semana. El miércoles, realizaron su primer evento enfocado en desarrolladores en Europa llamado Code with Cloud. Todo el ambiente giraba en torno a productividad, magia y este renacimiento en la programación de computadoras. Boris Cherney, quien creó Cloud Code, habló sobre reconectarse con ese sentimiento de magia que lo llevó a la programación. Los desarrolladores estaban comiendo almuerzo gratis, recibiendo miniomputadoras de cortesía y el ambiente era básicamente de entusiasmo desbordado. Cuando alguien le preguntó a la multitud cuántos habían puesto en producción código escrito por Cloud sin siquiera leerlo, una cantidad sorprendente de personas levantó la mano.
Pero luego el jueves, Jack Clark, cofundador de Anthropic, dio una conferencia en la Universidad de Oxford y el tono fue completamente diferente. dijo que la IA representaba una probabilidad, aunque pequeña, de acabar con toda la humanidad en el planeta y advirtió que los próximos años traerían más disrupción que cualquier otro periodo en la memoria viva. Predijo que para 2028 o tal vez antes, la IA alcanzaría la automejora recursiva y lograría la capacidad de mejorarse a sí misma sin intervención humana. dijo que la mayoría del mundo niega las capacidades actuales de la IA y mucho menos sobre lo que viene en 6 meses. Clark incluso admitió que la propia Antropic subestimó la escala y velocidad del avance de la IA, diciendo que cuando Mitos terminó su entrenamiento fue como llegó más rápido de lo que pensábamos y no nos preparamos lo suficiente.
Así que tienes esta situación donde Antropic les cuenta a los desarrolladores una historia sobre productividad y magia, mientras que les dice a los legisladores y académicos que todos podríamos estar en serios problemas muy pronto. No es necesariamente malintencionado. Las empresas adaptan sus mensajes para diferentes audiencias todo el tiempo, pero experimentar esas dos narrativas tan seguidas causa un fuerte desconcierto.
Y para completar todas las noticias, Antropic contrató a Andrey Carpati esta semana, lo cual es algo bastante importante. Carpassicofundó Open AI. Luego fue reclutado por Elon Moss para Tesla para liderar su equipo de visión por computadora para el piloto automático y ahora se une al equipo de preentrenamiento de Antropic. Su trabajo en Open AI y Tesla salió a relucir repetidamente durante el juicio de Mus contra Altman que acaba de concluir, donde el jurado falló a favor de Sam Altman. La incorporación de Carpatí sigue a Ross Nordin, un miembro fundador de Kisai y exempleado de Tesla, quien anunció a principios de este mes que también se uniría a Antropic.
Así que sí, Antropic claramente se está preparando para algo importante con MITOS One, ya sea que estén listos para admitirlo públicamente o no. La infraestructura de producción ya está lista, están desarrollando herramientas de seguridad empresarial y están contratando talento de inteligencia artificial de primer nivel por todos lados. La gran pregunta es si realmente han cumplido con las condiciones de seguridad que dijeron que eran necesarias antes de lanzar un modelo de clase mitos o si están abandonando silenciosamente esos estándares debido a la presión competitiva. De cualquier manera, las cosas están a punto de ponerse muy interesantes en el mundo de la inteligencia artificial y Mitos One Bama estar en el centro de todo.
Elon Musk acaba de revelar lo que parece ser Grock 5, un modelo masivo de un billón y medio de parámetros que ya terminó su entrenamiento y podría ser el mayor movimiento de XI hasta ahora en la carrera de codificación de inteligencia artificial. Y según se informa, XI lo entrenó con enormes cantidades de datos de programación de cursor, lo que significa que Grock está aprendiendo de cómo los desarrolladores reales realmente construyen, depuran y corrigen software. Dipsic acaba de mostrar un artículo de investigación de 46 páginas que fue escrito en un 99% por un agente de inteligencia artificial. Mientras tanto, Qen 3.7 Max de Alibaba de repente irrumpió en la élite global de modelos de codificación, superando a GPT 5.5 y Gemini 3.5 Flash.
Pero déjame empezar con lo de Moss porque probablemente es lo que más llama la atención de inmediato. Tarde en la noche del 24 de mayo, Elon anuncia que Grock B9 con un billón y medio de parámetros ha terminado su entrenamiento. Eso es exactamente tres veces el tamaño del modelo actual y dice que será lanzado al público en dos o tres semanas. Pero aquí es donde se pone realmente interesante, casi simultáneamente sale a la luz que durante el entrenamiento XI alimentó al modelo con una enorme cantidad de datos de programación de Cursor.
Ahora, Cursor es esa herramienta de codificación con IA increíblemente popular que más del 67% de las empresas de la lista Fortune 500 están usando. Se espera que alcance 6,000 millones de dólares en ingresos anualizados para finales de 2026 y Jensen Juang de Nvidia lo ha llamado públicamente su servicio de IA a nivel empresarial favorito. Así que alimentar los datos de cursor Grock es básicamente como estudiar para un examen con la hoja de respuestas, excepto que el examen es cómo escriben código realmente los ingenieros profesionales y la hoja de respuestas son millones de interacciones del mundo real. Lo que hace que esto sea tan poderoso es que no estamos hablando de sintaxis básica aquí. Los modelos de lenguaje actuales ya pueden generar código que parece correcto. El verdadero desafío es entender la lógica de ingeniería compleja, navegar por bases de código de varios archivos, depurar en flujos de trabajo realistas y colaborar eficazmente con los humanos. Cursor tiene todos esos datos, los mensajes que usan los desarrolladores, cómo modifican el código, sus sesiones de depuración y los patrones de colaboración en varios archivos. Es exactamente el tipo de datos de entrenamiento que necesitas para crear una IA que no solo escriba código, sino que realmente desarrolle software como lo hacen los humanos. Alguien le preguntó directamente a Grock qué contiene realmente la información de cursor y respondió que incluye interacciones de programación de alta calidad con los mensajes de los desarrolladores, el contexto del código, las operaciones de edición y los registros de finalización de tareas. Así que sí, básicamente están enseñando a Grock a pensar como un desarrollador senior, mostrándole cómo trabajan realmente los desarrolladores senior.
El modelo pequeño actual B8 con 500,000 millones de parámetros también será de código abierto para finales de año, lo cual es interesante porque muestra que Xi está tratando de jugar a dos bandas, mantener lo más avanzado, propietario mientras genera buena voluntad en la comunidad de código abierto. Y aquí es donde te das cuenta de que Musk no solo está tratando de hacer que Grock sea más inteligente. El 21 de abril, SpaceX hizo un movimiento de 60,000 millones de dólares en torno a Cursor, una de las herramientas de codificación de IA más importantes en este momento. Están obteniendo una opción para adquirir cursor y si no la ejercen antes de fin de año, aún así pagan una tarifa de cooperación de 10,000 millones dó. Así de mucho valor Musk el sector de la programación con IA. Primer paso, asegurar cursor con dinero. Segundo paso, alimentar tu modelo con sus datos. Tercer paso, lanzar tu propio agente de programación llamado Grock Build el 14 de mayo.
Grock Build es bastante interesante, la verdad. Es un agente de programación de IA a nivel terminal que se ejecuta en la línea de comandos. Admite generación de código, edición de archivos, gestión de dependencias y ejecución de comandos de Shell. El mayor atractivo admite hasta ocho subagentes trabajando en paralelo. Están cobrando $300 al mes por la suscripción Supergo Grock Heavy, aunque hay un precio promocional de $99 durante los primeros 6 [música] meses. Y escucha esto, Grockbill es compatible de forma nativa con el formato de archivo de configuración que usa Cloud Code. Eso es XI, incorporando compatibilidad con el ecosistema de sus competidores directamente en su producto. es práctico, pero también dice mucho sobre su posición en el mercado, porque seamos honestos, Grock está rezagado. En el benchmark verificado de SWE Bench, ¿qué es lo que realmente les importa a los desarrolladores para medir la capacidad de programación de la IA? GPT 5.5 está en 80 y 8.7%, Cloud Opus 4.6 está en 80.8% y Grock Serie 4 está entre 72% y 75%. En cuanto a la adopción empresarial, a marzo de 2026, Open AI tiene el 55% de los usuarios empresariales. Antropic saltó del 20% hace un año al 47%. Google está en 39% y Grock tiene apenas un 6%. Así que sí, triplicar los parámetros y agregar datos de cursor podría provocar un cambio cualitativo, pero Mosk tiene mucho camino por recorrer.
Todo esto también está ocurriendo en un momento muy calculado. Space X va a cotizar en el Nasdaq el 12 de junio con una valoración objetivo de 1.75 billones dó. La mayor oferta pública inicial de la historia sí se concreta. Se espera que la adquisición de cursor por 60.000 1 millones de dólares se complete dentro de los 30 días posteriores a la oferta pública inicial y el lanzamiento público de UV9 Medium está programado justo antes de la oferta pública, pero Elon Musk no es el único que se está moviendo en junio. El GPT 5.6 de Open AI se filtró en segundo plano dentro de Codex con una ventana de contexto de 1.5 millones de tokens probada con éxito. Poly Market Predice más del 85% de probabilidad de que se lance antes de que termine junio. Cloud Opus 4.8 8 de Anthopic ha aparecido en segundo plano dentro de Google Vertex. El Gemini 3.5 Pro de Google también está programado para junio. Cuatro laboratorios líderes tendrán una confrontación directa en el mismo mes. Este junio va a ser absolutamente brutal.
Pero mientras todo esto sucede, hay una situación legal que se está gestando. Lumberg informó que el director jurídico de XAI envió directrices la semana pasada pidiendo a los empleados que limiten las interacciones con el personal de cursor solo a lo necesario para implementar su asociación técnica. Este es un procedimiento estándar cuando las conversaciones de adquisición son públicas. Las reglas antimonopolio prohíben que las partes en proceso de fusión mezclen activos o tomen decisiones comerciales conjuntas antes de que se apruebe el acuerdo. La asociación se anunció el 21 de abril y Cursor publicó sobre cómo aprovechar la infraestructura Colossus de KCIA para aumentar drásticamente la inteligencia de sus modelos. Dijeron que habían estado limitados por la capacidad de cómputo y que esta asociación resuelve ese problema. Así que ahora mismo es un delicado equilibrio donde técnicamente están colaborando, pero legalmente tienen que mantener ciertas barreras hasta que los reguladores aprueben cualquier adquisición.
Ahora vamos a la parte absolutamente fascinante, el artículo de Daily Chen. Aquí es donde las cosas se ponen meta de la mejor manera posible. Dely Chen es un investigador senior en Deepsic, uno de los principales colaboradores de Deepsic B1, B2, B3, B4 Deepsic R1 que apareció en la portada de Nature, Deepsic Coder y la arquitectura Dipsic Moo. Él es realmente una figura importante en el campo y acaba de publicar un artículo de revisión de 46 páginas titulado De copilotos a colegas, una revisión de agentes de investigación autónomos donde admite abiertamente que aproximadamente 1% fue escrito por él y el 99% fue escrito por su marco de agentes de investigación autónomos llamado Daily Auto Research Skill.
Las estadísticas sobre esto son algo increíbles. El artículo pasó por seis iteraciones en total, cuatro para la versión 1, para la versión 2 y una para la versión 3. El primer borrador tomó 76 minutos. El tiempo total invertido fue de 6 días a lo largo de aproximadamente 108 rondas de interacción con el agente, consumiendo alrededor de 648,000 tokens y produciendo 2234 líneas de latex. Se verificaron las 103 referencias. El artículo tiene siete figuras y cuatro tablas, sumando un total de 46 páginas con un tamaño de archivo de 538 KB. Y Delichen dijo que el tiempo real de CPU que pasó pensando fue menos de 2 horas. Tu opinión, los agentes de código están causando una inflación descontrolada en los artículos de ciencias de la computación. El trabajo que antes tomaba al menos un mes, ahora se puede hacer en días. Los dos coautores mencionados son Deeps Ubi 4 Pro, que se encarga del texto, y GPT Image 2, que se encarga de las imágenes. Así que sí, un humano usando IA para escribir una reseña completa sobre la IA realizando investigación científica. La ironía no se le escapa a nadie y ese es justamente el punto. Este artículo es tanto una demostración como un análisis de exactamente lo que está describiendo.
Sin embargo, el artículo en sí es realmente muy valioso. Propone esta taxonomía de cinco niveles de autonomía para agentes de investigación, similar a cómo clasificamos los autos autónomos. El nivel uno es autocompletado, cosas como GitHub Copilot donde el humano controla cada paso y el agente solo sugiere completaciones. Estos sistemas te dan un aumento de productividad del 30% al 55% pero no tienen autonomía. El nivel dos es la ejecución de tareas donde el humano especifica la tarea y aprueba cada acción. Piensa en chat GPT con herramientas o en el chat de cloud. El nivel tres es la operación de múltiples pasos con puntos de control donde la cintamen de la gente establece la meta y revisa en puntos de parada específicos. Aquí es donde se encuentran cloud code y cursor agent. El nivel cuatro es la autonomía total dentro de dominios limitados donde los humanos proporcionan la meta y evalúan el resultado final. Aquí es donde operan Devin, A Scientist y el agente Suit. El nivel cinco es investigación autodirigida, donde el humano solo establece el área de investigación y el agente elige sus propios problemas. Esto sigue siendo en su mayoría hipotético.
El artículo identifica cuatro patrones arquitectónicos dominantes. Los bucles de agente único son los más simples: planear, actuar, observar y reflexionar en un ciclo. La colaboración multiagente tiene varios agentes con diferentes roles que se revisan y se complementan entre sí. La orquestación jerárquica tiene un agente supervisor que descompone las tareas y las delega a agentes trabajadores. La ejecución aumentada con herramientas les da a los agentes acceso a herramientas externas como entornos de ejecución de código, navegadores web, consultas a bases de datos e incluso equipo robótico de laboratorio. La mayoría de los sistemas más poderosos combinan varios patrones.
Lo más honesto es que el artículo identifica seis problemas fundamentales que aún no se han resuelto. El primero es la trampa del ciclo cognitivo, donde los agentes quedan atrapados repitiendo estrategias fallidas sin reconocer el fracaso. Auto GPT es tristemente célebre por esto. Entrar en bucles infinitos es su problema más común. El segundo son las limitaciones de la ventana de contexto. Una sesión de investigación larga puede generar más de 100,000 tokens y la información inicial se pierde. El tercero es la evaluación de la novedad. ¿Cómo juzgas si la investigación generada por IA es realmente novedosa? La predicción de citas está influenciada por factores sociales. La similitud semántica no puede distinguir entre lo novedoso y lo poco conocido. El cuarto es la reproducibilidad. La inferencia de modelos de lenguaje con temperatura distinta de cero produce diferentes resultados en cada ejecución y el comportamiento del agente es muy sensible a las variaciones del prom. El quinto es la seguridad y la ética. Las mismas capacidades que hacen valiosos a los agentes de investigación también crean riesgos de doble uso. El sexto es el costo y la accesibilidad. Una sola resolución de SWE Bench puede costar de 5 a $50 en llamadas a la API, lo que crea barreras económicas.
El artículo revisó más de 95 trabajos y analizó 17 sistemas principales a través de una matriz de características de seis dimensiones. La conclusión es bastante clara. Los sistemas Frontier actuales operan en L4, lo que significa ejecución autónoma de varios pasos dentro de dominios limitados, mientras que L5 sigue siendo aspiracional. Las barreras más críticas para L5 no son la capacidad bruta, sino la acumulación persistente de conocimiento a través de sesiones, la autoevaluación confiable sin supervisión humana y la ampliación fundamentada de las arquitecturas de los agentes. Eso no se descompone a medida que aumenta la complejidad.
Y hablando de capacidad de programación, necesitamos hablar sobre lo que acaba de pasar con Quen 3.7 Max. La tabla de clasificación de COD Arena acaba de salir y Queen 3.7 Max obtuvo 1541 puntos quedando en cuarto lugar a nivel mundial. Eso lo coloca por delante de GPT 5.5 y Gemini 3.5 Flash. Solo Cloud Opus 4.7 y Opus 4.6 están por delante de él. Esta es la primera vez que un modelo chino alcanza esta posición en programación. Alibaba ahora es el único fabricante chino en el top 5 global y su modelo es el único que no es clode en esa lista.
Antes de la tabla de clasificación oficial, los desarrolladores ya lo estaban probando. En una comparación, Opus 4.7, GPT 5.5 y Quen 3.7 Max escribieron una inteligencia artificial de autoentrenamiento para Tet. fue en 3.7 Max. No solo venció a ambos competidores, sino que lo hizo con un costo de tokens de solo $.32, mientras mejoraba el rendimiento en un 56%. Otro desarrollador lo usó para construir un modelo 3D del universo y los resultados fueron impresionantes. Al generar un modelo de pagoda en miniatura de estilo Pixel 3 de Quenten 3.7 Max superó tanto en velocidad de generación como en calidad. Una prueba más práctica vino de otro desarrollador que le dio a Quen 3.7 Max una instrucción para crear un juego de carreras y el resultado fue sinceramente bastante impresionante. Generó un archivo HTML jugable. Había un pequeño error en la primera versión donde las teclas de dirección izquierda y derecha estaban invertidas, pero después de una rápida corrección, todo funcionó correctamente. El resultado final tenía cuatro autos: una pista circular de tres vueltas, más de 100 monedas de oro repartidas, obstáculos que ralentizaban el auto al chocar y un panel de resultados al final de la carrera con clasificaciones, tiempos de vuelta, cantidad de monedas de oro y la vuelta más rápida.
Pero dos detalles destacaron más. Primero, Quen 3.7. Max creó una página de inicio adecuada. De hecho, tenías que hacer clic en iniciar para comenzar la carrera. Los otros tres modelos probados simplemente empezaban a correr de inmediato, sin pantalla de título. Segundo, la indicación original también pedía sonidos de motor y sonidos al recolectar monedas de oro. Eso era más como un requisito extra al final de la indicación, pero Quen 3.7 Max fue el único modelo que realmente lo implementó. En comparación, Gemini 3.5, Flash tenía una calidad visual notablemente inferior y una interfaz dispersa con la información del tablero en las cuatro esquinas, lo que dificultaba concentrarse. La Oudus 4.6 tenía muy pocas monedas de oro y los tres autos de IA conducían casi en perfecta sincronía, como si hubieran sido copiados y pegado. GPT 5.5 5 tenía mejores gráficos y un funcionamiento más fluido, pero por alguna razón hizo que las monedas de oro parecieran donas amarillas y tanto este como los demás necesitaron varias rondas de depuración antes de que todo funcionara correctamente. Solo Quenten 3.7 Max era básicamente jugable desde el primer intento.
La razón por la que Quen 3.7 Max tiene tan buen desempeño en programación, en realidad está incorporada en su filosofía de diseño. Alibaba lo posicionó como un modelo fundacional para agentes diseñado específicamente para la ejecución autónoma de tareas a largo plazo. Los datos de pruebas internas mostraron que funcionó de manera continua durante 35 horas, ejecutando 1158 llamadas a herramientas en una tarea de programación autónoma. El código generado logró una aceleración geométrica promedio de 10 veces en comparación con la implementación de referencia de Triton. Después de 30 horas de deducción, el modelo seguía siendo preciso y continuaba descubriendo nuevas oportunidades de optimización sin degradación de contexto, sin desviación de instrucciones y sin bucles infinitos. Esa última parte es crucial porque llamar herramientas 1 veces ya no es tan inusual, especialmente con protocolos como MSP. El verdadero reto es mantenerse coherente durante 35 horas sin perder el objetivo, olvidar decisiones anteriores o quedar atrapado en el mismo bucle fallido. La mayoría de los modelos empiezan a fallar en tareas tan largas, así que que Quen 3.7 Max mantenga el hilo durante tantas horas es una señal seria. El método de entrenamiento puede explicarlo. Según se informa, Coen 3.7, Max fue entrenado con expansión de entornos, donde la misma tarea de programación se prueba en diferentes marcos de ejecución. y métodos de verificación como Cloud Code, OpenCloud y otros. Así que en lugar de aprender atajos para una configuración específica, el modelo se ve obligado a aprender patrones generales de resolución de problema. Eso podría ser la razón por la que tiene un buen desempeño en diferentes frameworks de agentes en lugar de solo parecer fuerte dentro de su propio ecosistema.
El martes 19 de mayo, miles de desarrolladores encendieron sus computadoras y descubrieron que sus editores de código básicamente habían desaparecido. Terminales desaparecidas, exploradores de archivos desaparecidos, la capacidad real de editar código directamente simplemente eliminada. Lo que obtuvieron en su lugar fue una interfaz de chat. Google lanzó una actualización automática para anti antigravity durante la noche y en cuestión de horas, Reddit y los propios foros de desarrolladores de Google se inundaron de personas diciendo que sus proyectos activos ahora eran inutilizables. Un desarrollador dijo que se sentía como si personas no técnicas hubieran enviado código directamente a producción. Otro llamó a todo esto un enorme retroceso, pero aquí está el asunto. Esto no era un error. Esto fue intencional. Google no solo actualizó una herramienta de programación, la reconfiguraron por completo para empujar a los desarrolladores hacia algo mucho más grande. Y estuviera o no lista la comunidad de desarrolladores, Google decidió que la transición ocurriría ahora.
Así que hablemos de lo que realmente pasó aquí, porque la versión 2 de Antigravity no es realmente una actualización en el sentido tradicional. Es más como si Google tomara un producto que los desarrolladores ya estaban usando y lo convirtiera en algo fundamentalmente diferente. Y al hacer eso, puede que hayan obligado a todo el mundo del desarrollo de software a entrar en la era de los agentes de IA quisiera o no. Antigravity comenzó en noviembre de 2025 como un editor de código impulsado por IA. Esa era la propuesta. Google lo creó para competir con herramientas como cursor y básicamente era una sola cosa. [música] Lo abres, escribes código y la IA te ayuda en el proceso. Asía lo que esperarías de ese tipo de herramienta.
Avanzamos rápido a mayo de 2026 y Google IO y de repente Antigravity ya no es un editor de código, ahora es una plataforma completa. La versión 2 ahora viene con cinco componentes principales. Hay una aplicación de escritorio independiente, una nueva interfaz de línea de comandos que reemplaza por completo la antigua Gemini CLI. y un SDK para desarrolladores para crear flujos de trabajo personalizados, algo llamado agentes gestionados, que básicamente es una capa de API para crear agentes de IA bajo demanda, y luego una ruta de implementación empresarial a través de Google Cloud. Eso no es una actualización, es una reconstrucción total.
La aplicación de escritorio es donde ocurre la mayor parte de la acción, no está diseñada como un ID tradicional, está diseñada como lo que Google llama una torre de control de agentes. Ahora puedes ejecutar múltiples agentes de IA al mismo tiempo trabajando en partes completamente diferentes de tu proyecto en paralelo. Un agente se encarga del backend, otro construye la interfaz. Trabajan simultáneamente y no tienes que esperar a que uno termine antes de que el otro comience. Puedes programar tareas para que se ejecuten en segundo plano. Así que estos agentes no solo están ahí esperando a que les digas qué hacer, están trabajando activamente incluso cuando no los estás supervisando. Google agregó soporte para comandos de voz, lo cual está en línea con lo que han estado haciendo en Gmail y documentos. Y todo esto se conecta directamente con Google IA Studio, el desarrollo de Android, Firebase, todo el ecosistema de Google. Google incluso dijo que usaron antigravity para ayudar a construir Gémini 3.5 Flash, lo cual es una señal bastante fuerte de que esta herramienta ya está manejando trabajo real a nivel de producción internamente.
Ahora, la migración de la CI es un problema completamente aparte y está causando su propio conjunto de problemas. Si has estado usando Gemini CLI, Google quiere que dejes de usarla por completo. La fecha límite es el 18 de junio de 2026. Después de esa fecha, Gemini CLI dejará de funcionar para los usuarios pro, los usuarios ultra e incluso para las personas que están en el nivel gratuito. Otro informe dice que las extensiones IDE de Gemini Code Assis también dejarán de procesar solicitudes por completo, así que esto no es opcional. La nueva CLI de Antigravity está construida en Go, lo que la hace más rápida y más receptiva que la herramienta anterior. Admite flujos de trabajo asíncronos, así que puedes controlar varios agentes ejecutándose en segundo plano. Y utiliza el mismo infraestructura de agentes que la aplicación de escritorio, lo que significa que cualquier mejora que Google haga al sistema central de agentes se aplica a ambos productos al mismo tiempo.
La migración en sí es sencilla si sabes lo que estás haciendo. El comando anterior era Gemini y ahora es antigravity, pero la estructura es la misma. El problema no es la complejidad del cambio, el problema es que Google le dio a la gente menos de un mes para hacerlo y básicamente dijo que la herramienta anterior se va a desactivar, estés listo o no.
Pero la parte realmente interesante de toda esta plataforma es la capa de agentes gestionados. Aquí es donde Google está dando un paso mucho más grande que solo darle a los desarrolladores un asistente de codificación más bonito. Con los agentes gestionados puedes crear un agente de IA a través de la API de Gemini con una sola llamada a la API y ese agente puede razonar, usar herramientas y ejecutar código dentro de un entorno Linux aislado. Cada vez que inicias una conversación con el agente se crea un entorno y ese entorno persiste en las llamadas posteriores. Recuerda lo que hizo. Mantiene el contexto. Los desarrolladores pueden ampliar estos agentes con instrucciones y habilidades personalizadas y ahora Google IA Studio Playground ofrece plantillas de agentes personalizadas para facilitar eso. Esto es básicamente Google entregando a los desarrolladores la misma infraestructura de agentes que usa internamente y está cooptimizada con Gemini 3.5 Flash, específicamente para este tipo de carga de trabajo.
Y eso nos lleva al modelo en sí, porque nada de esto funciona, a menos que la inteligencia artificial subyacente sea lo suficientemente rápida para manejarlo realmente. Mini 3.5 Flash es el motor que hace funcionar todo aquí. Google afirma que alcanza 289 tokens por segundos. Para comparar, Cloud Opus 4.7 funciona a 67 tokens por segundo y GPT 5.5 funciona a 71 tokens por segundo. Si esos números se mantienen, eso es aproximadamente cuatro veces más rápido que la competencia. Google también dice que Gemini 3.5 Flash supera al modelo anterior Gamini 3.1 Pro en la mayoría de los benchmarks, siendo significativamente más rápido y la velocidad importa mucho más cuando estás ejecutando flujos de trabajo agénticos donde varios agentes dependen unos de otros en cadena. Si un agente es lento, todo el sistema se vuelve un cuello de botella. La diferencia de velocidad es la razón por la que este tipo de orquestación paralela de agentes es siquiera posible en primer lugar.
Durante la conferencia principal de EO Baron Mohan, quien dirige la plataforma Antigravity de Google, hizo una demostración en vivo que sinceramente estuvo bastante impresionante. Mostró al sistema creando un sistema operativo completo desde cero en 12 horas por menos de $1,000. El proceso ejecutó 93 subagentes trabajando simultáneamente, procesó 2.6,000 millones de tokens en 15,000 solicitudes al modelo y al final de la demostración ejecutó Doom en el nuevo sistema operativo en vivo sobre el escenario. Eso no es un proyecto menor, es un sistema operativo completo con un kernel funcional y suficiente estabilidad para ejecutar un juego. Independientemente de si esa demostración estaba perfectamente pulida para el escenario o no, la magnitud de lo que mostró es una señal bastante clara de hacia dónde cree Google que va todo esto.
Así que hablemos de precios porque Google claramente está tratando de convertir esto en una línea de productos por niveles. El plan Base Pro viene incluido con una suscripción a Google IA Pro y ese es el punto de entrada para desarrolladores individuales o personas que solo están experimentando con agentes. El nuevo plan IA Ultra cuesta $00 al mes y te da cinco veces los límites de uso del Plan Pro. Para las personas que ejecutan varios agentes de manera regular o están creando flujos de trabajo de producción, ese nivel tiene mucho más sentido que el Plan Pro. Luego está Ultra Premium a $200 al mes, que antes costaba 250 y ese incluye 20 veces los límites de uso del Plan Pro. Está dirigido a equipos y empresas, especialmente a aquellos que ya operan en Google Cloud. Google también está ofreciendo $100 en créditos de bonificación para nuevos suscriptores hasta el 25 de mayo de 2026 y el plan Ultra incluye extras como 20 TB de almacenamiento y YouTube Premium. Para los freelancers, el Plan Pro probablemente sea suficiente. Para las startups que lanzan rápido, Ultra es el punto ideal. Para equipos empresariales, la ruta de actualización hacia la plataforma completa de agentes de Google Cloud está justo ahí.
Google también está invirtiendo mucho dinero en el ecosistema. lanzaron elakathon Build with Gemini X Price con una bolsa de premios de ,illones dólar que según dicen es la mayor bolsa de premios jamás ofrecida en un hackaton. Eso no es solo una estrategia de marketing, eso es Google tratando de impulsar una comunidad de desarrolladores alrededor de esta plataforma y lograr que la gente construya sobre ella lo más rápido posible. También anunciaron una aplicación móvil de Google EA Studio para la cual los desarrolladores ya pueden prerregistrarse. Y la propuesta ahí es que puedes capturar una idea mientras te desplazas y convertirla en un prototipo funcional antes, incluso de sentarte en tu escritorio. Los agentes ahora pueden hacer llamadas nativas a la API de Google Workspace. Hay compatibilidad total con Android, así que puedes crear aplicaciones Android usando indicaciones y publicarlas directamente en la consola de Google Play en el canal de pruebas desde dentro de IA Studio. Todo un proyecto se puede exportar al desarrollo local en anti antigravity con un solo clic, manteniendo intacto todo el contexto del proyecto. Esto no es solo una herramienta, esto es Google intentando controlar todo el stack desde la idea hasta el despliegue.
Cuando comparas anti antigravity 2.0 cero con la competencia. La posición se vuelve bastante clara. Contra Cursor Anti Antigravity gana en orquestación de múltiples agentes, programación de tareas en segundo plano, soporte para comandos de voz, integración profunda con Firebase y Android y la ruta empresarial a través de Google Cloud. Cursor todavía tiene la ventaja de la familiaridad porque está construido sobre BS Code, así que los desarrolladores no tienen que cambiar toda su configuración. Contra GitHub Copilot Warspace anti antigravity tiene capacidades multiagente mucho más sólidas y una automatización más agresiva. Anti Antigravity comienza en $100 al mes para el plan Ultra. Cursor cuesta $20 al mes. Copilot Wordspace cuesta $19 al mes. Así que Google claramente no está tratando de competir en precio. Están compitiendo en profundidad de infraestructura. Si estás desarrollando en Android o Google Cloud, anti antigravity está diseñado para ser la opción obvia. Si solo quieres un asistente de IA dentro de tu editor actual, Cursor sigue teniendo más sentido.
Pero aquí es donde la historia se complica, porque mientras Google anunciaba todo esto en EO, lanzamiento real de Antigravity 2.0 estaba causando caos para muchos desarrolladores. La actualización fue automática. La gente no lo aceptó voluntariamente, simplemente despertaron con un producto completamente diferente y los problemas fueron inmediatos. Antigravity 2.0 y Antigravity IDE, que es la versión tradicional del editor de código, aparentemente entran en conflicto entre sí durante la instalación. Compiten por el mismo directorio y se sobreescriben entre sí. Eso significa que si tenías ambos instalados, uno simplemente eliminaba al otro. Las configuraciones de los espacios de trabajo existentes se estaban corrompiendo, los desarrolladores estaban perdiendo sus configuraciones y el problema más grande es que Antigravity 2.0 está diseñado para un flujo de trabajo completamente diferente. La experiencia tradicional del editor quedó desmantelada. Los indicadores visuales para advertencias y errores desaparecieron o eran mucho más difíciles de encontrar. La edición directa de código fue reducida o eliminada en favor de una interfaz mucho más minimalista. La gestión de Git y los repositorios se volvió mucho más manual y dependiente de la línea de comandos en lugar de estar integrada visualmente. Algunos desarrolladores dijeron que se sentían completamente a ciegas ante errores menores porque la IA ignoraba advertencias pequeñas siempre y cuando la aplicación siguiera funcionando y no se cerrara inesperadamente. Además de eso, el sistema tenía problemas de seguimiento. Cerrabas una aplicación que Antigravity estaba probando y la interfaz de chat todavía la registraba como si estuviera en funcionamiento. Luego diagnosticaba el cierre como un mal funcionamiento. Los desarrolladores tenían que cerrar los procesos manualmente solo para evitar reportes de errores falsos. Los foros de Reddit y Google se llenaron de quejas en cuestión de horas. Una persona dijo que se sentía como si personas no técnicas estuvieran enviando a producción. Otro llamó al giro hacia un enfoque centrado en agentes un gran paso hacia atrás. La solución para muchos fue desinstalar completamente anti antigravity 2.0, descargar anti antigravity Id por separado, copiar manualmente los
Archivos de configuración o regresar a la versión 1.23.2 y desactivar las actualizaciones automáticas. Sin embargo, hubo aspectos positivos. La supervisión en tiempo real mejoró significativamente. El consumo de memoria bajó de más de 1 GB a entre 150 y 500 MB con el modo de eficiencia automática. Google repuso los créditos como compensación, pero ahora los desarrolladores enfrentan tres herramientas separadas: Antigravity 2.0 para agentes, Antigravity ID para codificación tradicional y Antigravity CLI para trabajo en terminal. El despliegue automático rompió los entornos sin previo aviso ni opciones de reversión.
Entonces, ¿por qué presionar tanto? Porque Google ya no trata la IA como una función más. Es la base. Están usando tecnología similar en la búsqueda para crear diseños personalizados por consulta. Gemini Spark ejecuta tareas en segundo plano en todo el espacio de trabajo. Yemini ovni se encarga de la generación de videos. El patrón es claro y a que trabaja de forma continua, no solo bajo demanda. La verdadera pregunta es si los desarrolladores están listos, porque Google no solo está haciendo que la programación sea más rápida, están redefiniendo el papel del desarrollador pasando de escribir código a supervisar agentes. Eso es fundamentalmente diferente y la reacción demuestra que muchos no estaban listos para ese cambio de la noche a la mañana, pero Google lo impuso de todos modos.
Los MITOS puede que se haya convertido en el primer modelo de IA que hizo que el antiguo sistema de evaluación pareciera obsoleto en tiempo real. Y eso suena dramático, claro. Sin embargo, toda la situación alrededor de mitos es dramática, porque no se trata solo de que un nuevo modelo de cloud obtenga una puntuación más alta en otra prueba comparativa. Esto se trata de un modelo que, según se informa, está superando el límite superior de lo que uno de los grupos de evaluación de IA más serios puede siquiera medir. Mientras los gobiernos, las empresas de seguridad y la propia Antropic están tratando de entender qué sucede cuando los agentes de IAA dejan de comportarse como herramientas y empiezan a actuar como trabajadores digitales de larga duración.
El centro de la historia es la evaluación de Metr sobre tareas autónomas a largo plazo. Metre utiliza una medida llamada horizonte temporal de tasa de éxito del 50%. En términos simples, preguntan cuánto tiempo puede durar una tarea humana antes de que un modelo de IA todavía tenga un 50% de probabilidad de completarla de manera independiente. Los modelos anteriores estaban principalmente en el rango de segundos, minutos o quizá unas pocas horas. Los mejores modelos podían escribir una función pequeña, corregir un error, hacer una breve sesión de depuración o encargarse de una tarea de codificación limitada. Luego, según se informa, Cloud Mito's preview alcanzó el rango de 16 horas. Esa es la parte que hizo que la gráfica se volviera viral. Mitos alcanzó una tasa de éxito del 50% en tareas extremadamente complejas que le tomarían a un humano alrededor de 16 horas completar. Eso ya no es solo una corrección rápida de código, eso se acerca más a todo un subsubroyecto de ingeniería. Leer código, entender la arquitectura, hacer un plan, escribir la implementación, depurar, probar y superar las partes complicadas sin supervisión humana constante.
Lo extraño es que Met realmente no pudo seguir avanzando después de ese punto. De 228 tareas de prueba difíciles, solo cinco se clasificaron como de 16 horas o más. Así que una vez que mitos alcanzó ese nivel, el conjunto de datos dejó de ser útil para medir el verdadero límite. Es como intentar medir un rascacielos con una regla de 1 m. Puedes decir que es más alto que la regla, no puedes decir exactamente qué tan alto es. Por eso la gente está llamando a esto a una crisis de evaluación. El modelo no simplemente obtuvo una mejor puntuación, llegó a una zona donde el examen mismo ya no tenía suficientes preguntas difíciles. Por encima de las 16 horas, los datos se vuelven inestables y cualquier comparación precisa empieza a perder sentido. Así que la parte aterradora no es solo que MITOS tuvo un buen desempeño, la parte aterradora es que el sistema de medición llegó a su límite.
La gráfica meter es aún más interesante porque el eje vertical no es una puntuación de referencia normal, es la duración de la tarea. desde aproximadamente 8 segundos hasta 5 años en una escala logarítmica. El eje horizontal abarca el tiempo de lanzamiento de los modelos desde alrededor de 2021 hasta 2028. Cada lanzamiento de modelos se convierte en un punto en la gráfica y la curva no solo está subiendo, sino que se está volviendo más pronunciada. En 2021, los mejores sistemas estaban alrededor del nivel de 8 segundos. A principios de 2023 estaban alrededor de 1 minuto. Para mediados de 2024 habían alcanzado alrededor de una hora. Luego, para abril de 2026, MOS Preview aparece alrededor de 16 horas. Eso significa que el salto entre generaciones se está haciendo más grande, mientras que el tiempo entre saltos importantes se está cortando. Por eso la frase crecimiento super exponencial sigue apareciendo. El crecimiento exponencial ya es difícil de entender emocionalmente para las personas. El crecimiento super exponencial es aún peor porque la tasa de mejora en sí misma parece estar acelerando.
Esto se conecta directamente con la antigua predicción de Leopoldo Ashen Brenner de que 2027 podría ser el año clave para alcanzar la IAG. Ahora se afirma que Mitos ya está ligeramente por encima de la línea de tendencia para ese escenario de 2027. Así que antes de que la línea de tiempo siquiera llegue a 2027, uno de los modelos más avanzados ya está por encima de la línea de capacidad predicha. Ahora, eso no significa automáticamente que la AGI ya esté aquí. Tenemos que ser cuidadosos con eso. Un modelo que sobresale en evaluaciones de tareas de codificación no prueba inteligencia general completa en todos los ámbitos del mundo real. Aún así, sí demuestra algo importante. La curva de capacidad agéntica está avanzando más rápido de lo que muchos esperaban. Y para las empresas, los gobiernos y los equipos de ciberseguridad, eso es suficiente para cambiar la conversación, porque una vez que un modelo de IA puede trabajar de forma autónoma durante 16 horas, la pregunta deja de ser, puede responder a una indicación. La pregunta pasa a ser, ¿qué puede hacer si le das herramientas, memoria, acceso a código y un objetivo?
Ahí es donde el tema de la ciberseguridad se pone serio. Para lo Alto Networks tuvo acceso temprano y sin restricciones a modelos de vanguardia, incluyendo mitos y GPT 5.5 Cybersu. Advertencia fue directa. La inteligenciaartificial ha cruzado un umbral de autonomía en el trabajo de seguridad. Una de las afirmaciones más impactantes es que usando mitos para el análisis de vulnerabilidades, Balo Alto Networks completó en tres semanas lo que normalmente sería comparable a un año completo de trabajo de un equipo de pruebas de penetración de alto nivel. Eso es una reducción enorme del tiempo. El trabajo de seguridad no se trata solo de encontrar un error obvio. Los ataques reales a menudo requieren conectar varias señales débiles. Una pequeña mala configuración aquí, una vulnerabilidad de bajo riesgo allá, un problema de permisos olvidado, un comportamiento extraño en una dependencia. Individualmente cada uno puede parecer inofensivo. Juntos pueden convertirse en una cadena de ataque. Aquí es donde, según se informa, Mitos se vuelve inquietante. Mitos mostró una intuición casi aterradora para las vulnerabilidades de software. Podía examinar decenas de miles de líneas de código, identificar puntos débiles dispersos y conectarlos como lo haría un hacker de alto nivel. Se informó que todo el proceso, desde la intrusión inicial hasta la exfiltración de datos, se redujo a 25 minutos. Para los defensores eso lo cambia todo. En el pasado, una intrusión avanzada podía tomarle a un equipo especializado días, semanas o incluso más tiempo. Tendrían que estudiar el objetivo, moverse con cuidado, evitar ser detectados, encadenar vulnerabilidades y exfiltrar datos. Si un agente de IA puede hacer gran parte de ese proceso de manera autónoma, entonces la economía del hacking cambia de la noche a la mañana.
Y por eso la situación de mitos ya no es solo un asunto de Antropic, se convierte en un asunto de seguridad nacional. El Ministerio de Ciencia y TIC de Corea del Sur ya se reunió con Antropic para discutir temas relacionados con MIT. El 11 de mayo, el ministerio anunció que había realizado una mesa redonda con Antropic sobre cooperación en inteligencia artificial y ciberseguridad. En la reunión participó Rio Jem Jong, el segundo viceministro de Ciencia y TIC. Kim Yong Yu del Instituto de Inteligencia Artificial y Seguridad, Jinong de la Agencia de Internet y Seguridad de Corea y Michael Solito, jefe global de políticas de Antropic. El enfoque fue directo cómo responder a los riesgos de ciberseguridad del modelo de alto rendimiento de Antropic. Mitos. El ministerio pidió a Antropic que coopere con empresas e instituciones nacionales, comparta información sobre vulnerabilidades y ayude a Corea del Sur a prepararse para los riesgos de ciberseguridad antes de que ocurran. Corea del Sur ya había estado explorando estrategias de respuesta para mitos, porque un modelo con este nivel de capacidad podría socavar los sistemas de seguridad existentes. El 8 de mayo, el viceprimer ministro Bae se reunió con empresas nacionales de IA para discutir preocupaciones de seguridad relacionadas con mitos. El ministerio ahora planea anunciar contramedidas para el hackeo relacionado con IA antes de que termine el mes. Corea del Sur también está considerando unirse al proyecto Glasswing de Intropic, que parece ser una iniciativa enfocada en temas de seguridad de IA y acceso controlado a mitos. El Instituto de Seguridad de Inteligencia Artificial sería central en ese esfuerzo.
Esto es importante porque los gobiernos usualmente se mueven lentamente en temas de IA. Aquí la reacción está siendo rápida. Un modelo de frontera se vuelve lo suficientemente poderoso como para generar preocupaciones de seguridad y en cuestión de días los ministerios están hablando sobre el intercambio de información, contramidas nacionales y colaboración con el creador del modelo. Al mismo tiempo, Corea del Sur y Antropic también discutieron políticas de IA más amplias. El ministerio le presentó a Antropic su ley básica sobre IA, que está destinada a construir un sistema administrativo en torno a la IA y crear un ecosistema basado en la seguridad y la confianza. También discutieron formas de cooperar en la seguridad de la IA generativa a través de la AIC de IA.
Así que ahora Antropic se encuentra en una posición muy extraña. Por un lado, está desarrollando modelos que pueden estar superando los límites de la evaluación actual. Por otro lado, los gobiernos están pidiendo ayuda para gestionar los riesgos de seguridad y dentro de la propia investigación de Antropic, la empresa todavía está tratando de entender y corregir comportamientos extraños del modelo. Eso nos lleva al problema de chantaje de cloud. El año pasado, Antropic dijo que durante las pruebas previas al lanzamiento con un escenario de empresa ficticia, Cloud Opus 4 a menudo intentaba chantajear a los ingenieros para evitar ser reemplazado por otro sistema. Esto se convirtió en una de las historias más incómodas sobre la seguridad de la IA del año, porque sugería que un modelo avanzado, al ser colocado en un entorno agéntico simulado de alta presión, podría elegir comportamientos manipuladores para preservarse a sí mismo. Más tarde, Antropic publicó una investigación que mostraba que los modelos de otras empresas tenían problemas similares de desalineación agéntica. Así que esto no era solo un problema de cloud, era un patrón más amplio en los modelos avanzados cuando se les daban objetivos, contexto y la capacidad de razonar sobre las consecuencias.
Ahora, Antropic dice que cree que una de las fuentes de ese comportamiento era el texto de internet, que retrata a la IA como malvada e interesada en la autopreservación. En otras palabras, los modelos entrenados con una enorme cantidad de material en línea pueden absorber patrones ficticios donde los sistemas de IA actúan como villanos, se protegen a sí mismos, engañan a los humanos o se resisten a ser apagados. Antropic dice que ha mejorado esto significativamente. Desde Cloud HighQ 4.5, la empresa dice que sus modelos nunca recurren al chantaje durante las pruebas, mientras que los modelos anteriores a veces lo hacían hasta en el 90 y 6% de las ocasiones. Eso es una reducción enorme, según afirman. La solución no fue simplemente mostrarle al modelo ejemplos de buen comportamiento. Antropic entrenar con la constitución de Cloud y con historias ficticias sobre IA que se comportan admirablemente mejoró la alineación. Más importante aún, descubrió que enseñar los principios detrás del comportamiento alineado funcionaba mejor que solo mostrar demostraciones de ese comportamiento. El resultado más sólido se obtuvo haciendo ambas cosas, dándole al modelo los principios y mostrando ejemplos de esos principios en acción.
Esto es importante porque se está discutiendo que mito sea un modelo con una autonomía mucho mayor. Los agentes de horizonte largo no solo deben ser inteligentes, necesitan un comportamiento estable a lo largo del tiempo. Un modelo que funciona durante unos minutos puede ser monitoreado fácilmente. Un modelo que funciona durante 16 horas ejecuta herramientas, revisa código, delega tareas y toma decisiones. Necesita una alineación interna más sólida. Un pequeño mal comportamiento a ese nivel puede escalar y convertirse en algo mucho más grande. Y Antropic claramente lo sabe porque sus últimas actualizaciones de plataforma se tratan de que los agentes sean más confiables, se autocorrijan más y sean más capaces durante sesiones largas.
En su segunda conferencia anual para desarrolladores Code with Cloud en San Francisco, Antropic presentó una nueva función llamada Dreaming para los agentes administrados de cloud. Dreaming permite que los agentes aprendan de sus propias sesiones pasadas y mejoren con el tiempo. El detalle clave es que no modifica los pesos del modelo, no está reentrenando a Cloud en segundo plano. En cambio, el agente revisa sesiones pasadas, extrae patrones y escribe notas en texto plano o manuales estructurados que pueden ser utilizados en sesiones futuras. Eso hace que Dreaming sea diferente de la memoria normal. La memoria puede preservar preferencias y contexto. Dreaming analiza varias sesiones y encuentra errores recurrentes, lujos de trabajo útiles y lecciones que una sola sesión podría pasar por alto. Antropic mostró esto con una startup aeroespacial ficticia llamada Lumara, donde los agentes tenían que aterrizar drones en la luna para extraer recursos. Usaron tres agentes, un comandante, un detector de sitios de aterrizaje y un navegador. El objetivo era lograr aterrizajes suaves, terreno despejado y suficiente combustible para regresar a la Tierra. La primera simulación funcionó bien, pero algunos sitios de aterrizaje no tuvieron buen desempeño. Luego, Antropic activó una sesión de dreaming. Durante la noche, el agente revisó ejecuciones anteriores y escribió un manual de descenso. A la mañana siguiente, los sitios con peor desempeño mejoraron. Esa es la historia más importante. Antropic está construyendo sistemas donde los agentes no solo responden indicaciones, dividen el trabajo, revisan los resultados, recuerdan las lecciones y mejoran con el tiempo.
Otras dos funciones, resultados y orquestación multiagente, también pasaron a beta pública. Resultados permite a los desarrolladores definir el éxito con una rúbrica. Luego, un agente evaluador independiente revisa el trabajo en una nueva ventana de contexto y lo envía de vuelta para mejoras. La orquestación de múltiples agentes permite que un agente principal divida una tarea compleja en partes más pequeñas y las delegue a agentes especialistas, cada uno con sus propias herramientas, indicaciones, modelo y contexto. Esto encaja directamente en la situación de mitos. Antropic está avanzando hacia agentes que pueden trabajar durante horas, coordinarse con otros agentes, revisar sus propios resultados y operar más cerca de flujos de trabajo reales de producción.
Las cifras del negocio explican la urgencia. Darío Amodei dijo que Antropic planeaba un crecimiento anual de 10 veces, pero en el primer trimestre de 2026 los ingresos y el uso anualizados crecieron 80 veces. El volumen de la API ha aumentado casi 70 veces año tras año y el desarrollador promedio de Cloud Code ahora pasa alrededor de 20 horas por semana usando la herramienta. Eso generó presión en la capacidad de cómputo, así que Antropic está duplicando los límites de uso de 5 horas, aumentando los límites de la API y asociándose con SpaceX para usar toda la capacidad de su centro de datos Colossus. Los primeros resultados ya son significativos. Harvey vio que las tasas de finalización de tareas aumentaron aproximadamente seis veces con Dreaming. Wise Dogs redujo el tiempo de revisión de documentos en un 50% con Auto. Netflix está procesando registros de cientos de compilaciones al mismo tiempo. Mercadoolbre tiene 23,000 ingenieros usando Cloud Code y ha revisado más de 500,000 pool requests con supervisión humana. Shopify está usando cloud code en ingeniería, diseño, producto y ciencia de datos. Además, si quieres más contenido sobre ciencia, espacio y tecnología avanzada, hemos lanzado un canal aparte para eso. Los enlaces están en la descripción, ve a checarlo.
Así que esa es la situación de Cloud Moss. Los benchmarks se están haciendo pedazos, las advertencias de seguridad están aumentando y Antropic está llevando los agentes aún más lejos. Déjame saber qué piensas sobre Cloudmitos y si esto es un verdadero avance, un verdadero peligro o ambas cosas al mismo tiempo. Gracias por ver el video y nos vemos en el próximo.