Transcription
De ser real, podría ser el inicio de la AGI, es decir, el momento en que la inteligencia artificial iguala el nivel de los humanos. Y si logra igualar nuestro nivel, de allá que lo supere, simplemente es un paso más.
Comienza a estudiar gratis programación e inteligencia artificial en .tteam y descubre por qué en español nadie explica mejor.
Google ha lanzado un paper que es una investigación científica que, según muchas personas en internet, podría cambiar la inteligencia artificial para siempre y sería un segundo momento. "Attention is all you need".
¿Qué cosa es "Attention is all you need"? Es un paper, una investigación científica que salió en 2017 y que fue el inicio de toda la inteligencia artificial que estamos viviendo ahora. ChatGPT, Gemini, Cloud, Yama, las inteligencias artificiales chinas, DIPSy, Wanking, etcétera. Todo eso nace con "Attention is all you need". Entonces, Google tiene las credenciales para decir: "Oigan, tómenlo en serio. Cuando yo saco un paper, no es poca cosa." Entonces, el hecho de que venga de Google, porque Google fue quien inició la IA actual, le da mucho peso a este paper.
El otro detalle es que este paper propone que el deep learning como tal no existe. El deep learning es la base de toda la inteligencia artificial que estamos viviendo. Ahorita les voy a explicar mejor cómo funciona, pero este paper propone que no existe. De hecho, el título dice "La ilusión del deep learning", o sea, es un título con un codazo, un título que viene con escupitajo, ¿no? "El deep learning es una ilusión", es un título irrespetuoso, irreverente, que viene a crear conflicto. Entonces, en parte, también eso ha elevado mucho el hype.
Y lo que dice, en pocas palabras, este paper, ahorita lo vamos a analizar a fondo, es que el deep learning como tal no existe y que los modelos de inteligencia artificial actuales son como una persona con amnesia, que no aprenden. Y ellos proponen una nueva arquitectura para que los modelos sí aprendan. Spoiler. Si esto fuera verdad, el tiempo lo dirá, porque sobre el papel tiene sentido. Ha sido revisado por pares. Les cuento que los papers son revisados por la comunidad científica. Cuando tú veas un paper, tienes que preguntarte: ¿ha sido revisado o todavía está en preprint? Es decir, una etapa previa a la revisión. Este paper ha sido revisado por la comunidad científica y ha sido aprobado para entrar a un evento super importante de temas de inteligencia artificial. Entonces, sí ha sido revisado, no es una propuesta al aire.
¿No se acuerdan el famoso paper de Apple en el que supuestamente la inteligencia artificial no pensaba y todos los vendeumos salieron a hacer sus videos? Y cuando pasó a la comunidad científica, destrozaron el paper, o sea, hicieron leña con ese paper. La gente se amarró a un paper que no había pasado por revisión. En cambio, este sí pasó por revisión. Es importante tener eso en cuenta.
Ahora, si fuera real lo que propone Google en este paper, veríamos en unos años ChatGPT, Gemini, Cloud, Yama y todas las demás como modelos tontos. ¿Te imaginas un futuro en el que veamos a ChatGPT como algo tonto, que en algún momento te rías y digas: "Wow, ¿cómo veíamos a eso como algo inteligente?" No puedo creer que para nosotros eso era inteligente. Que a tus hijos tú le digas un día: "Hijo, eso que ves ahí, para nosotros era..." Y tu hijo se ría. Diga: "¿De verdad? Si tú crees que es imposible, ya pasó." Pasó con Siri. Siri para nosotros era superinteligente y ahora Siri es una cosa tonta.
Entonces, en este video vamos a analizar de qué se trata este paper, cuál es el problema que supuestamente viene a resolver y vamos a lanzar algunas teorías a ver si realmente es lo que ellos prometen y qué podría pasar si esto ocurre. ¿Listo? Entonces, comencemos.
Hey, tú. ¿Sí, tú? ¿Te gustan nuestros videos? ¿Sabes dónde más encuentras esta calidad de explicación? En nuestros más de 250 cursos de tecnología e inteligencia artificial. Y lo mejor es que tenemos 50% de descuento para estudiantes como tú. Postula en ed.team/onalbecas y no te pierdas esta oportunidad. El link está en la descripción. Tú eliges si quieres cambiar tu vida hoy mismo o quedarte donde ya estás. Piénsalo. Ahora sí, continuamos con el video.
El paper se llama "Nested Learning, The Illusion of Deep Learning", es decir, aprendizaje anidado, la ilusión del deep learning, la ilusión del aprendizaje profundo. Para entender el paper, lo primero que tenemos que hacer, amigos y amigas, es entender cómo funciona el deep learning, porque si no, no van a entender nada. Porque lo que busca Google, bueno, no Google como empresa, ojo, es un grupo de investigadores dentro de Google Research, lo que busca Google es que el Nested Learning sea una evolución al deep learning. Por lo tanto, hay que entender qué es el deep learning y cuáles son sus limitaciones para poder entender si el Nested Learning realmente es tan importante.
Deep learning, traducción, aprendizaje profundo, es la evolución del ML, que sería el machine learning. Bueno, el machine learning realmente es todo. Más bien, digámoslo así. Digamos que machine learning es todo. El machine learning son las técnicas que hay, pues muchas técnicas para que las computadoras aprendan. Entonces, Nested Learning o deep learning serían formas de machine learning. ¿Okay?
Ahora, el deep learning nace en 1986. Sí, vamos a resetear hasta el día en que yo tenía 6 años. Yo nací en el 80. Imagínense, en 1986 aparece el deep learning con el premio Nobel Joffrey Hinton. ¿Y qué pasa? Antes de Joffrey Hinton, antes del deep learning, lo que había eran redes neuronales de una sola capa, ¿okay? Y a las redes neuronales teníamos que explicarles qué debían ellos reconocer. Por ejemplo, si queríamos que reconozcan, por ejemplo, un gato, tendríamos que decirle todas las características del gato, pero no en lenguaje natural. Recuerda que la IA en ese momento no entiende lenguaje natural, solo entiende matemáticas. Así que habría que convertir todas las características de un gato o de lo que sea que quieras que la reconozca a matemática. Algo increíblemente complejo. De hecho, si te pones a pensar, explicar las cosas cotidianas para nosotros es increíblemente difícil. Es muy complicado. Imagínate que un niño te diga: "Señor, ¿qué es el calor?" ¿Cómo le respondes? Los reto. Los reto de verdad. ¿Qué es el calor? Piénsenlo. Es muy difícil. Son cosas que nosotros ya las asumimos, pero explicarlas es muy difícil. Ahora, imagínate explicárselos a una computadora y en matemática. Es jodidamente difícil.
Entonces, Joffrey Hinton llegó con una idea llamada deep learning. El deep learning lo que hace es multicapa. Tienes una capa de entrada, tienes una capa de salida, in, out, okay, y tienes muchas capas al medio, las capas ocultas. Y cada capa se encarga de una tarea en específico. Por ejemplo, vamos a suponer que quieres reconocer gatos, entonces esta capa se encarga de la silueta, solo la silueta. Esta capa de acá se encarga, digamos, solamente de reconocer las orejas, porque las orejas de los gatos son puntiagudas y de los perros no. Pero hay algunos perros que levantan sus orejitas, ¿no? Entonces podrían confundirse. Entonces, vamos a decir que la siguiente se encarga del tamaño de las orejas. Así de específico. Y así podemos seguir con miles, millones y miles de millones de capas, ¿no? Cada capa hace una función. Y las capas, ¿qué son? Grupos de neuronas. Piensen las neuronas como empleaditos en una fábrica. Cada neurona hace una tarea y cada capa sería como un departamento de la fábrica. Y ellos se van conectando, las neuronas se van conectando. Seguramente habrán visto esos gráficos, ¿no?, donde hay muchas conexiones y esas conexiones que van desde el in hasta el out y por todas las capas ocultas intermedias, esas conexiones se llaman pesos o parámetros.
Bueno, entonces lo que propone Joffrey Hinton es: vamos a dividirlo en múltiples capas de tal manera que nosotros le damos un conjunto de datos y aquí en la salida están las respuestas, las respuestas etiquetadas. ¿Okay? Entonces, luego del entrenamiento, un entrenamiento inicial, nosotros le empezamos a dar datos y vemos si reconoció. Por ejemplo, le damos un gato y aquí al final está la respuesta etiquetada si es o no es un gato. Entonces, vamos a decir que la IA se equivocó y dijo: "No es un gato." Entonces hay una función que compara la respuesta de la IA con la respuesta etiquetada. Ese se llama loss function o función de pérdida. Esta función compara la etiqueta, la respuesta etiquetada, es decir, la respuesta correcta con la salida y encuentra algo llamado gradiente. La gradiente es qué tan lejos está de la respuesta correcta la red neuronal. Así como Perú, esto también es clave, la gradiente es clave. No se olviden de esto.
Repito: imagínense que esto sea un examen de universidad, ¿no? ¿Quién descubrió América? A, Cristóbal Colón, B, José de San Martín, C, este, no sé, Claudio Pizarro, etcétera. Pero las respuestas están etiquetadas. O sea, ya se sabe cuál es la respuesta. Tú no la sabes, pero cuando te evalúen tus respuestas y hay un sistema que sabe cuál es la correcta y va a comparar. En la IA es el loss function, la función de pérdida la que compara. No existe el concepto de true o false en la IA. En la IA, por ejemplo, si uno es true y false es cero, el out, este out de acá, no necesariamente es uno o cero. Puede ser 0.9. Es decir, es casi true, casi casi verdadero, pero hay un 0.1% de probabilidad de que sea false. O sea, no existe el true/false de la programación tradicional. Por eso calcula cuánto le faltó para llegar al resultado correcto y ese cuánto le faltó y hacia qué sentido hay que ajustar es la gradiente.
Vamos a suponer que el valor real, suponiendo nada más, era 10. Okay. Entonces el out acá me dio un 15. Okay. Entonces la gradiente me dice -5. ¿Por qué? Porque es 5, pero hay que restarle. Y si el out hubiera sido ocho, la gradiente sería dos positivo. O sea, no solamente es el valor, sino también la dirección en la que hay que ajustar.
Entonces, la gradiente se manda para atrás en un proceso llamado back propagation para volver a recalcular. Y este proceso de: "Okay, ya sé cuál es la gradiente, ajusto los pesos y vuelvo a comenzar." Imagínense que sea una cocina. En la cocina nosotros vamos a preparar una pizza. Los pesos serían cucharas de ingredientes, cuánta cantidad de harina, cuánta cantidad de tomate, etcétera. Y el loss function sería un juez, un juez que prueba la pizza al final y dice: "Está muy salada, está desabrida, está cruda, está quemada", ¿no? Y te dice cuánto tienes que ajustar. Y entonces eso que te dice el juez que tienes que ajustar, eso sería el gradiente que se envía de regreso al final y todos los cocineros vuelven a ajustar sus pesos en sus cucharas o sus tiempos de cocción o lo que sea, según lo que la función de pérdida haya dicho. Y entonces vuelven a comenzar el proceso y ese proceso se hace muchísimas veces hasta que llegue un punto en que se ajustaron los pesos.
Entonces, ese es el deep learning. Yo siempre lo explico de esta manera, que creo que mucha gente lo entiende rápidamente. Imagínate que tú eres sonidista y te toca un reggaetonero. El reggaetonero no canta nada, pero tiene un fajazo de billetes y dices: "Okay, business son business. Ven, te voy a hacer sonar bien." El reggaetonero empieza a cantar y tú, ay, Dios. Dices: "Sácas el autotune y tu autotune tiene 20 perillas y empiezas a ajustar las perillas." A ver, canta de nuevo. No, más arriba. Eso sería la gradiente. No, me falta más. Ajustas. A ver, cante nuevo. Eso sería otro otro ciclo, ¿se dan cuenta? No. A ver, cante nuevo. No, todavía vamos a ajustar eso. ¿Ves? Sería la gradiente. Hay que bajarle más. Esa sería la gradiente. Vamos a bajarle más. Cante nuevo. Hay que subirle este otro. Esa sería la gradiente. Hasta que llegue el punto en que encontraste el sonido y mágicamente el reggaetonero canta bien, pero tuviste que hacer como 50 o 100 intentos, ¿cierto?
En el momento en que encuentras que todo funciona bien, que que el reggaetonero canta bien, bloqueas todo. Le pones un letrero a tu consola donde dice: "No me lo toquen. Prohibido tocar bajo pena de muerte porque te te ha costado mucho trabajo ajustar los pesos, ¿sí o no?" Entonces, de la misma manera, cuando un modelo ya se entrenó, se bloquean los pesos, ya no se vuelven a ajustar. Ya se ajustaron muchas veces hasta llegar al punto en que ya sabemos que funciona.
Estas dos cositas, esto, la gradiente y los pesos que se bloquean, estos dos conceptos son clave para entender el Nested Learning.
Ahora vamos a hacer un salto rapidito en el tiempo. Este back propagation tenía un pequeño problemita. La función de pérdida dice: "Oigan, está muy quemada la pizza." O por ejemplo, el reggaetonero sigue cantando desafinado, súbele el agudo. Si el juez que está escuchando se comunica directamente con la persona que va a hacer la modificación, todo bien. Pero ahora supongan que yo le digo a Matías: "Matías, dile, eh, no sé, digamos, el diseño está mal porque ese no es el color." Matías se lo dice a Arnold. Matías dice que el color está mal. Arnold se lo dice, no sé, a a Joaquín, eh. Joaquín, creo que hay un color mal. Joaquín se lo dice, no sé, a Alexis. Alexis, me han dicho que hay un color que hay que cambiar. Alexis le dice a Beto: "Beto, me han hablado algo de un color." Y Beto finalmente le dice al diseñador: "Oye, hay un color que creo que no pusiste." ¿Se dan cuenta? El mensaje se va degradando, degradando el fumoso teléfono roto y al final el diseñador no sabe qué hacer y al día siguiente yo enojado digo: "¿Por qué no me han cambiado el color que dije?" ¿Se dan cuenta? Pero es que el mensaje llegó mal.
Entonces, ese es el gran problema de este concepto. Todo muy bonito sobre el papel. Por eso digo que también este paper de Google, este nuevo paper, muy bonito sobre el papel. Pongamos en práctica a ver, ¿no? Porque este caso también nació con un paper y en la práctica la gradiente se iba perdiendo. O sea, la gradiente ya sabes qué es, cuánto hay que ajustar para que te dé un buen resultado, pero sí se iba perdiendo, capa tras capa se iba perdiendo y acá prácticamente era cero. Acá era como: "¿Qué? ¿Qué dijiste? ¿Qué hay que ajustar? ¿Cómo 5?" Ese problema se conoce en machine learning como el desvanecimiento de gradiente.
En 2006, Joffrey Hinton, el mismo man, trajo el concepto de preentrenamiento para mitigar el problema del desvanecimiento de gradiente. En el preentrenamiento lo que se hacía era que todas las capitas, todas las capas se entrenan de una manera general y se van ajustando una por una, una por una se van ajustando, de tal manera que los ajustes no tienen que pasar por todas las capas, ¿no?, para evitar el desvanecimiento de gradiente. Y al final de ese entrenamiento general genérico se hace un ajuste final, un fine tuning. O sea, esto de acá 2006 reaviva el interés por la inteligencia artificial, porque esto de acá fue de 1986, pero apenas se dieron cuenta del desvanecimiento gradiente, el interés por la IA empezó a caer. Volvimos a un nuevo invierno de la gente dijo: "No, eso no funciona." Y lo olvidaron, de verdad. Imagínense.
Entonces, 20 años después, esto vuelve a reavivar el interés. Y en 2012, este es el momento más importante, este es el momento en que vuelve la inteligencia artificial. AlexNet, una red neuronal que clasifica imágenes. La gente le explotó el cerebro, dijeron: "No puede ser, funciona." O sea, en serio. O sea, tienen que dimensionar el momento. 20 años después. Y este 20 años después es como 40 años después del inicio del de las investigaciones de IA. Ah, no miento, 30 años después de los inicios de investigaciones de la IA es esto. O sea, estamos hablando de 50 años después. La gente dice: "No puede ser, funciona." Un sueño de 50 años se cumplió en 2012 porque crean una red neuronal que clasifica imágenes, que entiende, ve las imágenes, esto es un pato, esto es un perro.
A partir de entonces empieza el verano de la IA, empiezan muchas investigaciones, empieza a mover billete las empresas: Google, Microsoft, eh las chinas también estaban ahí metiendo muchísimo billete, eh Facebook, que se llamaba Facebook en ese entonces, ¿no? Meta, también todos empiezan a meter una cantidad absurda de dinero en IA. Nosotros no lo vemos, pero ellos ya estaban invirtiendo muchísimo dinero.
En 2017 aparece el famoso "Attention is all you need". Es el momento en que comienza la IA actual. AlexNet es el inicio del verano de la IA, un nuevo interés de la comunidad científica. El preentrenamiento es como el descongelamiento, ¿no? Es el primer paso para que empiece a llegar el verano. Esto es como la primavera, por decirlo así. Y "Attention is all you need" es como la pieza faltante. ¿Por qué? Porque hasta ese momento eh redes neuronales lo que hacían era comunicar los tokens de manera secuencial. Entonces, por ejemplo, si tú decías: "Hola, amigos, estoy muy feliz, muy feliz, bla bla bla bla bla, 100 palabras después, adiós." Y si tú le decías a la IA: "Oye, ¿a quién le he dirigido esta carta?" La IA tenía que retroceder palabra por palabra hasta llegar a "amigos". Es ineficiente porque cuando la cadena de texto era muy larga, la IA ya olvidaba. Era parecido al desvanecimiento de gradiente, esto de acá, pero ya en tokens. O sea, imagínate que no es 1000 100 palabras, sino 1000 palabras. Ya a la mitad se perdía, ya no era capaz de llegar a "amigos".
¿Qué hace "Attention is all you need"? Es que propone una arquitectura Transformer en que cada palabra está conectada con todas las demás. Entonces, no necesita ver una por una en secuencia, sino que la última palabra sabe qué se dijo al inicio porque tienen conexiones con todas. Se crea como una red, como una malla entre palabras y eso se llama mecanismo de atención. Esto fue creado para para Google Translate específicamente, pero luego OpenAI vio que era lo necesario para construir una inteligencia artificial que entiende el lenguaje humano. Sacaron GPT1, GPT2, GPT3, luego sacaron ChatGPT y el mundo reventó. Toda la IA actual se basa en arquitectura Transformer, pero Transformer es deep learning, una arquitectura que tiene un mecanismo de atención en que cada palabra se conecta con todas las demás, formando una malla para no buscarlas de manera secuencial. Eso es todo lo que necesitan saber para entender el Nested Learning.
Antes de continuar, tengo una pregunta para ti. ¿Quieres capacitar a tu equipo en inteligencia artificial? En .team los ayudamos a adaptarse a este mundo tan cambiante con nuestros planes para empresas totalmente adaptados a tus necesidades. Podemos capacitar a tu equipo administrativo, gerentes, programadores y TI. Decenas de empresas ya han confiado en nosotros para dar el salto a la IA. También tenemos licencias empresariales para que tu equipo acceda a nuestros cientos de cursos y tú puedas supervisar el avance de su aprendizaje. No te quedes atrás en la era de la IA y contáctanos en .team/onalempresas. Ahora sí, continuamos con el video.
Ya vimos todo el contexto previo para entender bien esto y ahora hablemos de qué problema quiere resolver este nuevo paper de Google. El problema es el congelamiento del aprendizaje y el olvido catastrófico. ¿Qué significa? Congelamiento del aprendizaje significa que cuando un modelo es entrenado, ya no puede aprender nada nuevo. Y el olvido catastrófico significa que si le enseñáramos algo nuevo, olvidaría lo que ya sabe.
En este punto, muchos podríamos pensar: "Eso no es verdad. La IA se entrena, siempre se está entrenando, está mejorando." De hecho, yo he escuchado que cuando yo hablo con ChatGPT, yo estoy entrenando al modelo. ¿Cierto? ¿Quién no ha escuchado eso? Técnicamente, no. Técnicamente, no lo estás entrenando. Y también dirás: "¿Y cómo se olvida? ¿Cómo así? ¿Cómo que enseñarle algo nuevo va a ser que olvide otras cosas?" Okay, volvamos para entender el problema. Esta es la clave.
¿Se acuerdan el ejemplo del reggaetonero? Cuando logro que el reggaetonero suene bien, ¿qué hago? Le pongo un letrero a mi consola de sonido que dice: "No lo toquen bajo pena de muerte porque me maté horas encontrando esta combinación de perillas." Bloqueas los pesos porque si alguien modifica algo, ¿no? Ahora llega otro reggaetonero y tú dices: "Okay, quiero ajustarlo para el otro reggaetonero." Cambias las perillas, pero ahora no te funciona para el primer reggaetonero. Por eso se bloquean los pesos.
¿Por qué crees que Gemini sale una vez al año? Gemini 1 en diciembre de 2023, Gemini 2 en diciembre de 2024, Gemini 3 en noviembre de 2025, una vez al año. ¿Por qué? Porque durante ese año estuvieron entrenándola, pues. Y una vez entrenada, los pesos se bloquean, se congelan. Durante ese año o medio año, por ejemplo, OpenAI lanzó GPT5 a los 2 meses, un poco más creo, sacó GPT 5.1, un nuevo modelo. Durante ese tiempo lo estuvo entrenando, pero lo estuvieron entrenando ellos, la empresa. Es decir, me explico: tienes el GPT5 en producción, es decir, los usuarios lo están usando y tienes el GPT 5.1 en desarrollo, es decir, solamente los devs lo están usando, lo están entrenando, lo están probando, pero los usuarios no lo ven. Cuando el desarrollo termina, lo mandan a producción. Básicamente, el ciclo del software de toda la vida.
Lo que propone el Nested Learning básicamente es que el modelo se actualice en caliente, es decir, que no tengamos que esperar unos meses para que salga GPT 5.1 o que no tengamos que esperar un año para que salga Gemini 3 o Gemini 4 el próximo año, sino que el modelo en caliente se esté entrenando a sí mismo todos los días, todos los minutos. Y eso es una locura.
Entonces, tú me preguntarás: "Entonces, ¿no estoy entrenando a ChatGPT cuando converso con ellos?" No. Bueno, sí. No, porque no se está entrenando en ese momento, está bloqueado. No olvides esto. Esto es vital. Los pesos se bloquean. ¿Y por qué se bloquean los pesos? Porque ya sabemos que si no los bloqueas, va a olvidar cosas. Se van a corromper los pesos y va a olvidar otras cosas. Entonces, para evitar ese problema, se bloquean los pesos y se trabaja en el nuevo modelo, pero en una versión de desarrollo que no está libre al público.
Cuando tú hablas con ChatGPT, sí lo entrenas en el sentido de que esos datos van a usarse en la versión de desarrollo, pero no lo estás entrenando en caliente, como que ChatGPT esté mejorando sobre la marcha mientras tú hablas con él. Esa es la diferencia. Por eso inventaron algo llamado RAG. La IA tiene un conocimiento, vamos a ponerlo así, el modelo tiene un conocimiento, un knowledge base, pero por ejemplo, el modelo no sabe qué empleados trabajan en .Team, no lo conoce porque es una información privada. Entonces, cuando nosotros le preguntamos, por ejemplo: "Oye, ¿cuánto es el sueldazo de Alexis?" Y el modelo dice: "¿Qué? ¿Quién es Alexis? No lo conozco." No está en su KB Alexis. Entonces, los devs usan una técnica llamada RAG y entonces el modelo dice: "Bueno, no tengo esa info en mi conocimiento, vengo para acá." O si tú lo configuras, va primero al RAG y te responde. Tenemos curso de RAG en .Team. Vayan a verlo. El RAG es una forma de darle conocimiento extra al modelo para que cosas que el modelo no sabe las pueda copiar de ahí. Es como cuando tú vas a un examen y te apuntas las respuestas en un papelito y las metes ahí en en tu reloj, en la manga de la camisa o las chicas ahí en la pierna se lo anotan. Entonces, cuando viene la pregunta, tú buscas el papelito y dices: "Ah, es la A." Y para la dos: "Ah, es la B." Pero tú no sabes nada. Tú simplemente vas y copias el papelito. Tú no has aprendido nada. Es el equivalente. El modelo no ha aprendido nada. Si si rompo el cable, por decir así, o corto el cable y mañana le pregunto: "Oye, ¿cuál es el sueldazo de Alexis?" No tiene ni idea. No aprendió absolutamente nada.
Entonces, la IA es como esto. ¿Ya han visto esta película? Básicamente, los LLM son Drew Barrymore y tú eres Adam Sandler que intenta decirle: "Oye, pero ayer hablamos de esto." La chica recuerda toda su vida, ¿cierto? Recuerda todo. ¿Quién es su papá? ¿Quién es su familia? ¿Qué hace? ¿A qué se dedica? Pero hay un punto de corte en su memoria, ¿o no? De ahí para adelante no recuerda nada. Tiene un conocimiento que le hace completamente funcional. Puede atarse los zapatos, puede comer, puede ducharse. O sea, no es una persona que no es funcional, pero de ahí para adelante no puede recordar nada. Y este man lo que hace es intentar darle información. O sea, este man lo que hace es mandarle RAG, pero apenas corta el RAG al día siguiente se olvida todo y tiene que volver a empezar. Así son los modelos según el Nested Learning. Y bueno, según este paper, y es verdad, no pueden aprender nada nuevo. Ellos le llaman amnesia anterógrada. Bueno, no le llaman, ellos lo comparan con una condición médica que se llama amnesia anterógrada, que básicamente es lo de esta película. Básicamente es eso, nosotros intentando que recuerde y no recuerde y no recuerde y no recuerde. Y las técnicas de RAG o de memoria que usan, por ejemplo, ChatGPT, Claude, creo que todos los modelos ya tienen memoria. Básicamente es un RAG embebido, no están aprendiendo, simplemente van y copian de la información que tienen para responderte en ese momento, como tú copiando en el examen.
Tienen una ventana de contexto enorme, ¿se acuerdan? La context window. La ventana de contexto no es más que la memoria RAM del modelo, es decir, su memoria temporal, su memoria en el momento, que es lo que en el caso de esta chica, de esta película, es lo que permite que la muchacha recuerde al man durante el día. Pero la RAM la resetea al día siguiente. Entonces, la ventana de contexto es como la RAM, la memoria temporal de los modelos, pero una vez que tú abres un chat, se olvidan, pues, ¿no? Por eso es que cada vez le aumentan más ventana y contexto, ventana y contexto y te dicen: "Gemini 3 soporta 2 millones de tokens." Y la gente, wow, está chévere, por supuesto, pero seguimos bajo un aprendizaje congelado. Simplemente le están aumentando ventana de contexto para que pueda tener más información temporal de la cual copiarse, pero no está aprendiendo absolutamente nada. Porque si aprendiera en caliente, ocurriría el olvido catastrófico, olvidarías cosas si aprendieras en caliente.
Entonces, la propuesta del Nested Learning básicamente es la siguiente. La propuesta es que los modelos aprendan en caliente, es decir, que no esté la empresa OpenAI, Anthropic, Google, la que sea, que no tenga en sus laboratorios entrenando al modelo por meses y luego, cuando termina, lo saca congelado. Recuerden, no olviden eso. Los modelos están congelados, parecen que aprenden, pero en realidad no aprenden. Están usando RAG para devolverte información.
Entonces, la idea es que ya no pase eso, que en caliente estén aprendiendo con la interacción que tienen con nosotros, es decir, que sean capaces de ajustar sus pesos. ¿Se acuerdan? Los pesos. Los pesos son esos números que van conectando a las capas y esos pesos se van ajustando gracias a la función de pérdida y a la gradiente. ¡Chévere! Pero, ¿cómo? ¿Cómo? ¿Cómo se hace eso? Explícame, no entiendo. Es cambiar completamente la arquitectura imitando al cerebro humano, porque hasta este momento la inteligencia artificial no imita el cerebro humano. De hecho, eso es algo que repite muchas veces Yann LeCun, el exjefe del departamento de IA de Meta, lo repite demasiadas veces. Incluso nosotros hicimos un video acá diciendo que Yann LeCun decía que la IA no es más inteligente que un gato.
Siquiera lo que él dice me encanta. Dice: "El lenguaje es la expresión del conocimiento, no es el conocimiento. Tú necesitas tener conocimiento para expresarlo a través del lenguaje." ¿Se entiende eso? Por lo tanto, los LLM procesan el lenguaje, o sea, la capa exterior, pero el conocimiento, el razonamiento está dentro con o sin lenguaje. Por lo tanto, los LLM no son inteligentes, simplemente están entendiendo el lenguaje e imitando el lenguaje, pero no son capaces de aprender como aprenden los humanos. Eso es lo que hay que cambiar. Y por eso yo les decía al inicio del video que si esto funciona, veríamos a los modelos actuales como tontos, porque todos diríamos: "Oye, ninguno de ellos pensaba, eran loros cibernéticos, eran loros con muchísima GPU, pero al final de cuentas eran loros. Ninguno de ellos pensaba." Y de acá a unos años tu hijito, cuando tengas hijos, si aún no los tienen, te dirá: "Papá, ¿qué es eso? ChatGPT, ¿eso era la inteligencia artificial de mis tiempos?" Y tu hijo dirá: "¿Qué va a hacer? ¿De verdad eso inteligencia artificial?" Y te saldrá una lágrima diciendo: "Sí, y me quito la chamba."
Volvamos aquí. Ya vimos cuál es el problema. El problema es el congelamiento del aprendizaje y el olvido catastrófico. ¿Y cómo lo resolvemos? Imitando al cerebro humano. Aprende a través de la interacción. Aprende en caliente. No aprende una cosa y luego olvida otra. Porque eso sería el caso de esta chica de la película. Como les dije hace un momento, Yann LeCun dice que los LLM simplemente imitan el lenguaje, son un loro cibernético, pero no son inteligentes.
Entonces, lo que propone este paper es imitar cómo funciona el cerebro humano. Y el cerebro humano no tiene un reloj central, más bien tiene dos grandes capas de aprendizaje: el aprendizaje rápido y el aprendizaje profundo. El aprendizaje rápido son las cosas que vas aprendiendo sobre la marcha, ¿no? Por ejemplo, estás en una tienda buscando un producto y ves cuánto cuesta un producto y dices: "Aquí está, aquí está bueno el precio." Vas a otra tienda y dices: "En la tienda anterior estuvo más barato." Ese es aprendizaje rápido. Y el aprendizaje profundo son esas cosas que van quedando en tu memoria.
Hay un libro que me gusta mucho que se llama "¿Por qué dormimos?". Si les interesa todo el tema del sueño, búsquenlo, es muy bueno y te explica por qué. Si no duermes, te estás el cerebro realmente. Desde ahí me preocupo en dormir porque antes yo era de las ideas de que si duermo menos, chambeo más. En realidad no, porque te estás volviendo más bruto, porque estás matando tu cerebro. Pero volviendo acá, el libro cuenta y el Nested Learning aplica eso también de que, por ejemplo, en el aprendizaje profundo se ejecuta cuando nosotros dormimos. Cuando tú duermes, el cerebro hace el swapping. ¿Cómo te lo explico? Para programadores: Miren, esto es la RAM, ¿ya? Y esto es el disco duro. Ustedes son programadores y ustedes entienden. Y los que no sean programadores deben entender. También la RAM es una memoria volátil y el disco duro es una memoria persistente. Es decir, no se pierde esa información. Entonces, cuando tú duermes, el cerebro va filtrando información. La información valiosa la mete al disco duro y la información no valiosa la olvida. Realmente está ahí, ¿no? O sea, tú sabes que hay técnicas para encontrar esas cosas que tú creías olvidadas, pero están muy enterradas, mientras que la información valiosa la mete al disco duro y se queda persistente. Por eso es tan importante dormir. Por eso muchas veces cuando tú duermes encuentras soluciones a problemas que no encontrabas despierto. Esa es la razón.
Entonces, básicamente tenemos dos velocidades. Tenemos más en realidad, pero podemos basarnos en dos. Entonces, lo que propone el Nested Learning es tener esas dos velocidades al momento del aprendizaje, tener capas rápidas y tener capas lentas. Entonces, y que cada capa pueda aprender a su propio ritmo.
Entonces, veamos. El deep learning tradicional con Transformer sería como una pila, como un edificio donde están las capas, ¿no? Capa 1, 2, 3, 4, 5, 6, 7 y así. Eso sería el deep learning y con un solo reloj. Con un solo reloj significa que todos aprenden de una manera sincronizada, en una dirección específica, mientras que en el caso del Nested Learning habría diferentes capas corriendo a diferentes velocidades y ni siquiera serían paralelas. Podría ser un sistema orgánico en realidad, cada una corriendo a su velocidad imitando las diversas zonas del cerebro. Ustedes saben que el cerebro tiene zonas, ¿no? Entonces, hay capas lentas y hay capas rápidas. Prácticamente esto es un edificio y esto es, digamos, una empresa, por decirlo así. ¿Cómo que una empresa, dirás? Como si fuera un grupo de personas donde hay diversos departamentos que coordinan entre ellos y cada uno realiza diversas funciones. En cambio, esto es un edificio muy sólido, muy duro, muy inamovible, ¿se entiende? En cambio, esto es dinámico, esto es orgánico.
Entonces, hay capas rápidas y capas lentas. Ahora bien, las capas rápidas, las capas rápidas aprenden sobre la marcha y se actualizan cada 16 tokens. O sea, van aprendiendo todo, prácticamente todo lo que tú estás hablando ya lo están aprendiendo. Cada 16 tokens las capas rápidas se están actualizando, están aprendiendo cosas nuevas. Ahora bien, ¿cómo evitamos el olvido catastrófico? A través de las capas lentas. Las capas lentas funcionan como el sueño de los seres humanos. ¿Se acuerdan? Las capas lentas se actualizan cada seis o 16 millones, no me acuerdo, pero vamos a ponerle X millones porque, perdónenme, no recuerdo el número, se utilizan muy poco. Entonces, eso permite que no se olvide la información, pues no, porque te acuerdas, el olvido catastrófico es que yo aprendo algo nuevo, pero olvido lo que ya sabía. Pero como las capas lentas se actualizan muy lento, muy muy lento, pues lo que aprendan las capas rápidas no van a modificar lo que aprendan las capas lentas.
Volvemos a preguntarnos: ¿cómo es? Una propuesta, pero ¿cómo a través de esto de acá? Y aquí es donde viene este pedacito que nos faltaba, ¿no? Alguno de ustedes se preguntará: "Álvaro, ¿y qué fue de la gradiente?" Se le agregó, y eso no lo dije porque lo dejé para el final, algo llamado optimizador. El optimizador es una parte de la arquitectura que decide cuánto ajustar de la gradiente. No es que simplemente haga caso, no es que la gradiente diga: "Oigan, se equivocaron por -5, bájenle cinco y ya." No, no es así. El optimizador lo que hace es que recibe la gradiente, la analiza y la compara con las otras gradientes que han pasado en las etapas anteriores. En las etapas anteriores, una etapa es un ciclo, ¿se acuerdan? No se entrena, la gradiente regresa por back propagation al inicio y están en este ciclo, ¿cierto? Entonces, en cada etapa, el optimizador sabe cuáles fueron los valores de las etapas previas y de esa manera dice: "Okay, ya nos toca ajustar porque ya hay varios cambios. Entonces, acumulo estos cambios y voy a ajustar los pesos." No es que simplemente la gradiente sea una orden. El optimizador decide cuánto ajustar y también sabe el momentum. El momentum es el término técnico para referirse a que conoce los cambios anteriores, los valores anteriores de las gradientes anteriores de las anteriores etapas y de esa manera decide.
Básicamente, el optimizador es el arquitecto de la obra. La función de pérdida, esta de acá, ¿se acuerdan? Esta sería como el cliente. Imagínense que es una obra, están construyendo una casa. Viene el cliente y dice: "Ese color no me gusta, está feo. Cámbiale el color a las paredes." El optimizador es como el jefe de obra que dice: "Okay, pero este cliente ayer pidió un amarillo, hoy pide azul, mañana seguro pide otra cosa." Así que le dice a su equipo: "Oigan, no cambien nada, no cambien nada todavía, porque yo sé que este man va a cambiar de opinión." ¿Se dan cuenta? Ese es un optimizador.
Entonces, ¿qué tiene que ver el optimizador acá? Que según este paper, ya tenemos memoria dentro. El mecanismo para lograr esto son los optimizadores, porque los optimizadores ya tienen memoria y los optimizadores se encargarían de ser la memoria a corto plazo. O sea, básicamente pasan de estar ajustando el valor de los pesos a convertirse en esa memoria porque ya son memoria porque tienen la información de las de las anteriores etapas. De esa manera podemos hacer que, gracias a la arquitectura que ya tenemos con los optimizadores, tener dos tipos de capas: capas rápidas que se van actualizando sobre la marcha y capas lentas. De esa manera, la inteligencia artificial podría estar aprendiendo sobre la marcha.
Y ellos proponen una nueva arquitectura llamada Hop. El Nested Learning es el concepto que está detrás, ¿no? Como como deep learning, mientras que Transformer es la arquitectura. Ellos proponen una nueva arquitectura llamada Hop para manejar esto y, según ellos, en sus pruebas, Hop ha sido más eficiente que Transformer y que Titans. De hecho, esta es la parte en la que yo me quedo ahí como sorprendido, porque saben qué, Titans es un paper del año pasado que básicamente ataca lo mismo, pero la solución es diferente. La solución es darle una memoria más grande, si no me falla la memoria, a los LLM. Y ahora viene Hop, básicamente una evolución extra a Titans. Entonces, por un lado está muy chévere, pero por otro lado no es como la disrupción total, ¿no? El más bien es un paso más dentro de una propuesta que ya venía del año pasado.
El paper ha sido aprobado, ha sido revisado, repito eso, ha sido revisado y aprobado en una de las conferencias de inteligencia artificial más importantes del mundo. Y de ser real, como les dije al inicio, tendríamos modelos de inteligencia artificial que aprenderían solos. Ya no habría empresas que estén entrenándolas. No, no, no digo que las empresas desaparezcan porque pues necesitamos infraestructura, necesitamos datos, necesitamos arquitectura, necesitamos muchas cosas. Las empresas van a seguir, pero me refiero a que las empresas no van a tener que estar teniendo un modelo en público y un modelo en desarrollo, sino que el modelo en caliente estaría modificándose.
Y la parte, digamos, eh feíta de esto que da miedo es que sería, si es que ocurre, y esto sí me da miedo a mí, honestamente me da miedo, ocurriría la llamada singularidad. La singularidad es el momento post AGI, es cuando la inteligencia artificial iguala a la inteligencia humana, no que sea más inteligente, ojo, que la iguale. ¿Qué significa igualarla? Que puede razonar, que puede aprender de la experiencia y que puede, sobre todo, llevar su conocimiento de un área a otra. ¿Se entiende? O sea, si yo aprendo un concepto, si yo aprendo cómo patear eh una pelota de fútbol, me voy a otro deporte y me doy cuenta que la forma de patear es parecida al fútbol. Entonces, yo asocio esos conceptos. La IA es el momento en que la IA tiene la capacidad para hacer todas esas cosas. Ahorita simplemente es un loro super avanzado, pero el momento post AGI es cuando la IA ya no nos necesita. La IA es capaz de aprender y mejorarse sin necesidad de intervención humana. Y ahí es el momento, pues, el momento Skynet que todo el mundo teme, ¿no? Porque la IA ya es completamente autónoma. Hasta ahora la IA es una herramienta. Tú le dices qué hacer y lo hace. Pero en este momento que sigue siendo teórico, ah, la singularidad no es un término científico, es un término más de ciencia ficción, pero siempre se habla de de la singularidad. El momento en que ya no nos necesite y ya quedemos fuera de la ecuación. Y eso sí me da miedo.
Pero pues si llega el momento, tocará seguir estudiando porque repito, no hay momento más importante en la historia de la humanidad que la actual para ponernos a estudiar, para poder entender el mundo en el que estamos viviendo. No.