📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

Yann LeCun's Billion Dollar Bet

Welch Labs37:25

Transcription

De acuerdo, entonces déjenme hacer una declaración controvertida que, de nuevo, me ganará muchos amigos en SQL. Um, la leyenda de la IA Yan Lun ha recaudado mil millones de dólares para seguir un enfoque alternativo a la IA. A diferencia de los modelos de lenguaje grandes, el enfoque de Lacun no está arraigado en el lenguaje y no es generativo. Por diseño, no escupe texto, imágenes o videos. En cambio, Lacun ha propuesto Jeepa. Jeppa no es un único modelo de IA, sino una arquitectura o marco alternativo para entrenar modelos de IA. Muchos enfoques exitosos en IA y aprendizaje automático entrenan modelos para predecir alguna salida Y dado alguna entrada X. A los modelos de lenguaje grandes se les da algún texto de entrada X y se entrenan para predecir el texto Y que sigue. Los modelos clasificadores de imágenes reciben una imagen de entrada X y se entrenan para predecir la etiqueta correspondiente Y. Jeepa no funciona así. En cambio, nuestras entradas X y salidas Y se pasan a modelos conocidos como codificadores. Estos codificadores devuelven un vector o matriz de números, a menudo denominado incrustación (embedding). A partir de aquí, un tercer modelo conocido como predictor se entrena para predecir la incrustación de Y dada la incrustación de X. ¿Por qué podría esta ser una mejor manera de construir sistemas de IA? ¿Creen que Jeepa o los enfoques basados en modelos del mundo, creen que reemplazarán a los LLM algún día o están resolviendo problemas diferentes? Inicialmente resolverán problemas diferentes. Eventualmente reemplazarán a los LLM, de acuerdo, porque saben que los LLM son muy buenos manipulando el lenguaje, pero básicamente nada más. Son muy buenos en dominios donde el lenguaje en sí mismo es el sustrato del razonamiento, en comparación con el enfoque principal de lenguaje generativo de la IA. Jeepa vive en un camino alternativo de arquitecturas de incrustación conjunta. Curiosamente, Lacun jugó un papel importante al principio de ambos caminos. En la primera parte de esta serie de dos partes, exploraremos este camino alternativo hacia Jeepa. Profundizaremos en por qué Yan se alejó de las arquitecturas generativas justo cuando estaban ganando terreno en el lenguaje y exploraremos la epifanía de Yan para una nueva solución al problema del colapso de la representación que plagó a las arquitecturas de incrustación conjunta durante años. Finalmente, profundizaremos en la arquitectura Jeepa en sí. En la segunda parte, nos sumergiremos en las implementaciones de JEPA y veremos exactamente cómo se comparan estos modelos con los enfoques impulsados por LLM. Yan Lun vio venir la revolución en la década de 1980. Mientras la mayor parte del campo de la IA estaba ocupada construyendo sistemas expertos que se programaban explícitamente en lugar de aprender de los datos, Jan fue pionero en la red neuronal convolucional. 25 años después, cuando el aprendizaje profundo comenzó su ascenso a su posición dominante actual en la IA, el modelo de aprendizaje profundo revolucionario AlexNet resultó ser asombrosamente similar a las redes convolucionales de Lacun de la década de 1990. Sin embargo, a medida que el aprendizaje profundo continuó ganando impulso a lo largo de la década de 2010, Lacun y otros investigadores se preocuparon cada vez más por cuánto dependía este enfoque de la IA de los datos de entrenamiento etiquetados. AlexNet se entrenó en el enorme y meticulosamente etiquetado conjunto de datos ImageNet utilizando aprendizaje supervisado, donde AlexNet se entrenó para coincidir con las etiquetas asignadas a cada imagen por anotadores humanos. En contraste, los niños pueden aprender representaciones muy generales para conceptos como perro con muy pocos ejemplos etiquetados explícitamente. A medida que los datos etiquetados manualmente se convirtieron en un cuello de botella para el aprendizaje supervisado, creció el interés en enfoques alternativos. El aprendizaje por refuerzo, donde los modelos aprenden interactuando con su entorno en lugar de datos etiquetados, experimentó un renacimiento en mediados de la década de 2010, destacado por el rendimiento revolucionario de Google DeepMind en los juegos de Atari y el juego de mesa altamente complejo Go. Simultáneamente, Lacun y otros exploraron métodos no supervisados que aprenden de datos sin etiquetas, incluida una variante llamada aprendizaje autosupervisado, donde las etiquetas se toman de los datos mismos. A partir de 2015 aproximadamente, comencé a mostrar una diapositiva que se ha convertido en un meme en la comunidad de aprendizaje automático, donde dije, si es la diapositiva del pastel, ¿verdad? Entonces, si la inteligencia es un pastel, la mayor parte del pastel es aprendizaje autosupervisado, el glaseado del pastel, aprendizaje supervisado, y la silla del pastel, aprendizaje por refuerzo. En ese momento, la gente estaba un poco loca por el aprendizaje por refuerzo. Así que estaba tratando de decirles que esto nunca nos llevará a ninguna parte cercana a la inteligencia humana o animal porque es demasiado ineficiente. Y resulta que el éxito del aprendizaje autosupervisado ocurrió en texto y lenguaje mucho más rápido de lo que ocurrió en modalidades más naturales como la visión. Aquí Jan se refiere al éxito de la predicción del siguiente token para entrenar modelos de lenguaje grandes. OpenAI se fundó en 2015 y inicialmente centró sus esfuerzos en el aprendizaje por refuerzo, creando OpenAI Gym y Universe y mostrando un rendimiento muy impresionante en videojuegos complejos. Mientras gran parte de la empresa se centraba en el aprendizaje por refuerzo, Ilia Sutskever, Alec Radford y otros se interesaron en una nueva arquitectura de red neuronal de Google, el transformer. Diseñado inicialmente para la traducción de idiomas, mientras experimentaba, Radford probó una modificación interesante. En lugar de que el transformer tradujera de un bloque de texto en un idioma a un bloque de texto en otro idioma, cambió a un enfoque autosupervisado más simple donde el texto de entrenamiento se divide en secuencias y al transformer se le da todo menos la última pequeña parte del texto conocida como token en cada secuencia y se entrena para predecir cuál será este token final. Radford y sus colegas de OpenAI entrenaron su transformer en un conjunto de datos interno de OpenAI bastante grande de 7.000 libros. Tenga en cuenta que ahora llamamos a esta fase preentrenamiento y luego entrenamos aún más su modelo utilizando aprendizaje supervisado estándar a partir de etiquetas generadas por humanos en tareas de lenguaje específicas. Su enfoque de entrenamiento en dos etapas funcionó bien, estableciendo nuevos resultados de vanguardia en nueve puntos de referencia de lenguaje, incluidas tareas como preguntas de comprensión de lectura a nivel de escuela secundaria, superando a arquitecturas y métodos que fueron diseñados y entrenados individualmente para cada tarea individual. El modelo de Radford ahora se conoce como Generative Pre-trained Transformer 1 o GPT1. GPT1 no recibió mucha atención pública en ese momento, pero fue un gran avance, liberando a los modelos de su dependencia de datos etiquetados por humanos y abriendo niveles de escala sin precedentes. Otros investigadores de OpenAI captaron rápidamente la importancia de los resultados de Radford y el equipo se volcó por completo en este enfoque, escalando agresivamente a GPT2 en 2019, GPT3 en 2020 y Chat GPT en 2022. En 2012, AlexNet se entrenó con alrededor de un millón de ejemplos. En 2020, GPT3 se entrenó con cientos de miles de millones de ejemplos. E interesante, el nuevo paradigma de entrenamiento que surgió coincidió exactamente con las predicciones de Yon Lacun de unos años antes. Una fase extensa de preentrenamiento autosupervisado seguida de aprendizaje supervisado y finalmente aprendizaje por refuerzo para dar forma al modelo predictor de siguiente token en bruto en un asistente de IA útil. Sin embargo, mientras que estos enfoques generativos autosupervisados claramente rompieron en el lenguaje, la imagen era mucho más difusa para los datos de imágenes y videos. Pero seguí trabajando en visión y luego inicialmente la idea era usar para entrenar un sistema para predecir lo que sucede en video, pero usar arquitecturas generativas. Básicamente, entrenar a nivel de píxel lo que va a suceder en el video. Años antes del éxito de GPT1, investigadores, incluido Lacun, habían intentado aplicar el mismo enfoque generativo autosupervisado a video. En la implementación más directa, configuramos nuestra red neuronal para que tome los valores de píxeles RGB de una secuencia de fotogramas de video y luego prediga los valores de píxeles en el siguiente fotograma, al igual que los modelos GPT se entrenan para predecir el siguiente token en lenguaje. Sin embargo, cuando usamos estos modelos para predecir el siguiente fotograma, los resultados son borrosos. Y esta falta de nitidez se agrava drásticamente en predicciones de horizonte más largo. Los modelos de lenguaje grandes son autorregresivos. Cuando ChatGPT responde una pregunta, genera un token a la vez. En cada paso, retroalimenta su último token generado a su entrada para crear la siguiente salida. Si intentamos este enfoque autorregresivo con un modelo de predicción de video del siguiente fotograma, los resultados rápidamente se convierten en una nada borrosa. Antes de ver exactamente cómo JEA puede superar este problema de predicción borrosa, veamos otra aplicación fascinante de los transformers más allá de los modelos de lenguaje. Este video está patrocinado por Hudson River Trading, y este es un libro de órdenes. La columna izquierda muestra todas las ofertas de compra de acciones de Nvidia clasificadas por precio de oferta, y la columna derecha muestra todas las ofertas actuales de venta de acciones de Nvidia clasificadas por precio de venta. En un día de negociación activo, llegan del orden de 1.000 nuevas órdenes de compra y venta como esta cada segundo. Este diluvio de órdenes es una fuente de información increíblemente rica. ¿Es posible entrenar un transformer como los utilizados en VJA para encontrar patrones en estos datos y usar estos patrones para predecir precios futuros? Hudson River Trading tiene billones de tokens de datos históricos. Este es el mismo orden de magnitud de datos de entrenamiento utilizados para entrenar LLM de vanguardia, y sus investigadores están trabajando para ampliar las fronteras del aprendizaje automático en estos datos. El modelo VJEPA que veremos más adelante en el video mapea parches de videos a vectores de incrustación individuales. Podríamos adoptar un enfoque similar con datos de libros de órdenes, tokenizando grupos de órdenes utilizando alguna intuición financiera. Sin embargo, este enfoque ingenuo no funciona bien en la práctica, y el equipo de Hudson River Trading ha desarrollado algunos enfoques realmente interesantes para adaptar arquitecturas transformer de vanguardia a las complejidades y restricciones de los datos de negociación. Y todo esto está sucediendo en un entorno donde la velocidad lo es todo. Los modelos deben ejecutarse bajo restricciones de latencia increíblemente estrictas. Estos desafíos de investigación e ingeniería fascinantes y altamente complejos, combinados con los recursos para abordarlos y un entorno abierto y altamente colaborativo, hacen de Hudson River Trading un lugar increíblemente único para trabajar. Escucho mucho de posibles patrocinadores en estos días y me he quedado seriamente impresionado en mis interacciones con el equipo de Hudson River Trading. El nivel de discusión técnica y entusiasmo por estos problemas profundos e interesantes es incomparable en mi experiencia. Si esto suena interesante, Hudson River Trading está contratando actualmente investigadores de IA, desarrolladores de algoritmos e ingenieros de software. Están contratando a nivel mundial y no necesita tener experiencia en finanzas. Puede obtener más información en hudson rivertrading.com/welchlabs. Ahora, volvamos a Jeepa. Ahora, los fotogramas borrosos producidos por nuestro enfoque de predicción de video generativo no son un gran misterio. El lenguaje es complejo e impredecible, pero no es nada comparado con el video. Los modelos de lenguaje utilizan vocabularios de tamaño fijo. GPT2 tiene 25.257 salidas discretas, una por cada token que el modelo podría decir a continuación. Este enfoque de enumeración completa es inútil en video. Para video Full HD, en el caso más general, cada píxel puede tomar 256 valores discretos. Y tenemos 1920 * 1080 * 3 píxeles de color. Lo que significa que hay algo así como 10 a la potencia de 15 millones de fotogramas de video siguientes posibles, eclipsando el número de átomos en el universo observable. Por lo tanto, no hay forma de que nuestro modelo de predicción de video tenga una salida discreta para cada fotograma de video siguiente posible, como nuestro modelo de lenguaje tiene una salida discreta para cada token siguiente posible. En cambio, muchos enfoques de video generativo de esta era tenían la red que producía directamente valores de intensidad de píxeles. El gran desafío con este enfoque es cómo el modelo aprende a manejar la incertidumbre. Si comparamos un LLM aprendiendo a completar la oración, la pelota rebotó hacia el y una red neuronal prediciendo el siguiente fotograma de un video de una pelota rebotando, podemos ver exactamente qué sale mal. En el caso de entrenamiento de LLM, el modelo verá varios ejemplos en su conjunto de entrenamiento de la pelota rebotando a izquierda y derecha. Y dado que el modelo tiene salidas separadas para cada uno de estos tokens, puede actualizar independientemente estas probabilidades. Nuestro modelo de video no lo tiene tan fácil. Si nuestro conjunto de datos incluye videos de la pelota comenzando por el mismo camino y luego rebotando en varias direcciones, dado que nuestro modelo se ve obligado a predecir directamente una única salida de fotograma para una entrada dada, lo mejor que puede hacer ante esta ambigüedad es predecir el promedio de estos resultados. Cuando promediamos los valores de píxeles de nuestros videos, terminamos con un desastre borroso y descolorido. Ahora, este es solo el enfoque más ingenuo, y ha habido muchas, muchas estrategias interesantes de predicción de video e imagen probadas con diversos grados de éxito en las últimas dos décadas. Sin embargo, los desafíos que surgen naturalmente llevaron a Lun y a otros investigadores a hacer una pregunta interesante. ¿Nuestros modelos realmente necesitan ser generativos? En nuestro ejemplo de GPT, durante la fase crucial de preentrenamiento, realmente no importa que nuestro modelo sea generativo. Después del preentrenamiento en predicción del siguiente token, nos queda un modelo que es esencialmente un autocompletado muy bueno. Pero este no es el punto. Lo que realmente importa son las representaciones internas y las características que el modelo aprende para resolver la tarea de predicción del siguiente token. Estas representaciones internas aprendidas son lo que permite que los modelos preentrenados se adapten rápidamente a potentes asistentes de IA. La predicción del siguiente token en lenguaje es un proxy para la inteligencia que ha resultado funcionar sorprendentemente bien. Pero, ¿hay otras señales y métodos que podamos usar para aprender estas potentes representaciones internas que necesitamos para construir sistemas inteligentes? Simultáneamente, comenzamos a darnos cuenta, alrededor de 2017-18, de que el mejor sistema para aprender representaciones de imágenes son sistemas que no son generativos. No reconstruyen, ellos, obtienes una imagen y la pasas por un codificador y luego intentas forzar a este codificador a extraer tanta información como sea posible con ciertas propiedades. Por ejemplo, tomas dos imágenes de la misma escena o tomas una imagen y la corrompes o la transformas de alguna manera. Las pasas ambas por codificadores y le dices al sistema que la representación que extraigas sea realmente la misma para esas dos imágenes porque semánticamente representan lo mismo. Y he estado trabajando en cosas así desde los años 90. Así que esta no es una idea nueva. Esta idea de incrustación conjunta solía llamarse red neuronal siamesa. El método al que se refiere Yan aquí, las redes siamesas, fue creado por Yan y sus colaboradores en Bell Labs a principios de la década de 1990 al desarrollar sistemas para detectar firmas fraudulentas. El sistema funcionaba pasando un par de imágenes de firmas a dos copias de la misma red neuronal. Las copias de la red no se entrenaron para generar ningún tipo de datos. En cambio, producían vectores de números, a menudo denominados vectores de incrustación. Estas copias de red se entrenaron con dos tipos de ejemplos. Ejemplos positivos que contienen una firma de referencia y una firma no fraudulenta. Así que son de la misma persona. Y ejemplos negativos que contienen una firma de referencia y una firma fraudulenta. Para los ejemplos fraudulentos, las copias de red se entrenan para producir vectores de incrustación que son máximamente diferentes. Y para los ejemplos positivos, producen vectores de incrustación que son máximamente similares. Cuando llega una nueva firma, podemos pasarla a nuestra red para calcular un vector de incrustación y compararlo con el vector de incrustación producido por nuestra firma de referencia. Si los vectores de incrustación resultantes no son lo suficientemente similares, la firma se detecta como fraudulenta. Al incrustar conjuntamente nuestras firmas, nuestra red siamesa aprende una representación interna muy útil de las imágenes de nuestras firmas, notablemente sin aprender a predecir o generar ninguna imagen de firma real. Como un enfoque basado en GPT, ¿ofrecen las incrustaciones conjuntas una solución potencialmente viable a nuestro problema de video borroso? Como explica Yan, obtienes una imagen y la pasas por un codificador y luego intentas forzar a este codificador a extraer tanta información como sea posible con ciertas propiedades. Por ejemplo, tomas dos imágenes de la misma escena o tomas una imagen y la corrompes o la transformas de alguna manera. Las pasas ambas por codificadores y le dices al sistema que la representación que extraigas sea realmente la misma para esas dos imágenes porque semánticamente representan lo mismo. Así que la idea aquí es que evitamos el problema del video borroso que vimos con los modelos generativos utilizando una arquitectura de incrustación conjunta para mapear copias de imágenes o videos con uno o ambos corruptos o transformados a vectores de incrustación similares. Este modelo entrenado idealmente aprenderá una representación interna útil de imágenes o videos que podemos reutilizar para otras tareas, al igual que los modelos GPT aprenden representaciones internas durante el preentrenamiento que se pueden adaptar a comportamientos de asistente de IA. Sin embargo, esta estrategia de incrustación conjunta tiene un gran problema. Dado que estamos entrenando nuestra red para que las incrustaciones de nuestras imágenes o videos originales y corruptos sean lo más similares posible, la red puede encontrar una solución trivial donde simplemente devuelve el mismo vector de incrustación para cualquier entrada que le pasemos. Si nuestra red aprende a producir, por ejemplo, un vector de todos unos para cualquier entrada, entonces la red devolverá todos unos para una vista corrupta y no corrupta de la misma imagen, maximizando la similitud resultante, pero sin aprender nada útil. Este problema se conoce como colapso de la representación. En el enfoque original de red siamesa de Lacun, el equipo utilizó lo que ahora se conoce como aprendizaje contrastivo para evitar el colapso de la representación, dando a la red ejemplos positivos y negativos. Resulta que podemos aplicar el mismo enfoque contrastivo a imágenes y videos, entrenando nuestra red para producir incrustaciones similares para vistas de las mismas imágenes o videos subyacentes e incrustaciones disímiles para imágenes o videos diferentes. Estos métodos contrastivos se han implementado con éxito en imágenes y videos, pero pueden surgir problemas cuando se escalan, requiriendo grandes cantidades de computación y muchos ejemplos negativos para aprender representaciones significativas. Y Lacun ha argumentado que en el peor de los casos, el número de muestras contrastivas puede crecer exponencialmente con la dimensión de la representación. A finales de la década de 2010, estaba claro para Lun y otros que usar modelos generativos para reconstruir completamente imágenes y videos no era una buena estrategia para el aprendizaje autosupervisado. Pero no había una solución directa al problema del colapso de la representación que permitiera a las arquitecturas de incrustación conjunta aprender el mismo nivel de representaciones internas potentes y generales que estaban disfrutando los modelos de lenguaje grandes. Y así, estaba bastante claro que la reconstrucción era una mala idea para señales como imágenes y un fortuito para video. Y tuve una epifanía porque los métodos que estábamos utilizando para entrenar esas arquitecturas de incrustación conjunta eran un poco trucos hasta que hice algo de trabajo con un par de postdocs en Meta, en particular un tipo llamado Stefan Deni, que se le ocurrió una técnica llamada Ballot twin. Se basa en una vieja idea en ciencia del ruido computacional en aprendizaje automático en la que Jeff Hinton también jugó con ideas similares, que es que deberías tener tiempo para tener alguna medida de contenido de información e intentar maximizar eso, y hay un trabajo real de Barlo, un famoso neurocientífico computacional y teórico neurocientífico. Aquí Jan se refiere al trabajo de Horace Barlo, quien hipotetizó en 1961 que las neuronas en los sistemas de visión animal y humana operan reduciendo la información redundante entre neuronas. Stefan Deni, un postdoctorado con el que Lacun trabajaba en 2020, estaba familiarizado con el trabajo de Barlo y propuso que una forma de evitar el colapso de la representación podría ser aplicar la idea de Barlo a las salidas de sus redes. En las arquitecturas de incrustación conjunta que hemos estado considerando, nuestros vectores de incrustación se producen a partir de una capa final de neuronas artificiales en nuestras redes de incrustación. Por lo tanto, si nuestros vectores de incrustación tienen una longitud de 128, entonces la capa de salida de cada una de nuestras redes contiene 128 neuronas. Si pasamos un lote de varias imágenes a cada una de nuestras redes y trazamos la activación de salida de la primera neurona a medida que avanzamos por nuestras imágenes, podemos ver que esta neurona se activa fuertemente en esta primera imagen de un perro, no tanto en esta imagen de un gato, y así sucesivamente. Siguiendo nuestro enfoque de incrustación conjunta, nuestra red toma una vista distorsionada del mismo lote de imágenes. El objetivo de nuestra arquitectura de incrustación conjunta es hacer que las incrustaciones resultantes de las mismas imágenes o videos subyacentes sean similares. Por lo tanto, queremos que la salida de nuestra primera neurona en nuestra segunda red sea similar a la salida de nuestra primera neurona en nuestra primera red. En una arquitectura de incrustación conjunta estándar, simplemente mediríamos y maximizaríamos la similitud entre estos dos vectores. Sin embargo, como hemos visto, este enfoque es susceptible al colapso de la representación. Con la red aprendiendo simplemente a producir los mismos valores para cualquier imagen de entrada. Pero ahora, aplicando la hipótesis de Barlo, como propuso Stefan Deni, deberíamos reducir la redundancia entre las salidas de diferentes neuronas. Tenemos una elección que hacer aquí. Podríamos comparar la salida de la primera neurona en nuestra primera red con la salida de nuestra segunda neurona en nuestra primera red o con la salida de la segunda neurona en nuestra segunda red. El equipo eligió comparar con la salida de la segunda red. Como veremos, esto resulta en una implementación más simple y el equipo señala además en el apéndice de su artículo que en la práctica no vieron mucha diferencia entre estas alternativas. Aquí está la salida de la segunda neurona en nuestro segundo modelo. Para medir la redundancia entre las salidas de las neuronas, el equipo calculó la autocorrela entre estos vectores de salida. Este cálculo consiste en escalar cada vector y tomar el producto punto, lo que resulta en un solo número, la correlación o, más precisamente, el coeficiente de correlación de Pearson entre nuestros vectores. Para reducir la redundancia entre nuestras neuronas, como propuso Barlo, queremos que esta correlación sea cercana a cero. Si organizamos las salidas de las neuronas de nuestro primer codificador verticalmente y las salidas de nuestro segundo codificador horizontalmente, podemos calcular y colocar las correlaciones entre todos los pares de neuronas en una sola matriz. Esta matriz de autocorrela tiene una fila por cada neurona de salida en nuestro primer codificador y una columna por cada neurona de salida en nuestro segundo codificador. Los elementos a lo largo de la diagonal capturan las correlaciones entre neuronas correspondientes. Dado que toda la idea de esta arquitectura de incrustación conjunta es producir salidas similares para versiones distorsionadas de la misma imagen, queremos que las neuronas correspondientes en nuestros dos codificadores tengan altas correlaciones. Alternativamente, todas las entradas fuera de la diagonal en nuestra matriz de autocorrela corresponden a diferentes neuronas en nuestros dos codificadores. Y siguiendo la hipótesis de Barlo, queremos reducir la redundancia entre estas neuronas. Por lo tanto, queremos que estas correlaciones sean cero. Idealmente, nuestra matriz de autocorrela se parece a la matriz identidad. Deni, Lacun y sus colaboradores diseñaron una nueva función de pérdida para su arquitectura de incrustación conjunta que medía la desviación de su matriz de autocorrela de la matriz identidad. Su nuevo método, al que llamaron barlo twins, funcionó sorprendentemente bien, evitando el colapso de la representación y aprendiendo una representación interna potente de las imágenes en las que se entrenó. El equipo utilizó algunos métodos diferentes para medir la calidad de estas representaciones internas. Anteriormente, vimos cómo, al utilizar preentrenamiento autosupervisado, GPT1 pudo superar a los modelos puramente supervisados que se habían adaptado a tareas de lenguaje específicas. Para tareas de visión, uno de los puntos de referencia más importantes en ese momento era la precisión en el conjunto de datos ImageNet. Este es el mismo conjunto de datos de clasificación de imágenes en el que el modelo AlexNet había mostrado un rendimiento revolucionario en 2012. El artículo original de AlexNet logró una precisión del 59,3% en el conjunto de validación de ImageNet. Para comparar el enfoque autosupervisado Barlo twins con modelos puramente supervisados como AlexNet, el equipo utilizó un enfoque común conocido como "linear probe" (sonda lineal), donde se añade una sola capa de neuronas a la salida del modelo codificador entrenado con Barlo twins y se entrena utilizando aprendizaje supervisado para clasificar el conjunto de datos ImageNet. Es importante destacar que el modelo codificador principal se congela durante este proceso de entrenamiento. Por lo tanto, la simple sonda lineal está adaptando efectivamente la representación aprendida por los codificadores de Barlo twins para resolver la tarea de clasificación de ImageNet. Impresionantemente, el codificador congelado de Barlo twins con una sonda lineal logró una precisión de ImageNet del 73,2%, superando al modelo AlexNet original puramente supervisado en más de 10 puntos porcentuales. Sin embargo, en los nueve años desde el artículo de AlexNet en 2012 hasta el artículo de Barlo twins en 2021, los enfoques puramente supervisados habían logrado mejoras significativas sobre AlexNet. En 2020, un equipo de Google aplicó la arquitectura transformer a la clasificación de imágenes, logrando una nueva precisión de vanguardia en ImageNet del 88,6%. Por lo tanto, para 2021, gracias a la epifanía de Barlo twins y otros enfoques de incrustación conjunta, el aprendizaje autosupervisado estaba avanzando rápidamente para tareas de visión, pero todavía era inferior a los métodos puramente supervisados. Los métodos de preentrenamiento generativo autosupervisado generales y claramente superiores en lenguaje que estaban impulsando el rápido avance de los LLM aún estaban fuera de alcance para aplicaciones de imágenes y video. Y así, quedó claro que este era realmente el camino correcto a seguir. Así que, después de eso, publicamos otra versión, básicamente una versión simplificada de battle twins llamada vicrag, que resultó ser bastante buena. Y luego, simultáneamente, otro grupo, algunos de nuestros colegas de Fair Paris, estaban trabajando en métodos similares que eventualmente se conocieron como dino, dino v1, v2, v3, ahora tienen una nueva versión que ya no se llama dino, y esta también es una técnica de incrustación, por lo que está muy claro que la incrustación conjunta fue mejor para el aprendizaje de representaciones, para representar imágenes. El artículo Dino V3, publicado en agosto de 2025, marcó un punto de inflexión importante al lograr una precisión en ImageNet muy cercana a la de vanguardia del 88,4% utilizando una arquitectura de incrustación conjunta. Como dicen los autores en su artículo, en general, esta es la primera vez que un modelo autosupervisado ha alcanzado resultados comparables a los modelos débilmente supervisados en clasificación de imágenes. La calidad de las representaciones que Dino V3 es capaz de aprender sin acceso a ninguna etiqueta generada por humanos es asombrosa. Dino produce un vector de incrustación para cada parche de imagen que analiza. Si tomo esta imagen mía y tomo el vector de incrustación de Dino de este parche de imagen en mi mano y comparo este vector de incrustación con el resto de los parches de la imagen, visualizando qué tan similar es cada parche al parche de la mano usando un mapa de colores. Dino hace un trabajo notablemente bueno al segmentar mi mano del fondo. Aquí está el mismo enfoque aplicado a una pelota, un gato y un libro. Tras el éxito de Barlo twins, Vicreg y Dinov1, en 2022, Lun reunió estos y muchos otros hilos en un artículo de posición de 60 páginas llamado "A path towards autonomous machine intelligence" (Un camino hacia la inteligencia artificial autónoma). A diferencia de la gran mayoría de los artículos de Lun, donde trabaja en piezas específicas y técnicas de la teoría o práctica del aprendizaje automático, "A path towards autonomous machine intelligence" adopta un enfoque holístico de primeros principios sobre cómo deberíamos construir máquinas inteligentes. Lun comienza argumentando que nuestros enfoques actuales de IA están muy lejos de las capacidades del aprendizaje humano, dando el ejemplo de un adolescente que puede aprender a conducir un coche en unas 20 horas de práctica. ¿Cómo es que tenemos esos millones de horas de datos de entrenamiento con los que podemos entrenar un sistema de nivel dos, que es básicamente lo que está haciendo Tesla? Pero muy lejos del nivel tres, cuatro, cinco. De acuerdo. Y sin embargo, un joven de 17 años puede aprender a conducir en unas pocas horas de práctica. ¿Cómo sucede eso, verdad? ¿No deberíamos averiguar cuál es el secreto allí? Y mi suposición es que el secreto son los modelos a seguir. La apuesta de mil millones de dólares de Lacun es que la pieza que falta en la IA moderna son los modelos del mundo. Modelos que hacen predicciones sobre el mundo físico. Como él dice en su artículo de posición de 2022, el sentido común puede verse como una colección de modelos del mundo que pueden decirle a un agente qué es probable, qué es plausible y qué es imposible. Usando tales modelos del mundo, los animales pueden aprender nuevas habilidades con muy pocas pruebas. Pueden predecir las consecuencias de sus acciones. Pueden razonar, planificar, explorar e imaginar nuevas soluciones a problemas. Lun argumenta además que las arquitecturas de incrustación conjunta ofrecen la base adecuada para construir modelos del mundo. Así, JPA significa arquitectura predictiva de incrustación conjunta y se toma una observación del mundo y luego la siguiente observación del mundo. Las pasas a través de codificadores. Así que esto es como una arquitectura de tipo de incrustación conjunta y luego tienes un predictor que intenta predecir el estado en el tiempo t + 1 a partir del estado en el tiempo t y podrías condicionar esto en una acción y ahora tienes un modelo del mundo. Como ejemplo concreto, en lugar de usar una arquitectura generativa para predecir los valores de píxeles en el siguiente fotograma de video, podemos mapear el video y el siguiente fotograma a incrustaciones y luego entrenar un modelo predictor para predecir la incrustación del siguiente fotograma dado la incrustación del video. En esta implementación, la arquitectura JEPA libera al modelo de la tarea intratable de predecir cada píxel en el siguiente fotograma de video y teóricamente permite al predictor centrarse en predecir solo las características salientes de la escena que pasan por el codificador. Jan da un buen ejemplo aquí. Si entrenas un modelo de geología para predecir lo que va a suceder en un video de cámara de tablero, dedicará la mayor parte de sus recursos a predecir el movimiento aleatorio de las hojas en los árboles que bordean la carretera, y esas son cosas que son esencialmente impredecibles, pero tienen muchos píxeles, que se mueven. Como Jan mencionó anteriormente, podemos llevar a Jeepo un paso más allá condicionando en acciones. En el artículo VJEPA 2, que exploraremos en la segunda parte, el equipo condiciona un modelo JEPA en las señales de acción enviadas a un brazo robótico. Así, el modelo JEPA ve una secuencia de imágenes del brazo del robot y el entorno y luego se entrena para predecir la incrustación del siguiente fotograma de video, pero también se le dan las señales de control que se envían al brazo del robot. Esto permite al predictor aprender a predecir cómo varias señales de control cambiarán la posición del brazo del robot en la imagen incrustada. Este modelo del mundo aprendido puede luego usarse para planificación y control de robots. Dado una imagen de algún estado objetivo, por ejemplo, mover una taza de una plataforma, esta imagen se pasa al codificador del siguiente fotograma, lo que resulta en una incrustación del estado objetivo del robot. A partir de aquí, se puede utilizar un algoritmo de control para explorar las predicciones del modelo del mundo dadas varias acciones hipotéticas y encontrar un conjunto de acciones que hagan que el estado futuro predicho por el modelo coincida con su estado objetivo. Como dice Jan, esto es realmente un nuevo giro a una vieja idea. Construyes un modelo que te da el estado del mundo en el tiempo t + 1 como una función del estado del mundo en el tiempo t y una acción que imaginas tomar o intervención o control, ¿verdad? Y luego, si tienes esto, puedes predecir el resultado de una secuencia de acciones y puedes, mediante optimización, encontrar una secuencia óptima de acciones para llegar a un resultado particular. Esto es control óptimo clásico. Esto es, esto se remonta a finales de los años 50 en la Unión Soviética, principios de los 60 en Occidente. Cosas muy clásicas. Sí. Lo que no es clásico es que aprendes el modelo. Usas aprendizaje automático para aprender el modelo. Correcto. Sí. Lo que es aún menos clásico es que aprendes una representación de la entrada que calcula un estado, una representación de estado abstracta, y aprendes el modelo en ese estado, y eso es JPA, pero ¿Jeepa u otros enfoques de modelos del mundo realmente superarán a los modelos de lenguaje grandes? Desde que Lacun propuso Jeppa por primera vez en 2022, la arquitectura ha sido aplicada por varios equipos a una amplia gama de problemas. ¿Cómo se comparan exactamente estos modelos? En la segunda parte, profundizaremos en VJeppa 2 para tener una idea de lo que realmente está sucediendo dentro del espacio de incrustación de los modelos y veremos cómo VJA 2 se desempeña como algoritmo de control de robótica frente a los enfoques VLA en rápida evolución. También exploraremos VLJA, que resuelve muchos de los mismos problemas de visión y lenguaje que resolvemos hoy con LLM multimodales, pero de una manera muy diferente y con resultados impresionantes. Finalmente, pasaremos tiempo en una implementación de Jeepa llamada modelo de mundo de capa. El modelo de mundo de capa ofrece la imagen más completa, aunque temprana, de lo que pueden hacer los sistemas basados en Jeepa. Hasta la próxima, los dejo con la opinión de Yan. De acuerdo, entonces déjenme hacer una declaración controvertida que, de nuevo, me ganará muchos amigos en Silicon Valley. No entiendo cómo se puede siquiera pensar en construir un sistema agentivo sin que un sistema agentivo tenga la capacidad de predecir las consecuencias de sus acciones. ¿De acuerdo? Y una VA no hace eso. Seguro. Correcto. Las aerolíneas no tienen modelos del mundo. No pueden predecir las consecuencias de sus acciones de antemano. Simplemente toman la acción y luego, como dijeron algunos reyes franceses famosos. Así que, si realmente quieres construir sistemas agentivos confiables, absolutamente deben poder predecir las consecuencias de sus acciones para que puedan planificar una secuencia de acciones para hacer algo, primero para cumplir la tarea que se les pide que cumplan, pero también, quizás, para garantizar algunas barreras de seguridad. Seguro. Correcto. Y el proceso de inferencia ahora se convierte en una búsqueda en lugar de una simple predicción autorregresiva. Correcto. Ese es un modelo del mundo. Esa es toda la idea de un modelo del mundo. Si disfrutaste este video, consulta la guía ilustrada de IA de Welch Labs. Su portada produce representaciones de Dino altamente consistentes, ¡así que sabes que tiene que ser buena! El libro está bellamente ilustrado y es una excelente manera de profundizar en muchos de los temas que tocamos en este video. El capítulo 5 sobre Alexnet es una excelente manera de aprender más sobre vectores de incrustación y el auge del aprendizaje profundo. El capítulo seis sobre leyes de escalado neuronal profundiza en la fascinante acumulación de GPT1 a GPT3 en OpenAI. El capítulo 9 cubre los modelos de difusión, que son capaces de reconstruir representaciones a nivel de píxel de imágenes y video de alta precisión, pero con algunas compensaciones notables. Los capítulos 1 a 4 brindan una excelente base para todos estos temas, cubriendo los fundamentos de las redes neuronales, la retropropagación y el aprendizaje profundo. Cada capítulo incluye ejercicios que invitan a la reflexión y código de apoyo. El libro se envía ahora a 24 países. Puede adquirir una copia hoy mismo en welchlabs.com.