📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

The Man Replacing LLMs (And He Has $1B to Prove It)

Parthknowsai9:49

Transcription

L'homme qui a littéralement inventé la technologie derrière Chad GPT a récemment déclaré que les LLM sont une impasse. Et il n'a pas écrit d'article de blog ni s'en est plaint sur Reddit. Il a démissionné, quitté l'un des laboratoires d'IA les plus puissants de la planète et levé un milliard de dollars pour construire quelque chose de différent, pour construire une intelligence réelle, pas seulement un auto-compléteur sophistiqué. Il vaut la peine de comprendre ce qu'il sait réellement et que la plupart des gens ignorent, et pourquoi on lui a donné un milliard de dollars pour recommencer avec l'IA. Yan Lee Kun a remporté le prix Turing en 2018. C'est l'équivalent du prix Nobel de l'informatique pour le travail qu'il a accompli sur les réseaux neuronaux. Et il est brillant. Il a passé les 12 dernières années en tant que scientifique en chef de l'IA chez Meta, construisant le modèle même qu'il qualifie maintenant d'impasse.

Ainsi, les grands modèles de langage font une chose très bien. Ils prédisent le prochain jeton. Vous donnez au modèle du texte. Il détermine quel mot est le plus susceptible de suivre, le crache, puis recommence encore et encore des dizaines de milliers de fois jusqu'à ce que vous ayez un paragraphe. C'est vraiment impressionnant. Mais si vous demandez à GPT ce qui se passe lorsque vous poussez un verre d'une table, il vous dira qu'il tombe et se casse. Il le sait, mais il ne sait pas pourquoi. Il sait que les mots verre, tomber et casser apparaissent constamment ensemble dans les phrases. Et c'est toute la base de sa réponse. Il ne comprend aucune physique, ni gravité, ni élan. Juste une mise en correspondance de motifs sur le langage que les humains ont écrit à propos de ces choses.

Vous pouvez soutenir qu'un chat domestique en sait plus sur le fonctionnement réel du monde que le modèle d'IA le plus cher jamais construit. Votre chat a un modèle mental de la gravité. Il planifie ses sauts. Il anticipe où un objet en mouvement va atterrir. Et il comprend que si quelque chose est mal équilibré, il va tomber. GPT n'a rien de tout cela. Il n'a que du texte à propos de ces choses. Et Lee Kun soutient que ces entreprises d'IA qui consacrent plus de puissance de calcul et de données aux LLM est une perte de temps et ne résoudra pas les problèmes fondamentaux. Par exemple, Meta Llama 4 est sorti en avril 2025. Lorsqu'il est sorti, les scores de référence ont grimpé en flèche. Mais lorsque les développeurs l'ont eu entre les mains, ils ont immédiatement commencé à se plaindre. Les performances dans le monde réel étaient loin d'être à la hauteur de ce que l'évaluation suggérait.

Tous ces modèles d'IA sont devenus très bons pour passer des tests, ce qui n'est pas la même chose que de devenir plus intelligent. Lee Kun dit que cela allait arriver depuis des années. Et il a cinq problèmes spécifiques avec les LLM. Et chacun d'eux, je suis sûr que vous les avez rencontrés. Un, ils n'ont aucune compréhension de la réalité. Le langage est une description du monde, pas le monde lui-même. Une bonne façon de le dire est que s'entraîner sur du texte, c'est s'entraîner sur une ombre de la réalité. Le modèle apprend l'ombre, pas la chose qui la projette. Deux, ils ne peuvent pas raisonner. Ce qui ressemble à du raisonnement dans les modèles de chaîne de pensée n'est toujours que de l'échantillonnage. La façon dont cela fonctionne est que le modèle génère de nombreux chemins possibles et un second système choisit simplement celui qui semble le plus plausible. Donc, ce n'est toujours pas du raisonnement ou de la pensée. C'est juste plus de devinettes coûteuses. Trois, Leon soutient que les hallucinations ne peuvent pas être corrigées avec plus d'apprentissage par renforcement avec rétroaction humaine ou simplement en ajoutant plus de données. Elles sont une conséquence directe d'un modèle qui fonctionne sans simulation causale de la réalité. Et lorsqu'aucune vérité fondamentale n'existe dans l'espace latent, le modèle comble ces lacunes avec une fiction statistiquement plausible. Essentiellement, des informations inventées. Vous pouvez le réduire, mais ces réductions ne sont que des pansements sur le problème. Elles ne le résolvent pas. Quatre, les modèles de langage ne peuvent rien planifier structurellement. Par exemple, un adolescent apprend à conduire en environ 20 heures. Et même après avoir dépensé des milliards en recherche, nous n'avons toujours pas de conduite autonome de niveau cinq. Mais cela indique que quelque chose dans l'approche sous-jacente ne correspond pas au fonctionnement réel du monde physique. Et cinq, Lee Kun dit que la mise à l'échelle atteint un mur. Au cours des dernières années, l'industrie de l'IA a mené les expériences. Ils ont ajouté plus de paramètres, plus de puissance de calcul, plus de données, plus d'apprentissage par renforcement avec rétroaction humaine, ajouté des couches de raisonnement. Mais les gains de référence diminuent par rapport au coût. Lee Khun pense que ce ne sont pas des plateaux temporaires. Ce sont des plafonds structurels.

Alors, qu'est-ce qu'il pense qui fonctionne réellement ? Comment va-t-il apporter une véritable intelligence artificielle ? Son idée principale s'appelle JEPA, architecture prédictive à jointure d'encodage. La différence avec un LLM réside dans l'endroit où se produit la prédiction. Nous en avons parlé plus tôt, mais un LLM prédit dans l'espace des jetons. Ce sont des mots ou des pixels réels. Jeepa prédit dans un espace de représentation abstrait. Donc, les modèles de langage demandent quel mot vient ensuite, mais Jeepa demande quelle structure vient ensuite. Il ignore les détails qui n'ont pas autant d'importance. La texture du mur, par exemple, la couleur de la tasse, et essaie de comprendre la dynamique sous-jacente, ce qui bouge, ce qui va se passer, et pourquoi.

Il a décrit cela comme apprendre de la manière dont un bébé apprend. Un bébé ne lit pas sur la gravité. Il apprend en laissant tomber des choses, en les regardant tomber, puis en construisant un modèle interne de cause à effet à partir de simples observations brutes. Ainsi, la deuxième version de Jeppa, qui est V Japa 2, est une version vidéo de cette architecture. Lee Kun et son équipe ont entraîné ce modèle avec plus d'un million d'heures de vidéos internet, juste des séquences brutes du monde, qui incluent des choses comme des humains qui ramassent des objets, des objets qui tombent, des choses qui sont poussées, lâchées et empilées. Le modèle regarde tout cela et construit une compréhension interne du comportement réel du monde physique. Et une fois qu'ils ont eu ce modèle pré-entraîné, ils lui ont donné 62 heures de séquences de robot, ce qui n'est pas beaucoup, d'ailleurs. Le but n'était pas de lui apprendre le monde. Il avait déjà cette information du pré-entraînement, mais c'était juste pour lui apprendre comment un bras de robot bouge, et c'était tout ce dont il avait besoin. Ils l'ont déployé dans deux laboratoires complètement nouveaux avec des objets qu'ils n'avaient jamais vus.

Revenons à la vidéo dans une minute. Regardez ceci. Donc, vous exécutez un agent IA en production, n'est-ce pas ? Il y a des milliers de traces qui arrivent chaque jour et il n'y a aucun moyen de les lire. Personne ne le fait. Mais quelque part là-dedans, il y a quelque chose qui se casse silencieusement et vous n'avez aucune idée de ce que c'est. Brain trust vient de lancer une fonctionnalité appelée "topics" qui parcourt toutes vos traces de production et vous dit simplement ce qui se passe. Comme vos utilisateurs sont frustrés ici. Il y a cette chose spécifique qui continue d'échouer. Des détails sur les choses les plus courantes que les gens essaient réellement de faire. Vous pouvez donc me montrer toutes les traces où le sentiment était négatif pour cette tâche spécifique et en construire un ensemble de données d'évaluation. Il existe même un moyen de comparer vos traces de production à vos évaluations pour voir où se situent les lacunes. Comme si un mode d'échec continue d'apparaître dans votre production mais jamais dans vos évaluations, vous savez maintenant exactement quoi réparer, ce qui, oui, celui-ci est plutôt énorme. Si vous expédiez des agents IA et que vous naviguez à l'aveugle sur ce qui se passe réellement, c'est la chose qui résout cela. Gratuit à essayer dès maintenant. Liens dans la description. Maintenant, retour à la vidéo.

Ainsi, le million d'heures et les 62 heures fonctionnent ensemble. L'un lui a donné le monde tandis que l'autre lui a donné le corps, et ensemble, ils ont trouvé le reste. Et gardez à l'esprit qu'un modèle traditionnel aurait besoin de milliers d'heures de données de robot étiquetées. Il devrait être spécifique à chaque environnement, spécifique à chaque objet. il devrait être réentraîné chaque fois que quelque chose changeait. V Japat 2 avait besoin de 62 heures et s'est généralisé de lui-même. Je veux souligner que ce n'est pas une petite différence. C'est une philosophie différente de ce que signifie même l'apprentissage pour un modèle d'IA. Et tout cela n'est qu'une expérience avec un seul modèle. AMI Labs de Lee Kun construit le système complet et ils ont tout l'argent dont ils ont besoin. L'architecture de Jeppa comporte six parties différentes. Et je sais que cela semble technique, mais restez avec moi car c'est en fait assez simple lorsque vous voyez ce que chaque pièce fait. Vous avez un configurateur. Vous pouvez le considérer comme la partie qui définit l'intention. Il examine la tâche et dit à tout le reste ce qui est important en ce moment. Ensuite, il y a un module de perception qui lit l'environnement. Il regarde ce qui est là, ce qui bouge, et ce qui a changé récemment. Ensuite, vous avez le modèle du monde, qui est le cœur de tout. Il prédit ce qui va se passer. Il exécute constamment une simulation de ce qui va suivre. Le système anticipe donc ce qui est susceptible de se produire dans le monde. Ensuite, il y a un module de coût qui est la partie qui demande si c'est une bonne idée. Il évalue essentiellement les actions potentielles avant de s'engager dans l'une d'elles. Ensuite, il y a un acteur qui transforme le meilleur plan en mouvement réel. Et enfin, une mémoire à court terme pour que le système ne perde pas de vue ce qu'il a déjà fait.

Lorsque vous mettez tout cela ensemble, vous avez un système qui poursuit des objectifs. Il comprend le monde, construit un modèle de ce qui se passe. Il réfléchit à l'avance, évalue ses opinions, puis agit. Ce n'est pas un chatbot plus intelligent. C'est quelque chose de véritablement différent. Et il est important de comprendre que ces six modules ne traitent aucun texte. Ils opèrent directement sur des représentations du monde physique. Donc, des choses comme la position, le mouvement, la cause et l'effet. Il n'y a pas de couches linguistiques intermédiaires. Il ne pense pas en mots, il pense en physique.

Donc, les modèles de langage sont vraiment une impasse. Vous pouvez rendre une machine à vapeur plus efficace pendant 100 ans, mais vous n'obtiendrez jamais un avion à réaction. Et il ne s'agit pas de savoir si l'IA actuelle est impressionnante. Nous savons tous qu'elle l'est. La question est de savoir si toute l'industrie optimise la mauvaise chose, investissant des centaines de milliards pour rendre l'auto-complétion plus rapide alors que le plafond de l'auto-complétion pourrait être beaucoup plus bas que quiconque ne veut l'admettre. Lee Kun a un milliard de dollars disant que les LLM sont une impasse alors que le reste de l'industrie a environ 500 milliards disant qu'il a tort. L'un d'eux aura l'air très idiot dans les 5 prochaines années. Suivez et je vous tiendrai informé.