Transcription
J'avais planifié tout mon week-end. J'allais me concentrer et utiliser le modèle d'IA le plus puissant de la planète, Fable 5, pour construire cette idée folle sur laquelle je réfléchissais. Puis, vendredi à 17h21, le gouvernement américain a envoyé une lettre à Anthropic. Et vendredi soir, le modèle avait disparu, désactivé pour tout le monde. Sans avertissement, sans appel. Et je suis resté là, pensant à quel point tout cela est fragile. Nous avons tous construit nos entreprises, nos flux de travail, notre processus créatif entier sur des modèles qui vivent sur les serveurs de quelqu'un d'autre, contrôlés par les conditions de quelqu'un d'autre, à une lettre gouvernementale de disparaître. Donc, ce week-end, je ne construirai avec aucun modèle de pointe. Pas du tout. Et c'est l'épisode que je devais faire. À la fin de cet épisode, vous comprendrez ce que sont les modèles locaux, pourquoi ils sont soudainement plus importants qu'il y a une semaine, lesquels utiliser exactement, quel matériel vous avez besoin, et quelques idées de startups qui n'existent que parce que l'intelligence fonctionne désormais sur votre bureau gratuitement. Je pense que cela a ouvert un tas d'opportunités lucratives que je vais partager à la fin de cet épisode. Allons-y. Alors, laissez-moi vous dépeindre ce qui s'est réellement passé, car la leçon est plus grande que cette seule interdiction de modèle. Les modèles de pointe sont incroyables. Vous savez, je serai le premier à le dire. Personne ne le conteste. Mais ils partagent tous la même faiblesse. Vous ne les possédez pas. Vous louez l'accès. Et l'accès loué peut être révoqué à tout moment par un gouvernement, par un changement de politique, par un changement de prix. Comme ils pourraient simplement le rendre si cher que vous ne pouvez pas y accéder. Par la décision de l'entreprise que votre cas d'utilisation viole une condition que vous n'avez pas lue. Nous venons de voir cela se produire en temps réel. Le modèle le plus puissant sur Terre a disparu du jour au lendemain. Et je veux être clair, je ne suis pas anti-cloud. J'utilise ces modèles cloud tous les jours et les modèles cloud seront les plus puissants. Vous savez, ils seront meilleurs que les modèles locaux juste en termes de ce que vous obtenez, le meilleur possible. Ce sont les outils les plus intelligents disponibles. Mais ce que cela m'a appris, c'est que vous avez besoin de posséder une partie de votre pile. Vous avez besoin d'une couche que personne ne peut vous retirer. Et la façon dont j'y pense, c'est comme l'électricité. La plupart du temps, vous êtes heureux d'être sur le réseau, n'est-ce pas ? C'est moins cher. C'est plus facile. Quelqu'un d'autre s'en occupe. Mais les gens qui sont vraiment résilients ont un générateur dans le garage. Vous savez, une tempête arrive et les lumières s'éteignent, eh bien, ils ont ce générateur qui continue de fonctionner et ils peuvent réellement utiliser leurs affaires. Les modèles locaux sont essentiellement ce générateur pour vous. Et je sais ce que beaucoup de gens vont dire dans les commentaires. Ils vont dire : "Eh bien, les modèles locaux ne sont pas bons du tout." Et ce n'est tout simplement plus vrai. Je pense que le changement s'est probablement produit il y a environ 6 mois. Il y a deux ans, faire fonctionner un modèle sur votre ordinateur portable était littéralement nul. Peut-être il y a un an aussi. Mais aujourd'hui, un modèle qui fonctionne sur une carte graphique de jeu ou un Mac décent est suffisant pour environ, je dirais, 80% de ce que la plupart des gens utilisent pour des choses comme ChatGPT ou le cloud. L'écart entre le gratuit et le local et le cloud cher s'est refermé plus rapidement que je ne le pensais, y compris moi-même. Alors, parlons de ce qu'est un modèle local. Et je veux le rendre très simple. Vous savez comment je suis sur cette chaîne et ce podcast. J'aime simplifier les choses pour moi-même et pour vous, car je ne veux pas effrayer les gens. Un modèle local est un modèle d'IA qui fonctionne entièrement sur votre propre ordinateur. Vous n'avez pas besoin d'Internet. Vous n'avez pas besoin d'une clé API. Et vous n'avez pas de coût par jeton. Aucune entreprise ne vous surveille. Vous téléchargez simplement le fichier du modèle une fois et à partir de ce moment-là, il est à vous. Il fonctionne sur votre machine de la même manière qu'un jeu vidéo ou un éditeur de photos pourrait fonctionner sur votre machine. Et c'est tout. C'est tout le concept. Nous n'avons pas besoin de compliquer les choses. Essentiellement, l'intelligence vit sur votre matériel au lieu de celui de quelqu'un d'autre. Et vous obtenez trois choses principales que vous n'obtenez pas avec les modèles cloud. La première chose que vous obtenez est la confidentialité. Vos données ne quittent jamais votre machine. Et ce n'est pas seulement agréable pour vous personnellement. C'est une ouverture complète pour vendre à un tas d'industries différentes auxquelles vous pourriez vouloir vendre, comme la santé, le droit ou la finance, des industries qui ne peuvent légalement pas envoyer leurs données à une API tierce. Et il y a en fait une tonne de ces industries. Nous en parlerons davantage lorsque nous aborderons les idées de startups. Alors, mettons cela en attente. Le deuxième point principal est que vous avez un coût marginal nul. Donc, une fois que vous avez le matériel, et bien sûr, vous devez dépenser de l'argent sur le matériel, et le matériel devient de plus en plus cher. Mais une fois que vous avez le matériel, chaque requête est gratuite, elle est illimitée et vous pouvez faire fonctionner un modèle 24 heures sur 24 pendant un mois et votre facture ne sera que l'électricité. Cela change vraiment les calculs pour toute une catégorie de produits et cela ouvre beaucoup de choses. La troisième chose est que personne ne peut l'arrêter. Le modèle sur votre disque fonctionne, que l'entreprise qui l'a créé existe encore ou non. Que le gouvernement l'aime ou non, cela n'a pas d'importance. Que votre connexion Internet soit active ou non. Il fonctionne dans un avion. Il fonctionne dans un bunker. Il fonctionne tout simplement. Donc, oui, vous obtenez beaucoup, vous obtenez des avantages principaux, mais comme pour tout dans la vie, il y a des pour et des contre. Alors, parlons des compromis, car je ne veux pas vous vendre un fantasme. Je ne suis pas là pour vous vendre un fantasme. Je suis là pour vous dire quels sont les pour, quels sont les contre, et comment et ce que je trouve intéressant à ce sujet. Le compromis est que les modèles locaux ne sont généralement pas aussi intelligents que les modèles de pointe absolus. Les plus grands modèles ouverts peuvent rivaliser avec le cloud, mais ils ont besoin de matériel très, très performant. Et il y a, vous verrez des gens sur X faire des choses incroyables avec le local, et la plupart du temps, ils dépensent 5 000, 10 000, 15 000, 20 000 dollars sur des machines. Ceux qui fonctionnent sur un ordinateur portable normal sont un cran en dessous des meilleurs modèles cloud. Mais la façon dont je commence à y penser et à le reformuler, c'est que vous n'avez pas besoin d'une intelligence de pointe pour la plupart des tâches. Vous avez besoin d'une intelligence suffisamment bonne, privée, gratuite et toujours active. Et ensuite, vous devez faire correspondre le bon modèle au bon travail. Et cela devient une toute nouvelle compétence. Et nous allons y arriver. Alors, comment devenir bon avec les modèles locaux, ce qui est quelque chose que j'essaie de comprendre ce week-end et que je partage en temps réel. C'est vraiment le cœur de cet épisode. Si vous voulez vraiment devenir bon dans ce domaine et ne pas simplement hocher la tête en regardant des vidéos YouTube et des podcasts, voici l'ordre dans lequel je l'apprendrais. La première chose est de commencer par le runtime. Tout le monde fait ça à l'envers. Ils partent à la recherche du modèle parfait avant même de pouvoir en exécuter un. C'est le mauvais ordre. La première chose que vous téléchargez est le runtime, le programme qui exécute réellement les modèles sur vos machines. Il y a deux noms principaux à connaître : Ollama et LM Studio. Ollama est généralement le préféré de beaucoup de mes amis développeurs car il fonctionne en ligne de commande. Il est relativement simple car il suffit d'une commande et il exécute le modèle. Mais LM Studio est celui que je recommanderais aux personnes non techniques car il a une vraie interface. Il a un navigateur de modèles. Vous cliquez et il fonctionne. Et il n'y a pas de terminal, et vous savez que ces choses font peur. C'est un peu la partie que beaucoup de gens compliquent. Téléchargez simplement l'un de ces deux programmes en premier, celui qui vous semble le plus attrayant, et vous aurez un modèle en cours d'exécution en 10, 15, 20 minutes. La deuxième chose est que vous voudrez faire correspondre le modèle à votre matériel. La taille d'un modèle est mesurée en milliards de paramètres. Vous verrez des nombres comme 4 milliards, 12 milliards, 27 milliards, 70 milliards. Plus grand signifie généralement plus intelligent, mais plus grand signifie aussi plus de mémoire pour fonctionner. La chose la plus utile à comprendre dans cet épisode est la correspondance approximative entre la taille du modèle et le matériel. Un modèle de 4 milliards fonctionne sur pratiquement n'importe quoi. Un ordinateur portable avec 8 Go de RAM, même beaucoup de téléphones. Un modèle de 12 milliards est le point idéal pour une machine avec 16 Go de RAM. C'est là que la plupart des gens devraient se situer. Un modèle de 27 à 35 milliards nécessite un très bon Mac avec 30 Go ou plus, ou une carte graphique dédiée. C'est là que cela commence à sembler vraiment performant. D'après mon expérience, un modèle de 7 milliards et plus nécessite du matériel sérieux. Un Mac Studio configuré au maximum ou une machine dédiée comme un Nvidia DGX A100 avec 128 Go de mémoire unifiée. Le DGX A100 est intéressant et j'en ai parlé dans ce podcast auparavant car il est spécialement conçu pour cela, 128 Go de mémoire, il reste allumé 24h/24 et 7j/7. Il fonctionne sous Linux et devient vraiment la machine par défaut pour l'IA sur votre bureau pour les personnes qui sont sérieuses. Je ne suis pas affilié à Nvidia. C'est juste ce que je remarque dans l'industrie. Vous exécutez votre modèle dessus, vous le laissez fonctionner et vous vous y connectez depuis votre téléphone. Votre bureau devient ainsi un mini centre de données, du moins tel que je le vois. La troisième chose à savoir est de savoir quel modèle pour quel travail. Il y a évidemment un tas de modèles et je n'ai pas assez de temps pour tous les couvrir, mais je vais vous donner les quatre principaux que vous devez connaître. Qu'est-ce que le modèle 3 et la nouvelle série 3.6. Le meilleur choix polyvalent pour la plupart des gens, je pense. C'est la famille de modèles ouverts d'Alibaba. Il est assez performant en codage, performant en multilingue. Il a une licence commerciale claire. Ils ont des versions de 27 milliards et 35 milliards. Et il semble qu'il surpasse son poids. Il surpasse les modèles de la génération précédente, quatre fois leur taille. Si vous n'en apprenez qu'un, c'est probablement celui-là. Mais c'est l'un d'eux. L'autre est DeepSeek. Vous avez probablement entendu parler de DeepSeek. Il est très bon pour les problèmes de réflexion et de codage difficiles. Mais attention, les modèles de raisonnement prennent 10 à 30 secondes pour réfléchir avant de répondre. Et c'est normal. Si vous installez DeepSeek et que vous vous dites, pourquoi cela prend-il autant de temps ? C'est généralement ce que j'ai vu, cela prend environ 10 à 30 secondes. Le troisième est Gemma. Et c'est le modèle ouvert de Google. Et si j'étais Google en ce moment, je lancerais une nouvelle version de Gemma tout de suite et je profiterais de ce moment. Celui-ci fonctionne remarquablement bien. Il existe même une version qui tient dans 16 Go de RAM. Et celle-ci, c'est celle qui peut tenir sur votre téléphone. Il a une écriture belle et propre. Le fait que Google offre cela gratuitement est en fait fou. Et je ne serais pas surpris si Google redoublait d'efforts à l'avenir. Ensuite, il y a Llama de Meta. Il est devenu très important dans tout l'écosystème ouvert. Il a une énorme communauté, une tonne de fine-tunes. Il a beaucoup de tutoriels que vous pouvez consulter. Il fonctionne presque partout. Donc, en cas de doute, il y a probablement un Llama pour votre situation. Le quatrième point principal que vous devriez apprendre sur les modèles locaux est ce qu'on appelle la quantification. Personne n'en parle vraiment et c'est une astuce très importante concernant les modèles locaux. Et la quantification est ce concept de réduire un modèle afin qu'il fonctionne sur du matériel moins performant avec une perte de qualité à peine perceptible. L'analogie que j'utilise pour cela est qu'un modèle brut est comme une photo non compressée. La quantification, c'est comme enregistrer un JPEG de haute qualité. C'est beaucoup plus petit et votre œil ne voit vraiment pas la différence. Lorsque vous téléchargez des modèles, vous verrez des étiquettes comme Q4 ou Q5. La quantification, c'est comme le niveau de compression. C'est le niveau de compression de quantification. Et Q4 a à peu près la mémoire dont un modèle a besoin avec une perte de qualité minimale. Et c'est ainsi qu'un modèle qui est censé nécessiter un serveur fonctionne en douceur sur votre ordinateur portable. Comprendre ce concept est donc vraiment essentiel. Et c'est essentiel parce que c'est ce qui permet à votre matériel de faire soudainement deux fois plus. Le cinquième point principal est que vous voudrez vous connecter à votre agent. Donc, faire fonctionner un modèle et discuter avec lui, c'est bien, mais la vraie percée est de pointer un agent vers votre modèle local. Vous pouvez donc utiliser quelque chose comme Hermes pour cela. J'ai couvert Hermes. Je pense que la semaine dernière, j'ai fait un épisode sur l'application de bureau Hermes. Vous pouvez aller le voir. Hermes est l'agent le plus utilisé au monde en ce moment, je dirais. Il gagne certainement le plus d'engouement et de buzz, et il est en fait conçu spécifiquement pour fonctionner localement et ne jamais s'arrêter. Vous pointez un profil Hermes vers votre modèle local et vous avez maintenant un agent qui fonctionne gratuitement, hors ligne, se souvient de tout, écrit ses propres compétences et vous pouvez lui envoyer des messages via votre application de messagerie préférée comme Telegram ou autre, pendant que le travail lourd s'exécute sur la machine de votre bureau. Donc, super cool. Encore une fois, j'ai cet épisode que j'ai fait la semaine dernière que j'inclurai dans la description si les gens veulent en savoir plus sur les profils d'agents et leur connexion aux modèles locaux. Ce sont donc les points clés que je dirais concernant ce que je dois savoir sur les modèles locaux. Cela vous aide à vous lancer. Mais vous savez, comment passer au niveau supérieur ? Comment séparer les professionnels des touristes ? L'un d'eux est que la fenêtre de contexte est votre véritable contrainte localement. Les modèles cloud vous offrent une énorme fenêtre de contexte gratuitement. C'est comme ça qu'il faut le voir. Les modèles locaux vous font payer en mémoire. Donc, plus le contexte est grand, plus il consomme de RAM. Gardez donc vos sessions courtes, très courtes, et ne déversez pas toute votre vie dans un seul fil, sinon votre machine va s'étouffer et vous direz : "Les modèles locaux ne sont pas très bons." Vous voudrez donner des outils à votre modèle local. Ainsi, un petit modèle local avec recherche web, accès aux fichiers, capacité d'exécuter du code bat un modèle géant sans rien. L'écart de capacité se comble rapidement lorsque vous connectez les bons outils. Pensez-y comme si le modèle était le moteur et les outils les roues. Maintenant, une chose courante qui arrive avec les modèles locaux, c'est qu'il oublie parfois vos outils. Je ne sais pas si d'autres personnes l'ont remarqué. J'essaie encore, vous savez, j'apprends en temps réel, comment en tirer le meilleur parti, comment il n'oublie pas, mais sachez simplement que c'est une bizarrerie qui, au moment où j'enregistre ceci, juin 2026, se produit. Parfois, rappelez-vous que la confidentialité est la fonctionnalité clé ici. Donc, tout fonctionne hors ligne. Vos données ne quittent pas la machine. Et juste, je parlerai de cela plus en détail avec les idées de startups et comment vous pouvez en tirer parti. La dernière chose que je dirai sur les concepts qui séparent les professionnels des touristes, c'est qu'il est en fait très utile de faire fonctionner un petit modèle local à côté d'un modèle cloud de pointe pendant une semaine. Parce que cela vous aide à développer l'instinct. Je pense que c'est le moyen le plus rapide de développer l'instinct. Et vous serez choqué de voir à quel point le modèle local gratuit est souvent suffisant. Vous vous verrez donc arrêter de vous tourner vers l'option coûteuse pour des choses qu'un modèle de 12 milliards gère très bien. Et cet instinct, savoir quoi exécuter où, c'est la compétence que nous essayons d'acquérir ici. Ce moment Fable 5 d'être banni et autres, c'est juste un appel au réveil pour apprendre à utiliser les modèles locaux. Et c'est probablement pourquoi vous êtes ici à m'écouter en parler aujourd'hui. Je voulais donc vous donner, c'est le début, je veux vous donner quelques idées de startups. Après tout, c'est le podcast des idées de startups. Je suis là non seulement pour clarifier comment vous apprenez à utiliser l'IA et à être pratique, mais aussi pour vous aider à stimuler votre créativité autour d'idées de startups qui n'existent que pour une raison particulière. Et il existe des idées de startups qui n'existent que maintenant parce que les modèles locaux existent et parce que beaucoup de gens, je veux dire, c'est une nouvelle grand public. Beaucoup de gens voient que ces modèles cloud pourraient être interdits. Il y aura donc une énorme demande, à mon avis, pour les modèles locaux au cours des prochaines années. Donc, une idée de startup que je voulais vous donner est l'IA sur appareil pour les industries réglementées. C'est un gros problème. Nous en avons parlé un peu plus tôt, mais la santé, le droit, la finance, ils ont de l'argent, ils ont des problèmes que l'IA peut résoudre, mais ils ne peuvent légalement pas envoyer leurs données à une API cloud. Donc, un produit où le modèle fonctionne entièrement sur l'appareil du client. Les données ne quittent jamais le bâtiment. Cela ouvre un marché auquel les concurrents basés sur le cloud ne peuvent pas accéder actuellement. Donc, cette contrainte de confidentialité est votre objectif et vous commencez simplement à vendre à ces types de personnes. La deuxième idée de startup est que vous la vendez essentiellement comme la version "vos données ne quittent jamais" des outils d'IA existants. Alors, allez, choisissez n'importe quel produit d'IA cloud populaire : prise de notes, résumés de réunions, analyse de documents, puis créez des versions locales de ces produits. C'est le même produit, mais le discours est essentiellement que rien de ce que vous nous donnez ne touche Internet. Et vous mettez cela sur la proposition de valeur principale de la page d'accueil. Vous le faites pour les avocats, pour les médecins, les thérapeutes, et toute personne manipulant des documents sensibles. C'est la phrase qui pourrait aider à conclure l'affaire. Troisième idée de startup, l'agent air-gapped pour les opérations sensibles. Certaines entreprises ne peuvent pas être en ligne du tout pour des raisons de sécurité, les sous-traitants de la défense, certaines opérations financières, toute personne paranoïaque quant aux fuites. Donc, vous faites une configuration d'agent qui fonctionne entièrement hors ligne sur du matériel local, et ils seront prêts à payer. Donc, ce n'est pas seulement l'idée de startup numéro un, c'est juste les industries réglementées, mais l'idée de startup numéro trois concerne vraiment les fuites et les opérations sensibles. Vous pourriez avoir une industrie pas si sensible, mais ils ont une opération sensible. C'est cette niche. La quatrième idée que j'ai pour vous est l'IA hors ligne pour les endroits sans internet. Navires, avions, cliniques rurales, opérations sur le terrain, zones sinistrées, une IA utile, des agents utiles qui fonctionnent sans internet est un produit que toute l'industrie du cloud ne peut tout simplement pas servir. Et puis la dernière idée que je vous donne est la résilience en tant que service. Après ce week-end, toutes les entreprises sérieuses vont se demander : "Qu'arrive-t-il à nos flux de travail d'IA si notre fournisseur est coupé ?" Et vous vendez la réponse. C'est essentiellement une couche de secours qui intervient lorsque les modèles cloud disparaissent. Vous vendez donc une assurance contre exactement ce qui s'est passé avec l'interdiction de Fable 5. Dans l'ensemble, j'essaie encore de digérer les nouvelles et tout ça, mais ce qui me revient sans cesse, c'est que ce week-end était censé être consacré à la construction avec le modèle le plus puissant de la planète, mais il est plutôt devenu quelque chose de plus durable. La leçon n'est pas que le cloud est mauvais et le local est bon. Je ne veux pas ça. Ce n'est pas le cas. La leçon est de ne pas construire toute votre vie sur quelque chose qui peut disparaître avec une seule lettre. Possédez une partie de votre pile. Ayez le générateur dans le garage. Les modèles locaux sont l'assurance. Et c'est ce week-end que j'ai enfin acheté la police. Et vous savez, lorsque vous jouez avec ces modèles locaux, vous apprendrez qu'ils ne sont pas parfaits. Ils ne sont pas le modèle le plus puissant de la planète, mais pour 60%, 70%, 80% des tâches routinières, ils sont en fait assez bons. Et il existe une large gamme de ces cas d'utilisation. Donc, au cours des prochains jours, je vous encourage à jouer avec ces modèles, ne vous contentez pas de regarder ou d'écouter et de hocher la tête. Téléchargez Ollama ou LM Studio, prenez Quake 3, exécutez-le, pointez Hermes dessus, choisissez une tâche réelle et forcez-vous à la faire entièrement en local. Et c'est vraiment comme ça que tout cela se met en place. Et une fois que vous jouez avec et que vous mettez la main à la pâte, vous comprendrez un peu mieux ce que je dis. Et la prochaine fois que quelque chose sera interdit ou que quelque chose sera hors de prix, vous pourrez toujours gérer votre entreprise, vous pourrez toujours livrer vos idées, vous pourrez toujours faire des choses, et dans le meilleur des cas, vous aurez des modèles cloud faisant XYZ et des modèles locaux faisant ABC. Si cela vous a intéressé, si vous avez appris une chose ou deux, faites-moi une faveur. En fait, j'allais dire faites-moi une faveur, mais faites un like, un commentaire et abonnez-vous. Cela signifie simplement que davantage de contenu de ce type apparaîtra dans votre flux. Et cela me dit aussi que je devrais continuer à faire cela et à partager ce que j'apprends en temps réel. J'espère que vous construirez quelque chose de cool. J'espère que vous avez appris une chose ou deux. Je vous soutiens. Maintenant, allez construire quelque chose aujourd'hui que personne ne pourrait arrêter. Et je vous verrai dans le prochain. Prenez soin de vous et passez une journée créative.