Transcription
Les amis, je suis devenu littéralement accro à des outils comme ChatGPT ou Claude, et je suis certain que vous aussi. Je les utilise littéralement plus d'une centaine de fois dans une seule journée.
Mais récemment, j'ai dû prendre un vol long-courrier, donc de 9h, pour aller en Inde sans connexion internet. Et la panique ! J'avais une grosse session de taf qui m'attendait dans l'avion, et je savais pertinemment que j'allais être beaucoup moins productif sans un outil comme ChatGPT ou Claude.
Alors, heureusement que j'ai trouvé une solution avant de monter dans le vol, qui est celle d'installer une IA conversationnelle, un petit peu comme ChatGPT, mais en local sur mon ordi, et donc pas besoin de connexion internet. Et ce serait la cerise sur le gâteau, c'est 100 % gratuit et beaucoup plus sécurisé si jamais on balance des informations confidentielles sur ce genre de chatbot conversationnel.
Dans cette vidéo, je vais vous montrer comment faire. Vous allez voir, c'est assez simple quand on sait où regarder et quoi faire. Vous allez voir, c'est un game changer une fois qu'on a une solution à nous, et donc on est beaucoup plus indépendant que n'importe quel outil comme ChatGPT. Mais je ne vais pas vous mentir, il y a des avantages et des inconvénients à utiliser des IA locales vs des IA propriétaires. Mais on va voir tout ça dans cette vidéo.
Mais avant ça, je vous fais une petite démo. Alors, pendant toute cette vidéo, je vais couper ma connexion internet pour vous montrer que je ne mens pas. Et en effet, quand là, je suis sur ChatGPT et j'ai envie de lui demander un truc, évidemment, il va me dire que bah, c'est pas possible parce qu'il n'a pas de connexion internet. Donc, il va essayer de chercher quand même, mais là, vu que je n'ai pas de wifi du tout, il me dit "La connexion est impossible".
Et donc moi, je vais utiliser Enchanted. Enchanted, qui est une interface graphique qui permet bien d'utiliser des modèles locaux que moi, j'ai installés sur mon ordi. C'est des modèles open source. On va voir plus en détail ce que c'est tout à l'heure. Mais un peu comme ChatGPT, où en fait, ChatGPT nous permet d'aller regarder et d'utiliser plusieurs modèles différents. Là, moi, j'ai installé mes propres modèles.
Donc, comment ça marche ? Je vais aller, par exemple, lui poser une question simple : "Est-ce que tu peux m'aider à écrire une vidéo, une intro pour ma vidéo sur l'open source ?" Hop, il s'exécute et il m'aide. Et donc là, dans l'avion, typiquement, ça m'a permis de brainstormer un petit peu quand j'étais en train de préparer cette vidéo.
Ça, c'est pour les utilisateurs de Mac, parce que Enchanted, il est uniquement disponible sur Mac. Mais vous avez aussi un autre outil pour les utilisateurs Windows. Mais même en général, on va voir que c'est un très bon outil, même pour les utilisateurs de Mac. C'est LM Studio. LM Studio. De la même manière, en fait, il va me permettre ici de choisir des modèles que j'ai installés. Il a aussi une librairie de modèles qu'on va, qu'on va pouvoir installer plus en détail. Ici, on va vraiment voir tout ça tout à l'heure. Donc, ça, c'est tous les modèles open source qui sont disponibles.
Mais de la même manière, si je lui demande : "Corrige-moi ce mail en français", je lui ai donné un mail rapidement à corriger, je lui envoie ça et pareil, il va ici, euh, me corriger ce mail.
J'ai aussi la possibilité dans LM Studio, et bien, contrairement à Enchanted, d'ajouter des images. Donc là, typiquement, si je lui donne cette image et je lui demande de me décrire ce qu'il y a sur l'image, hop, lui, il va pouvoir regarder ce qu'il y a dans cette image, parce que c'est des modèles qui sont multimodaux. Là, Gemma, c'est un modèle de Google qui est open source, et donc il va pouvoir me lire ça. Mais j'aurais pu utiliser Mistral ou d'autres logos, d'autres, pardon, LLM qui me permettent de faire ça. Donc là, il m'explique un petit peu ce qu'il y a sur l'image avec tous les logos qu'il y a dessus, et encore une fois, je suis encore hors ligne.
Euh, dernière chose rapide, c'est l'ajout de PDF. Donc typiquement, je vais ici trouver un PDF qu'il y a sur mon ordi. Et donc, je ne sais pas, je vais trouver une presse, peut-être. Voilà, "Presse Mobile Summit". C'est une presse que j'avais faite pour un client. Donc, j'envoie ça et je vais dire : "Donne-moi le plan de cette presse en PDF." Et donc là, normalement, ce modèle, il est capable d'aller lire dans le PDF et d'aller me prendre les informations. Donc, on va voir ce qu'il va, ce qu'il va me dire. Donc là, ce qu'il est en train de faire, c'est essayer de, de, bah, d'extraire ce qu'il y a sur le PDF. Voilà. Donc, il me fait le plan du PDF. Il me le fait en anglais, je crois que, parce que la presse, je ne sais pas si elle est en anglais. Non, elle n'est pas en anglais, mais je peux, comme dans ChatGPT, et bien, mettre des "system prompts". Euh, donc, je peux aller, par exemple, dans Enchanted et dans Settings, je peux lui mettre un "system prompt" qui lui dit que tout ce qui va se passer dans cette application va se faire uniquement en français ou en anglais, peu importe.
Bon, la réalité, c'est que je vous démontrerai là, euh, uniquement deux exemples sur cinq. Euh, pour ces exemples-là, j'ai besoin, en fait, de vous donner un peu plus de contexte, de vous donner, euh, euh, ce qui va se passer dans la suite de cette vidéo. Et donc, euh, pour, euh, pour mieux comprendre, il faut qu'on avance un petit peu.
Mais pour tous ceux qui me découvrent via cette vidéo, je m'appelle Chouam Charma. Euh, aujourd'hui, je forme des milliers de personnes à l'automatisation et à l'IA. Avant ça, j'étais ingénieur développeur dans plusieurs start-ups françaises et scale-ups françaises également. Euh, et notamment, j'ai travaillé pas mal avec des outils open source comme MLflow ou encore PM2, pour les développeurs à qui ça parle. Et aujourd'hui, je passe tout mon temps à geeker sur les outils d'IA. On est dans un monde qui va très, très vite. Et donc, euh, je vous partage un petit peu sur cette chaîne YouTube tout ce que je trouve. N'hésitez pas à vous abonner si, euh, vous êtes nouveau ici.
Maintenant que les connaissances sont faites, je vous présente un petit peu le plan de cette vidéo. Donc, avant de voir les trois exemples restants, on va d'abord commencer à regarder ce que c'est qu'un modèle open source, comment ça fonctionne un petit peu, et surtout comment l'installer sur notre ordi. On a deux possibilités, et on va voir les deux, que vous soyez sur Mac ou sur Windows. Et, et ensuite, on va comprendre un petit peu comment est-ce qu'on choisit ces modèles open source. Donc, c'est "large language model", ça s'appelle des LLM. On en entend souvent parler. J'ai même fait une vidéo sur ce que c'est qu'un LLM si jamais vous ne savez pas, mais on va le revoir aussi également. Comment choisir son modèle ? Euh, on va voir quelles sont les, les manières et les bonnes pratiques pour choisir ces différents modèles open source. Et ensuite, on va voir comment est-ce qu'on va optimiser petit à petit l'utilisation, euh, et on va voir aussi des utilisations avancées avec N8N, et aussi comment est-ce que, sans connexion internet, on peut utiliser, et bien, de la génération de code avec des modèles qui sont open source. Ce qui, honnêtement, avant de faire cette vidéo, je ne le savais même pas. Donc, franchement, c'était même une découverte pour moi. Donc, je vous incite vraiment à, à, si vous êtes curieux et, et peut-être un peu avancé, de rester jusque-là. Et même pour les nouveaux, hein, je pense que c'est vraiment quelque chose de, de génial de savoir que ça existe.
Il y a de plus en plus de boîtes qui vont vers ces solutions open source, tout simplement parce que elles sont beaucoup plus sécurisées. Notamment, quand on a, par exemple, un cabinet d'avocats, il n'a pas envie de mettre ses informations de ses clients sur des sujets hyper sensibles sur des outils comme Claude ou ChatGPT, parce que, évidemment, ces grandes entreprises là utilisent vos données pour pouvoir réentraîner leur modèle, et quand bien même, on ne sait pas si un jour ça fuite.
Maintenant qu'on sait où on va, on va essayer de comprendre un peu ce que c'est qu'un, qu'un modèle open source. Alors, dans cette partie de la vidéo, on va essayer de clarifier un petit peu ce qui différencie l'utilisation d'un chatbot comme ChatGPT ou Claude, et l'utilisation de ce que je vous ai montré tout à l'heure, donc un modèle open source. Même ceux qui pensent connaître, je suis persuadé que vous allez apprendre des choses dans cette partie de la vidéo.
Donc, en gros, quand vous utilisez un ChatGPT comme ça, donc, c'est une interface graphique en réalité qui communique avec les serveurs de chez OpenAI. OpenAI, c'est l'entreprise qui fait ChatGPT. Donc, quand vous cliquez et vous tapez du texte dessus, l'information arrive vers les serveurs. Derrière, elle revient, mais elle ne revient pas par magie. Ces serveurs, en fait, ils hébergent des modèles, des modèles, euh, de langage qu'on appelle des LLM. Euh, ces modèles, vous pouvez d'ailleurs les choisir dans l'interface. Euh, et notamment, si vous voulez utiliser le modèle 4, c'est celui qui est par défaut, et bien, c'est ce modèle-là qui va être exécuté sur leur serveur. La raison pour laquelle il vous chargent de l'argent, ces boîtes-là, c'est parce que, bah, elles ont construit ce modèle, en tout cas, elles l'ont entraîné, ça coûte de l'argent, et en plus de ça, le fait de le faire tourner, ça coûte de l'argent.
Ça marche pareil pour Claude, qui est géré par Anthropic, qui est la boîte derrière Claude. Et ben, là aussi, vous allez pouvoir sélectionner le modèle que vous voulez utiliser. Et de la même manière, quand vous utilisez ce modèle ici, bah, c'est les serveurs de chez Anthropic qui, en fait, run ce modèle, donc qui vont faire tourner ce modèle. Pareil chez Google. Et en fait, à chaque fois, ici, on va avoir un serveur qui va faire tourner un modèle de langage. Ce modèle de langage, on a dit qu'il s'appelait les LLM. Et en fait, ce serveur-là, il faut qu'il ait quand même pas mal de patates, en fait. Il faut qu'il ait ce qu'on appelle du GPU. Donc, en fait, c'est de la puissance de calcul vidéo. Euh, parce que, en fait, pourquoi vidéo ? Parce que pour faire tourner un modèle de langage, il y a besoin de faire beaucoup de multiplication de matrices. Et en fait, c'est un truc qui se fait beaucoup dans le monde de la, de la vidéo, de la génération 3D et cetera. C'est pour ça qu'en fait, le monde des cartes graphiques et la valeur de Nvidia a explosé.
Et du coup, tous ces LLM en question, il y en a de deux types. Il y a les modèles qui sont propriétaires, et il y a les modèles open source. Dans les modèles propriétaires, on en a parlé, il y a Claude, il y a Grok, il y a ChatGPT, il y a Gemini de Google. Tous ces modèles-là, et bien, en fait, ils ont été entraînés, et en fait, on ne peut pas les faire tourner sur nos machines, sur nos ordinateurs. Contrairement à ceux-là. Typiquement, Mistral, c'est un modèle français open source qu'on peut faire tourner sur notre propre ordi. Il faut qu'on ait de la patate, là aussi, de la puissance de calcul, mais on peut le faire. En fait, ces modèles ici qui sont développés par ces entreprises-là, c'est ceux-là qu'on va essayer d'installer sur nos ordis. Euh, donc, comme je vous ai dit, la raison pour laquelle ces boîtes nous font payer de l'argent, c'est pour, en fait, le fait qu'ils font tourner ces modèles. Mais nous, si on veut, on peut prendre ces modèles-là et les faire tourner, bah, sur nos propres ordis à nous. Évidemment, il faut qu'il soit un peu puissant, mais on peut prendre, par exemple, le modèle chinois DeepSeek et le faire tourner sur notre ordi, sur notre MacBook à nous. Et c'est ce qu'on va apprendre à faire aujourd'hui.
Il y a, euh, plusieurs avantages à ça. Donc, le fait que ça soit confidentiel, parce que du coup, ça reste sur notre ordi. Euh, là, il n'y a pas besoin d'activer, d'activer votre connexion internet. Toutes les infos que vous allez mettre dedans vont rester sur votre ordi. C'est gratuit, c'est-à-dire que ça demande uniquement la puissance de calcul de votre ordi. Encore faut-il qu'il ait, qu'il soit puissant, et on va voir aussi à quel point il faut qu'il soit puissant. En tout cas, quels sont les paramètres dans votre ordi à regarder pour qu'il soit puissant, et, euh, le fait que ça soit hors ligne. Et c'est ça qui m'intéressait moi avant de monter dans l'avion.
Donc, c'est le site qui répertorie un petit peu tous les modèles open source. Donc, il y a celui de DeepSeek, donc j'en ai parlé. Il y a Alibaba qui a lancé Qwen. Il y a Meta qui fait pas mal de contributions open source en avec plusieurs modèles. Il y a le français Mistral. Il y a Google qui fait aussi des modèles open source, notamment Gemma, et il y en a plusieurs. Donc, je vous laisserai le lien en description, comme je l'ai dit.
Et maintenant, on va voir comment l'installer. Il y a deux manières de l'installer. Il y en a un premier, une première manière, c'est utiliser Ollama. Ollama, j'en ai déjà un petit peu parlé dans cette vidéo, dans cette, sur cette chaîne, euh, mais c'est la première qu'on va aller voir. Et la deuxième, c'est LM Studio. C'est l'outil que je vous avais montré initialement, euh, qu'on va revoir ici. Donc, on commence tout de suite par, euh, la, la première manière, qui est d'installer Ollama.
Alors, nous voici sur le site de Ollama. Ollama.com. Qu'est-ce que c'est ? C'est un outil qui va nous permettre, et bien, de, d'installer et d'exécuter ces modèles open source. Donc, ces modèles open source, il y en a plein. Donc, ils en proposent plusieurs quand on va cliquer sur "Models" ici. Donc, il y a plein, plein, plein, plein de modèles qu'on va pouvoir, en fait, installer. Mais avant toute chose, il va falloir installer Ollama. Donc, on va cliquer sur "Download", et d'ailleurs, selon votre système d'exploitation, installation assez classique. Vous avez un zip, vous devez ouvrir le zip et mettre l'application derrière dans votre outil, enfin, dans votre dossier d'applications si vous êtes sur Mac. Et l'installation Windows, elle est assez classique.
Mais une fois que vous l'aurez fait, que vous soyez sur Mac ou sur Windows, si vous lancez le terminal, donc, vous allez donc avoir un écran blanc ou noir, selon votre configuration. Et là, quand vous allez aller, du coup, dans "Models", vous allez pouvoir installer ces modèles-là. Donc, par exemple, si moi, je veux installer le modèle Llama 3.2 que je n'ai pas encore, et bien, je vais venir ici et copier ce truc-là. Je vais le coller ici. Là, ce qui est en train de se passer, c'est que Ollama est en train de télécharger le modèle. Donc, selon, euh, le modèle que vous prenez, il peut être plus ou moins lourd. Là, c'est le modèle qui est, euh, à 2 Go. Donc, ça va le télécharger. Donc, vous voyez, là, ça le télécharge. Une fois que ça l'aura téléchargé, et bien, vous allez pouvoir, euh, le, l'utiliser. Donc, ce qu'on appelle "run" le modèle, donc, l'exécuter sur votre machine, sur votre ordinateur.
Pendant que le téléchargement a lieu, moi, je vais ouvrir une autre fenêtre pour vous montrer un peu tous les autres modèles que j'ai d'installés. Pour ça, on va faire "ollama ls". Donc, ça va venir lister tous les modèles que j'ai installés. Et donc, moi, j'en ai plusieurs qui sont installés ici. Bon, pour, du coup, les utiliser, par exemple, si je vais utiliser le modèle Mistral, qui est un modèle français, et bien, je vais ici sur Mistral et je vais taper ça. Hop, je viens, je colle. Et donc, là, ce qui se passe, c'est que, étant donné que moi, Mistral, il était déjà installé sur mon ordi, j'en ai pas besoin. Donc, donc, si je lui dis : "Est-ce que tu peux m'aider à écrire une vidéo, une intro de vidéo ?" Et bien, lui, ce qui va se passer, c'est qu'il va m'écrire l'intro de vidéo, mais dans cette interface qui n'est pas terrible, terrible. Euh, c'est pourquoi, en fait, euh, comme sur ChatGPT, il y a, euh, une interface graphique, et bien, pour Ollama, il y a des interfaces graphiques.
Donc, là aussi, pendant que ça télécharge, je vais, euh, vous montrer un petit peu, euh, ce qu'on avait tout à l'heure. Tout à l'heure, ce qu'on avait, une interface graphique, un modèle, et un serveur. Et de la même manière, là, on a notre serveur qui est, en fait, notre ordi. Le LLM en question, c'est Mistral, mais il nous manque l'interface. Et donc, des interfaces pour Ollama, il y en a plusieurs. Il y a une, une interface qui s'appelle WebUI, dont que je vous ai déjà parlé sur, dont je vous ai déjà parlé sur cette chaîne. C'est un petit peu compliqué à installer, mais c'est possible pour les développeurs d'entre nous. Sinon, pour ceux qui sont sur Mac, il y a un truc qui s'appelle Enchanted, du coup, qui est une app Mac à télécharger. Donc, je vous invite à la télécharger, et vous allez voir que, une fois que j'aurai installé Enchanted, et bien, je vais voir ici tous les modèles qui sont dispos, donc les mêmes modèles que Ollama, et en fait, ça se configure automatiquement avec Ollama. Ici, on peut même sélectionner, euh, le modèle par défaut, ici, changer plein de choses, assez classiquement, de n'importe quelle app. Donc, je vous incite vraiment à, à télécharger Enchanted, parce que je trouve que ça change vraiment la manière d'utiliser, euh, euh, Ollama.
Autrement, pour ceux qui ne sont pas sur Mac, il y a aussi Msty, euh, je ne sais pas comment le prononcer, mais c'est un agrégateur, un petit peu de LLM, dans lequel vous allez pouvoir lancer les LLM classiques, mais aussi ceux qui sont sur votre ordi, ce qui peut être intéressant. Il y a, il y en a plein d'autres, en fait. Il y a Ollama GUI, il y a LibreChat, euh, qui est là aussi, un outil qui va vous permettre d'avoir plusieurs LLM dans un même outil.
Bon, maintenant que ça, c'est terminé, vous avez vu que Ollama, il a réussi, il a installé Llama 3.2, et maintenant je peux parler à, à Llama 3.2, qui est, du coup, le modèle de chez Meta.
Les amis, si jamais vous êtes en train d'apprécier, euh, cette vidéo, n'hésitez pas à mettre un petit like, ça m'aide beaucoup. Et surtout, si jamais l'IA, l'automatisation et la productivité vous intéressent, je fais beaucoup de vidéos dans ce genre. Donc, n'hésitez pas à vous abonner. Bref, on y retourne.
Maintenant, il y a une autre manière d'installer tous ces modèles open source, et très honnêtement, je vous le conseille, parce que je ne le connaissais pas, ou en tout cas, je ne l'utilisais pas, c'est LM Studio. LM Studio. Avant, je pensais que c'était un truc de développeur. Du coup, je, je pensais, et parce que Ollama était le plus connu, et bien, je n'avais pas vraiment allé, j'avais pas vraiment été regardé ça. Et en fait, malgré son interface un peu dev, il est très pratique.
Donc, LM Studio, je vais l'ouvrir. Donc, là aussi, comme Ollama, en fait, comme, pardon, je vais avoir mes conversations, un peu comme ChatGPT. Ici, je vais avoir mes modèles. Alors, ils ne sont pas partagés avec Ollama, donc on va devoir les télécharger ici, dans "Discover". Pour info, si jamais vous n'avez pas ce truc "Discover", il faut aller sur "Power User" ici. Et donc, là, vous allez dans "Discover", et là, vous allez pouvoir télécharger plein, plein de modèles. Donc, pareil, il y a Mistral 7B, par exemple. Ici, je fais ça, je fais "Download", et là, c'est en train de télécharger, euh, la version de, de Mistral 7B. Donc, ça, je peux le laisser comme ça. Et en fait, la différence avec Ollama, c'est que les deux sont ensemble. C'est-à-dire qu'on a à la fois l'interface et à la fois le LLM et le serveur qui tourne. Et donc, c'est quand même bien pratique. Euh, moi, ce que je vous conseille de faire dedans, c'est donc, vous mettre en mode "Power User", d'utiliser, euh, cette version-là avec le chat, du coup, et de télécharger directement vos modèles ici.
Un des éléments qui donne, avec lequel il va falloir faire attention, c'est, c'est ce truc-là, c'est la puissance de votre ordi. En fait, si vous mettez en mode développeur, ce qui va être cool, c'est d'aller regarder ce truc-là, ce truc qui s'appelle "tokens per second". Et en fait, selon la puissance de votre ordi et selon le modèle que vous allez choisir, il y a des modèles qui vont être plus ou moins lents, parce que votre ordi, il a peut-être pas, du coup, assez de patates, assez de GPU, ou ce qu'on appelle, assez de mémoire, euh, vidéo, donc de VRAM. On va en discuter un peu plus en détail de tout ça.
Donc, en gros, maintenant qu'on sait comment installer, on va pouvoir se poser la question de quel modèle choisir. Déjà, il faut réfléchir selon le besoin. Si votre besoin, il est plutôt d'avoir un assistant généraliste comme ChatGPT et cetera, ou de faire du résumé, du résumé de documents PDF, de la génération de code. Si vous voulez faire plutôt du RAG, donc, c'est-à-dire avoir plusieurs documents et derrière aller les requêter, et ben, votre utilisation va être différente. Et en fait, selon tout ça, euh, vous n'allez pas choisir les mêmes modèles. Et il y a aussi la puissance de votre ordi. En fait, ce qui se passe, je vous ai expliqué que le truc le plus important dans, pour faire tourner ces modèles, c'est de faire de la multiplication de matrice. Et pour ça, il faut du GPU, en tout cas, du VRAM, et, euh, et voir un petit peu la puissance de votre ordi. Et donc, sur LM Studio, ce qui est quand même très cool, c'est que quand on va dans la partie configuration ici, en bas à droite, et bien, quand on va dans "Hardware", on a cette information : c'est le type de votre ordi, le GPU, si vous avez un GPU ou pas, donc une carte graphique ou pas, est-ce que vous avez de la VRAM ? Et c'est ce truc-là qui est important. Donc, moi, j'ai un ordinateur qui est assez puissant, c'est pour ça qu'il le fait tourner assez rapidement, mais selon votre ordi, bah, ça peut être plus ou moins long. Et ce qui est le plus important, en fait, c'est du coup, le GPU. Et donc, dans le GPU, il y a de la VRAM. Euh, évidemment, votre processeur et votre RAM est importante, mais le plus important, c'est cette VRAM et ce GPU.
Euh, maintenant, euh, vous n'avez pas changé d'ordi pour ça, évidemment, mais si jamais un jour vous voulez faire ça en local, il y a, euh, notamment les Mac Mini en ce moment qui sont pas mal, parce qu'ils ont une mémoire partagée avec le processeur, la mémoire graphique et la mémoire du processeur sont unifiées, et donc ça permet d'avoir pas mal de VRAM. Donc, c'est, c'est l'élément qu'il va falloir regarder, et c'est d'ailleurs l'élément qu'on va regarder aussi en fonction du, du nombre de tokens par seconde. C'est ça qui va venir augmenter la rapidité avec laquelle ça va s'afficher.
Si j'utilise un modèle par exemple assez, assez balaise pour mon ordi, donc là, j'en ai pas, mais si je vais sur Ollama, donc je vais regarder Enchanted, et je vais prendre peut-être un modèle qui est peut-être trop gros pour moi. Donc là, j'en ai pas, mais si j'en avais un, typiquement DeepSeek 7, déjà, il est un peu plus gros que les autres, et donc, parce que c'est un modèle à 7 milliards de tokens, 7 billion tokens, et donc déjà, il est plus lent que les autres. Pour un modèle à 7 milliards de tokens, grossièrement, il va vous falloir au moins 8 Go de VRAM pour que ça puisse déjà tourner. En fait, le nombre de, euh, de paramètres, pardon, j'ai dit token tout à l'heure, mais c'est le nombre de paramètres, il va être marqué au moment du téléchargement du modèle. Donc, si on va, euh, ici, donc vous voyez ici, il y a marqué le nombre de paramètres sur les modèles de chez Ollama, et ben, là aussi, il y a marqué quels sont les nombres de paramètres. Et donc, selon ce que vous allez mettre comme nombre de paramètres, ils vont pouvoir oui ou non tourner sur votre machine. Et donc, moins il y a de paramètres, moins ils sont précis, plus ils peuvent halluciner, et plus ils sont balaises, bah, plus ils sont précis. Mais évidemment, il faut des ordis quand même assez puissants.
Donc, comment faire pour pouvoir optimiser l'utilisation des LLM locaux sur notre ordi ? Bien, première chose, ne pas choisir des modèles trop gros, hein, pour optimiser cette vitesse. Je vous ai montré le nombre de tokens par seconde. C'est la mesure, en fait, de la vitesse. Donc, vous ne prenez pas un modèle trop gros selon la puissance de, de votre ordi. Derrière, tous les modèles ne sont pas des modèles multimodaux, c'est-à-dire qu'ils ne vont pas pouvoir tous prendre des images et des PDF. Je vous donne un exemple. Par exemple, ici, il y a un truc qui s'appelle "Vision". Et donc, dans "Vision", ce qu'on va pouvoir avoir, c'est tous les modèles. Donc, ça, ça va venir filtrer les modèles ici. Tous les modèles de vision, c'est ceux qui vont pouvoir regarder, et c'est ceux, euh, donc qui vont pouvoir lire des images, lire des PDF et cetera. Tous les modèles ne permettent pas de faire ça. Il y a des modèles qui sont plus des outils, qui sont des outils, du coup, spécialisés. Il y a des modèles, c'est des modèles d'embedding qui vont être bien meilleurs à retrouver de l'information, notamment pour du RAG. Et on va en parler du RAG. J'ai d'ailleurs fait une vidéo au-dessus si vous ne savez pas ce que c'est, mais c'est des modèles qui ne vont pas utiliser du texte, mais qui vont utiliser des vecteurs pour pouvoir ranger les informations sur notre ordi et les retrouver. Et donc, selon tout ça, euh, bah, vous allez choisir, en fait, votre modèle.
Très honnêtement, si vous êtes débutant et que vous ne savez pas, prenez Mistral 7B si jamais votre ordi est assez, est assez balaise. Sinon, prenez Gemma 3, qui est un modèle de, de Google, en version 1B ou 4B. Et sinon, DeepSeek R1, 1.5 billion ou 7 billion parameters, euh, ça va être largement suffisant si vous êtes vraiment débutant.
Pour ce qui est de la voix, parce qu'il y a des modèles qui permettent de gérer la voix, notamment Whisper. C'est un modèle qui est d'ailleurs développé par OpenAI, mais qui est un modèle open source, et du coup, vous pouvez l'installer sur votre ordi et derrière parler à votre ordi, et derrière, il le retranscrit. Bon, le problème, c'est que c'est assez compliqué à installer, et surtout que moi, déjà, j'utilise Super Whisper. J'utilise ce truc-là. En fait, Super Whisper, ça permet de comprendre tout ce que je suis en train de dire et derrière de le transcrire. Et c'est un outil qui est certes payant pour une partie, mais sinon, il est gratuit dans la version de base. J'avais fait une vidéo dessus, et très honnêtement, si vous l'avez pas encore vu, je, je vous invite à aller la regarder. Et ça aussi, ça se passe en local. En fait, Super Whisper, lui, ne travaille que directement sur l'ordinateur. J'étais capable de parler et que lui, il me comprenne. Derrière, pour ce qui est du RAG, RAG, c'est mettre plein de documents ensemble et derrière de les, de les donner à un LLM pour qu'il puisse aller chercher dedans, et bien, il y a un truc qui existe qui s'appelle PrivateGPT. Si jamais vous êtes une boîte et que vous avez besoin d'avoir plein de documents, euh, que vous voulez que les LLM aillent regarder, PrivateGPT, c'est une superbe, superbe solution.
Enfin, on arrive aux utilisations avancées pour ceux que ça intéresse. Euh, moi, c'est là où j'ai pris le plus de plaisir. En gros, je ne sais pas si vous savez, mais N8N, c'est un outil open source, là aussi. Donc, en fait, ce que j'ai fait, moi, c'est que j'ai, bah, lancé N8N sur mon ordi. Comment est-ce que j'ai fait ça ? Et ben, là aussi, je vais sur mon terminal, je tape "npx n8n". Et donc, ce que ça a fait, ce truc-là, c'est que c'est venu installer sur mon ordi N8N. Bon, si vous le faites, ça n'a probablement pas marché parce qu'il y a quand même pas mal de dépendances à aller installer. Mais une fois qu'on fait ça et qu'on va sur ce lien-là, en fait, N8N, il est installé sur mon ordi. Euh, et donc, là aussi, sans connexion internet, je peux l'utiliser. Donc, là aussi, je peux créer un workflow, et je peux créer un workflow, par exemple, avec un agent. Euh, ceux qui voient peut-être ce que c'est qu'un agent, sinon, allez regarder ma vidéo sur les agents IA. Ici, je peux discuter avec mon agent, et mon agent, je peux lui donner un modèle. Et en fait, ce qui est génial, c'est qu'ici, je peux choisir Ollama. Ça veut dire que pour des boîtes qui ont des besoins d'automatisation, je ne sais pas, si je travaille dans un cabinet d'avocats, à l'armée, et cetera, ben, on va pouvoir utiliser Ollama. Ici, vous voyez, c'est les mêmes modèles que j'ai ici. Je peux utiliser CodeLlama, CodeLLama, donc, du coup, qui est spécialisé dans le code. Euh, et donc, là, je vais pouvoir lui donner une mémoire simple. Et là, si je vais aller parler ici, je veux faire "hello", vous allez voir, c'est bien Ollama qui va me répondre. Et donc, je peux avoir une conversation avec le modèle qui est sur mon ordi.
Là, vous allez me dire : "Oui, mais Chouam, à quoi bon faire de l'automatisation si on n'a pas internet ?" Et bien, dans ce cas-là, typiquement, là, par exemple, je vais aller sur une autre automatisation qui prend des éléments sur mon disque, donc, en fait, sur mon ordi, qui va extraire des éléments dans CSV, par exemple, et qui derrière va utiliser un modèle Ollama pour pouvoir faire des interactions avec des fichiers. Il y a aussi la possibilité ici de gérer tout ce qui est image. Euh, et donc, là, on va pouvoir redimensionner des images, euh, avoir écrire des éléments sur des images, tout ça va être possible sans coder avec un outil, euh, euh, comme N8N ici.
Autre élément, Make, donc, qui est un de mes outils préférés aussi d'automatisation. Ce qui est génial avec LM Studio, c'est qu'on a une API qui est disponible. Donc, si on va dans le mode "Developer" ou "Power User", il y a une API qui est là. Et donc, cette API en question, elle est uniquement locale. Ça veut dire que je peux l'appeler via cette URL-là. Le problème avec mon API qui est en local, c'est que je ne peux pas l'appeler depuis un outil externe comme Make. Je peux l'appeler depuis un outil installé sur mon ordi. Mais si j'ai envie, parce que j'ai un sujet de confidentialité de données, là aussi, et je vous prends un scénario que je vous ai préparé sur Make ici. Admettons, j'ai un Google Sheet dans lequel il y a, bah, des informations confidentielles d'avocats et cetera, des échanges avec des avocats, et j'ai besoin de générer des réponses. Admettons, je suis moi-même avocat, ce qui n'est pas le cas, mais admettons. Et bien, bah, là, je n'ai pas envie de mettre mes données sur ChatGPT ou sur Claude. J'aurais pu utiliser ici un module de Claude, mais j'ai préféré utiliser l'API qui est, qui est de LM Studio.
Maintenant, vous avez vu ici, par exemple, je n'ai pas du tout mis le même lien que là. C'est parce que ce lien-là, il est local à mon ordi. Et pour pouvoir faire le lien entre les deux, et bien, il faut utiliser un, un outil. Et là, on va un peu plus dans le monde des développeurs ou dans le monde technique, c'est, on va créer ce qu'on appelle un tunnel entre le monde externe et le monde de notre ordi. Et donc, ce tunnel-là, ça s'utilise avec Ngrok. Je vous épargne un peu les détails, mais grossièrement, ça s'installe comme ça, et puis ça s'utilise comme ça. C'est-à-dire que ça s'installe, euh, vous suivez la documentation de, de Ngrok ici, et puis derrière, on va dire "http 1234". Ça veut dire que, en gros, il va faire, il va faire en sorte que tout ce qui arrive sur le lien de l'API avec cette URL-là, et ben, aille directement en local sur LM Studio.
Vous allez voir la démo, c'est assez cool. Donc, typiquement, là, je vais aller sur mon truc ici. Je vais bien changer le lien parce que, du coup, entre-temps, il a changé. Voilà, je fais "Save". Ce que je lui ai demandé, c'est lui dire : "Voici un message initial avec le dernier échange pour le prénom." Et je vais dire : "Aide-moi à écrire un message de réponse." Et derrière, je vais lire chacune, euh, des, euh, des, euh, des éléments dans mon Google Sheet. Donc, je ne sais pas, je vais en mettre 10 et je vais venir les mettre à jour dans mon Google Sheet également dans une des colonnes. Et je vais lui dire ici : "Ne, n'affiche que le message." Hop. Et là, je fais "Run Once". Et vous allez voir que ici, ce qui est en train de se passer, et vous allez voir LM Studio. LM Studio ici, il est en train de recevoir des infos et il est en train de donner des infos à Make, alors que Make, il est lointain, il est ailleurs, en fait. Et donc, ici, vous voyez, ça met, bon, le prompt, il n'était pas le plus simple, mais en tout cas, vous voyez, et du coup, il est en train de proposer des options pour chacune des personnes ici, ce qui est, ce qui est génial. Et donc, pour bien comprendre, hein, grossièrement, ce qui s'est passé, c'est que ici, moi, j'ai mon ordi sur lequel j'ai un modèle qui tourne en local. Ce modèle-là, et bien, derrière, il est appelable via une API. Cette API, vu que elle est uniquement sur mon ordi, j'en ai fait un tunnel avec Ngrok. Et donc, ce tunnel sur Ngrok, et ben, je peux derrière maintenant, avec le lien qu'on m'a donné, utiliser ça dans une app Make, qui est juste magique, magique, parce que du coup, c'est gratuit et j'ai la confidentialité. Ça, ce sont des modules Make, hein, pour ceux qui, qui sauraient pas. Vous voyez, c'est, c'est quand même assez dingue ce qu'on arrive à faire.
Et puis, dernier exemple que je voulais vous montrer, c'était la partie code. Donc, là, on arrive vraiment vers la fin de la vidéo, où j'espère que ceux qui regardent, peut-être des devs, ou en tout cas, des gens qui s'intéressent au dev. Là, vous voyez, j'ai utilisé, euh, je fais, je fais du Python. J'ai un fichier qui est ouvert sur un outil qui s'appelle VS Code, qui est un éditeur de code. Et là, je peux vouloir, par exemple, prendre ça, faire "Cmd L". Et là, j'ai ce truc qui va s'ouvrir, un peu comme Cursor. Je ne sais pas si ceux qui connaissent Cursor, c'est un, c'est un éditeur de code, mais cette fois-ci, qui peut se connecter à plusieurs LLM payants. Et ben, là, je peux, euh, ici, prendre des modèles qui sont des modèles open source, parce que lui, il a automatiquement détecté, en fait, tout ce que j'avais dans, et bien, dans mon Ollama. Euh, vous voyez, c'est les mêmes modèles que mon Ollama tout à l'heure. Et donc, là, je peux lui dire : "Réécris cette fonction sur un port différent, par exemple." Et donc, là, ce qu'il va faire, c'est qu'il va écrire ici des éléments. Il a changé le port, et là, il va me demander : "Est-ce que c'est OK ?" Et moi, j'aurais plus qu'à valider "Apply". Voilà, c'est en train d'appliquer les changements, et voilà. Et là, du coup, il a réussi à faire ce qu'on lui demandait. Et donc, ça, ça se fait avec une extension qui s'appelle Continue. Cette extension permet, du coup, extension VS Code, qui permet, du coup, à VS Code de, bah, se connecter avec des, des LLM qui vont être locaux ou distants.
Je vous ai montré un petit peu des outils d'automatisation, dont un qui est N8N, et l'autre Make. Ce que je vous incite à aller voir, c'est comment moi, j'utilise Make au quotidien. Et donc, euh, je vous incite à aller voir cette vidéo, et si jamais, euh, vous l'avez déjà vu, je vous incite à aller voir celle sur les agents IA avec N8N. Très honnêtement, sur une des deux, vous allez être bluffé sur tout ce qu'on peut faire avec de l'automatisation. Et pour ceux qui sont des, des, et bien, des spectateurs récurrents, je suis curieux d'avoir votre avis sur ce genre de vidéo qui est beaucoup moins montée, beaucoup plus chill, et très honnêtement, moi, je prends un grand plaisir, parce que je passe mon temps à découvrir des trucs, et à chaque fois, je me prends la tête, faut que je fasse du storytelling et cetera, et en fait, j'ai l'impression que là, je prends mon pied. Curieux d'avoir votre, votre avis.