📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

🚀 Claude Code GRATUIT : Les astuces pour ne PLUS JAMAIS manquer de tokens

front-end•33:52

Transcription

Ce que je vous propose aujourd'hui les amis, c'est de voir comment on peut utiliser Cloud Code gratuitement.

Alors, on va faire différents tests. Vous allez voir, je vais faire à chaque fois avec le même prompt, on va réaliser une landing page et comme je l'ai dit, ça sera toujours avec le même prompt. Ce qui va changer, ça va être le modèle qu'on va utiliser. Et donc pour utiliser Cloud Code gratuitement, c'est une des astuces qu'on va voir. Il y en a, il y a plusieurs manières de faire et je vais aussi vous montrer en fait comment on peut économiser énormément de tokens. Donc si vous arrivez tout le temps à la limite à chaque fois de votre utilisation de Cloud Code et cetera, dans cette vidéo, vous allez avoir énormément d'astuces. Il y en a forcément que vous ne connaissez pas. Donc regardez bien jusqu'au bout. Peut-être qu'il y a une des astuces qui vous correspondra le mieux.

Première chose qu'il faut qu'on comprenne, c'est c'est quoi Cloud Code exactement ? Cloud Code, c'est pas Sonnet 3.4.6 ou Opus 4.6. Cloud Code, c'est une surcouche. Une surcouche qui va en fait appeler ces modèles et se servir de ces modèles. Et en général, donc on a ces différents modèles ici et ces modèles sont des modèles d'Anthropic. D'accord ? Et on peut choisir déjà une première chose qui serait intelligente, c'est que quand vous avez des petites modifications qui ne demandent pas forcément énormément de contexte ou des choses du genre comme modifier un bouton, je vois des fois des gens qui utilisent Opus 4.7 alors qu'il y a pas forcément besoin pour juste modifier un bouton et on peut descendre utiliser par exemple le modèle Haiku qui sera très compétent et qui nous donnera la même chose, sauf que ça sauvegarde beaucoup plus de tokens. Donc pensez déjà à bien utiliser les différents modèles qui sont à votre disposition quand vous utilisez Cloud Code.

Mais il y a quand même autre chose que l'on peut faire, c'est qu'on peut utiliser nos propres modèles, les modèles que l'on souhaite. Et là, il y en a une infinité. Ces modèles, en fait, ça pourrait être des modèles comme Qwen 3.6, comme DeepSeek ou encore d'autres modèles que l'on pourrait retrouver même sur OpenRouter et des modèles qu'on va voir qu'on peut faire aussi tourner en local comme ceux que je viens de citer par exemple, comme le Qwen. Et vous vous dites peut-être aussi que pour faire tourner des modèles euh en local, il faut déjà des grosses configurations. En tout cas, pour avoir des bons résultats. Et bah pas forcément. Et je vais vous montrer vraiment qu'il y en aura pour tous les goûts.

Donc déjà la première chose, c'est qu'il va falloir faire tourner un modèle en local. C'est ce que la première chose que je vais vous montrer, ça sera d'utiliser des modèles en local. Et moi, j'aime bien utiliser LM Studio. Alors, où est-ce qu'il est mon petit LM Studio ? Il est ici en fait ici dans LM Studio. Donc vous le téléchargez gratuit et vous avez accès à plein plein plein de modèles. Vous avez par exemple ici les derniers qui sont sortis Qwen 3.6 qui ou 3.6. Alors il y a le modèle 27B, il y a les modèles MOE et cetera. Donc ça je vais pas forcément rentrer dans les détails, même si je vous expliquerai quand même quelques choses, quelques trucs pour vous voyez lequel est le mieux pour vous. Et ensuite on a des modèles de Gemma 4 par exemple et cetera. On a DeepSeek, on a Mistral et cetera. Et il y a énormément de modèles qui peuvent tourner sur des cartes graphiques grand public et qui seront tout aussi efficaces. Je vous ai montré ici. En réalité, vous allez voir qu'on va utiliser des modèles 9B et franchement pour le faire tourner, il n'y a pas besoin d'avoir un PC forcément énorme. Alors évidemment, plus vous avez de puissance, mieux ce sera, on est d'accord, mais vous pouvez quand même faire tourner certaines tâches en gratuit. Ça sera votre ordinateur qui tourne tout simplement en utilisant Cloud Code.

Alors sur LM Studio, c'est assez simple. Vous allez ici, vous sélectionnez le modèle que vous voulez et puis ensuite moi j'en ai téléchargé plusieurs parce que j'ai voulu faire beaucoup de tests pour voir lequel euh tiendrait le mieux sur sur ma carte graphique. Alors moi, j'ai une 5070 Ti qui a 16 Go de VRAM. Donc c'est ça qui va être important, c'est la VRAM que vous avez sur votre carte graphique ou aussi la RAM que vous avez sur votre ordinateur. Ce qu'on peut faire tourner sur les deux. Et euh je vais vous montrer qu'il y a même des modèles qu'on peut faire tourner euh à la fois sur la RAM et sur la VRAM et on obtiendra quand même de bons résultats.

Alors, comment ça se passe concrètement ? Déjà concrètement en fait vous allez avoir là ici. Alors ça c'est ça correspond au final au site que vous avez vu juste avant où je vous compare les différents éléments. Je les fais aussi avec Cloud Code. Et là par exemple, vous voyez dans mes settings, vous avez des variables d'environnement que vous pouvez rajouter. Et pourquoi c'est bien de faire comme ça ? Parce que vous pouvez aller modifier en fait des fichiers directement dans Cloud Code, mais sauf que ça va vous empêcher à chaque fois, ça risque de poser des problèmes. Ça veut dire que vous allez tout le temps utiliser le modèle de Qwen 3.6 par exemple, alors que des fois vous aurez peut-être envie de repasser sur un modèle comme Sonnet et cetera. Donc au lieu de changer la configuration générale de votre Cloud Code, en fait vous allez juste dans un projet et dans ce projet vous ajoutez dans le dossier .cloud le fichier settings.local.json. C'est ici d'ailleurs que vous avez aussi vos permissions que vous accordez que quand vous dites oui par exemple au fur et à mesure à Cloud, vous allez pouvoir enfin vous c'est ici que les permissions sont données. Ensuite vous avez donc les variables d'environnement et ce qui va être important, c'est d'utiliser votre modèle local. Donc ça, on l'a sur Qwen. Alors je vais lancer un modèle, alors pas trop gros parce que je sais pas ce que ça donne vu que j'enregistre en même temps si ça va me manger beaucoup de de VRAM. Donc j'ai pas envie que ça ça casse. Donc je vais lancer en, je veux pas que la vidéo sacade. Donc je vais lancer un modèle. Et là en fait quand vous arrivez ici dans le modèle, donc vous allez dans la console des développeurs et là en fait vous voyez l'adresse. D'accord ? Donc c'est l'adresse que j'ai mis juste ici. Et ensuite vous avez le nom du modèle. Alors ça Studio, ça change pas. Et là vous avez le modèle. Donc là on utiliserait par exemple le 3.5 9B. Donc il faudrait que je change ici.

Alors, ensuite dans le montage, j'avais oublié de vous montrer concrètement comment ça se passait dans Cloud, mais du coup vous ouvrez Cloud et vous avez juste à choisir le modèle en faisant slash modèle et puis vous choisissez le modèle qui est en cours dans LM Studio et puis vous voyez que ça se lance. Alors, je précise, ça ne marche que dans Cloud en mode console et ici directement dans votre éditeur par exemple. Mais ça marche pas sur l'application. On peut pas changer directement les fichiers de configuration dans l'application, ça fonctionne pas.

En tout cas, ce que je vous propose donc maintenant, c'est tout de suite de voir un petit peu les résultats en fonction des différents modèles. Ensuite, je vous montrerai un petit peu comment vous vous pouvez faire tourner des modèles, même qui sont en théorie plus gros que ce que vous avez en euh en carte graphique qui normalement ne pourraient pas faire tourner le modèle. Je vais vous montrer quelques petites astuces.

Alors, on retourne ici et on va regarder un petit peu. Alors, j'ai demandé même prompt à chaque fois avec Cloud Code. D'accord ? Donc il y a deux deux choses. Il y a une fois où je me suis servi de skill un peu personnalisé. Donc c'est ceux qui seront à la fin. Pour l'instant, ce que je vais regarder, c'est uniquement ceux que j'ai, j'ai pas utilisé de skill particulier à part celui de UIU Pro Max. Mais sinon, j'ai pas utilisé de skill personnel. En tout cas, dans ce que je vous montre là tout de suite. Dans les autres, je vous expliquerai un petit peu après.

Donc là, en fait, premier site ici par exemple, c'est fait avec Cloud Code uniquement. D'accord ? Donc c'est un site. Donc j'ai demandé toujours le même prompt là pour tous les sites que vous allez voir, c'est le même prompt, toujours le même prompt, une formation Figma et je veux une landing page. D'accord. Je lui donnais un thème d'arc. Alors il y a un moment où j'ai oublié de lui donner. Je lui ai pas dit le thème d'arc, j'ai voulu voir ce qu'il allait faire, le laisser libre. J'ai pas aimé le résultat, mais c'est juste peut-être en terme de goût. J'ai pas aimé le résultat, c'est tout. Mais sinon le site reste correct. Donc là vous voyez ce que Cloud Code m'a fait. Donc bon voilà, on voit que c'est l'IA, mais ça reste correct. Parce qu'évidemment, j'ai fait qu'un seul prompt, ça faisait deux lignes. Voilà, c'est c'est on peut pas non plus obtenir des choses énormes. Ça ça fait 13 IA ici. Maintenant, on reconnaît, mais c'est quand même correct. D'accord ? Donc ça c'est Cloud Code. Donc ça c'est si vous aviez payé Cloud Code, vous lui dites de faire la même chose. Vous obtenez ça.

Maintenant, alors je vais vous montrer le modèle le moins bon en réalité que j'ai utilisé, c'est le Qwen 3.5, donc déjà c'est un petit peu plus ancien et c'est le 9B. Donc il a pas beaucoup de paramètres. 9B, c'est le nombre de paramètres, de milliards de paramètres qu'il peut avoir. Donc plus il y en a et plus il est intelligent entre guillemets. Et ici vous allez voir qu'en fait bah j'ai quand même obtenu un résultat. Alors certes, je le trouve moche. Moi j'aime pas les couleurs. C'est c'est vraiment pas ce que j'aurais choisi pour voilà. J'ai oublié de lui dire que je voulais un type d'arc et cetera et donc bah il m'a fait ça. Mais en soit il y a quelques petites animations sympa et cetera, vous voyez ? Et ça c'est vraiment un modèle très petit 9B. En gros, vous pouvez le faire tourner sur une carte graphique, j'ai envie de dire même avec des techniques que je pourrais vous montrer, même des petites cartes graphiques anciennes qui ont que 8 Go de VRAM. Et de toute façon, vous pouvez aussi faire tourner si vous avez 8 Go de toute façon à mon avis vous avez forcément plus que que allez 16 Go. Vous avez peut-être 16 Go si vraiment vous êtes en minimum sur votre PC. Je pense que vous pouvez le faire tourner. Alors il sera plus lent forcément que de le faire passer par une carte graphique, mais vous pouvez le faire tourner. Donc ça vous pouvez déjà obtenir des résultats comme ça. Vous voyez des petites animations quand je passe au-dessus et cetera. Donc c'est intéressant malgré que ce soit le modèle 9B. Et là c'est un prompt, j'ai pas ensuite discuté avec lui. Premier GPT, j'ai pris tel quel. J'ai pas dit "Ah bah non, mais là je préférerais que tu fasses ça", rien du tout.

Maintenant, je suis passé sur un modèle un petit peu plus gros, le 35B. Donc 35B là c'est un MOE le modèle. Donc c'est en gros sans rentrer dans les détails, ça me permet en fait euh d'utiliser une sorte de mode expert, c'est-à-dire qu'il se sert que de 3 milliards de paramètres à chaque fois. Donc euh voilà, c'est là ici il en a 35 mais il est constitué d'experts et à chaque fois il interroge les bons experts quand il en fonction des tâches qu'il fait et euh et voilà. Donc ici c'est un plus gros modèle et voilà le résultat que j'ai obtenu. Donc toujours, alors je dis pas de bêtises, à chaque fois je l'ai marqué si c'est Cloud Code. Donc là ici c'est Cloud Code avec le modèle 3.6. Vous voyez que le site est plutôt correct. Rien de transcendant, mais par rapport au premier site qu'on a vu, identique. Je l'ai fait une deuxième fois euh une version 2. Vous voyez ? Elle est même un peu plus sympa et je crois qu'elle est même mieux en réalité que la version de Cloud Code avec Opus directement. Voilà.

Et euh donc ensuite, j'ai utilisé aussi OpenRouter. Alors en fait ce qu'il faut comprendre c'est que là je vous ai montré Cloud Code. Imaginons vraiment que vous avez pas de carte graphique ou quoi que ce soit. Vous pouvez utiliser OpenRouter. OpenRouter c'est en fait il il vous avez un compte, vous mettez des crédits dessus et vous avez la possibilité d'utiliser n'importe quel modèle. Même Opus finalement 4.6, 4.7, ça va vous consommer juste plus de crédit que certains modèles. Donc il y a énormément de modèles sur OpenRouter. Euh c'est ça l'avantage, c'est que bah vous avez qu'une clé à payer et vous utilisez ensuite les modèles que vous voulez. Donc avec OpenRouter, je l'ai utilisé en free, c'est-à-dire que vous avez des modèles gratuits dans OpenRouter et j'ai utilisé un modèle gratuit de OpenRouter. Donc je lui ai laissé faire un petit peu celui qu'il voulait. Euh je j'en parlerai peut-être plus tard dans OpenRouter donc je vais pas m'éterniser, mais voyez avec un modèle gratuit. Donc là c'est que même si vous avez une configuration qui est vraiment qui tient pas forcément la route, un petit laptop ou quoi que ce soit, même un petit Raspberry, pourquoi pas, et ben là vous pouvez faire tourner quand même parce que vous allez utiliser finalement OpenRouter. Donc c'est les calculs ce qu'on fait en dehors de votre ordinateur et ce que j'ai obtenu ressemble à ce que alors ça paraît un peu plus simple. On voit que c'était un modèle gratuit, il s'est pas trop foulé. Donc le même prompt, on voit que j'ai beaucoup moins de contenu, j'ai même pas de FAQ ou quoi que ce soit. Mais bon, c'est quand même correct. Je pourrais lui demander de les rajouter au fur et à mesure. C'est juste que ça me demandera moins de travail. Mais finalement, le résultat, il est pas non plus incohérent.

Ensuite modèle encore cette fois-ci avec OpenCode. Alors OpenCode c'est comme CloudCode mais je voulais montrer aussi qu'on on a des alternatives à CloudCode et donc OpenCode s'en est une et moi c'est une que j'utilise beaucoup que j'aime beaucoup et j'ai fait tourner à la fois le modèle 9B vous avez vu he que j'avais fait tourner tout à l'heure ici. Cette fois-ci, j'ai pas oublié de lui dire, enfin, je lui ai mis en mode dark. Là, j'avais voulu laisser enfin voir ce qu'il allait me faire, mais au final, j'ai voulu retenter avec le mode dark et j'ai dernier ici encore avec OpenCode qui est le gros modèle de 35B de Qwen 3.6. Donc là, on regarde, vous voyez que j'ai une petite animation un peu plus sympathique et ça c'est un modèle 9B vraiment j'insiste parce que c'est quand même exceptionnel les résultats qu'on arrive à obtenir avec des modèles extrêmement petits. Ils font là, il fait quoi ? 8 9 Go le ce modèle. Donc alors si ça dépend des quantifications, je vous explique ça juste après. Mais en gros c'est un modèle relativement léger que honnêtement là je pense 90 % d'entre vous peuvent peut faire tourner facilement. Donc bon voilà, on va pas c'est pas un champion du monde pour me créer des dessins clairement, mais voilà, il a essayé et moi à moi de mettre une image, on voit qu'il essayer de faire des icônes aussi, apparemment il s'est un peu lourdé, mais il me fait des choses. Alors là, il a pas réussi à me faire fonctionner. Donc faudra regarder pourquoi, il y a peut-être un un problème de JavaScript et cetera, mais résultat plutôt correct pour un 9B, c'est c'est même plutôt énorme. Et là ensuite le modèle 35B sur OpenCode. Évidemment, pas de surprise, quelque chose de propre, quelque chose qui. Alors, ça c'est pareil, ça fonctionne pas. Alors, c'est bizarre, j'ai l'impression qu'il fonctionne pas les. Alors là, il m'a écrit directement les choses. Donc là, bon, en réalité, je pourrais très vite lui dire que ça fonctionne pas, il pourrait me le faire. Je pense que là, il y a pas de il y a pas de souci là-dessus. Mais voilà.

Donc ici, on a fait un petit peu le tour d'horizon des différents modèles. Alors là, maintenant, ce que j'aimerais vous montrer, c'est que j'ai rajouté une petite surcouche supplémentaire. Cette surcouche là, c'est moi qui a rajouté des skills, mais perso, un petit peu pour faire ce que j'avais envie un peu plus, on va dire, pour donner plus d'instruction, mais le prompt est resté le même. Donc ce que je vais vous montrer, alors on va choisir plutôt cela. Et là en fait donc je l'ai fait avec Code le modèle 3.6 35B le plus gros entre guillemets. Donc là les deux premiers ça va être ça. Et là vous voyez on commence à avoir autre chose. Là on commence à avoir des animations avec le fond et cetera qui suit ma souris et cetera. On a un design qui est différent. Alors il y a des trucs que j'aime moins, mais on sent qu'il y a un effort supplémentaire qui est fait et ça je vous le dis, c'est en tournant en local avec l'autre code gratuitement. D'accord. Donc là, j'ai même des petites animations de bordure autour. Voilà. Euh cette fois-ci ça fonctionne la FAQ pour celle-ci. Et voilà. Donc là, c'est le modèle 35B. J'en ai une autre. Alors là, je me rappelle qu'il m'avait fait le mode clair par défaut. J'avais été obligé de le modifier parce que il m'avait fait le mode clair alors que je voulais un mode sombre, mais il m'avait prévu le mode sombre. Sauf qu'il l'avait pas bien codé. Donc j'étais obligé de lui redire "Excuse-moi mais tu as dû te tromper quelque part. Euh et je sais pas pourquoi il a pas mis le mode sombre." et j'étais obligé de lui dire une deuxième fois aussi de le mettre par défaut. Euh donc voilà, c'est c'est juste ça que j'ai dû faire, mais sinon c'est encore une fois le même prompt. Et là vous voyez, alors je vais remettre le mode sombre euh c'est plutôt sympa aussi. Donc en fait on se rend compte que quand on rajoute un peu plus d'instruction, un peu plus de skills, on peut tout de suite avoir des meilleurs résultats même que le premier Cloud Code. He si on se rappelle le premier Cloud Code, c'était pas ce résultat là. À limite, j'ai des meilleurs résultats et pourtant je suis restant gratuit. Donc ça montre que si on cherche un petit peu, des modèles gratuits peuvent convenir. Il suffit de savoir les utiliser en fait.

Là le 35B encore. Alors je vais le montrer un plus rapidement. Là il y a des petits effets aussi avec le cadre derrière. Là il y avait un petit effet spot. Est-ce que c'est moi qui lui ai dit ? Je sais pas. Mais bon là c'est incohérent sur les les icônes. Donc c'est pas terrible. Ici j'ai un fond aussi animé et cetera et cetera. Donc là, c'est pas très cohérent pour les cards. J'aime bien ce petit effet de spot à la rigueur. Donc donc voilà, je vous remonte un autre. Alors celui-ci c'est avec OpenCode. Cette fois-ci le gros modèle, les deux gros modèles en fait ici. Donc là j'ai des petites animations, voyez en fond. D'accord ? Donc là j'ai changé un peu les prompts. Je pense que j'ai dit pour certaines couleurs et cetera. J'ai voulu certaines choses. Donc j'ai un peu modifié les prompts, mais c'est pareil, ça reste des prompts qui font pas plus de trois quatre lignes. Donc donc voilà.

Donc voilà ce qu'on obtient un petit peu en creusant un peu plus. Donc je vais montrer le dernier. Je vous laisse faire pause hein pour ralentir ou accélérer la vidéo parce que là j'essaie de de montrer un petit peu tous les résultats que j'ai obtenu parce que j'ai vraiment essayé au fur et à mesure de de d'améliorer les résultats que je pouvais obtenir. Donc là j'ai voulu essayer des nouvelles choses et voilà. Donc ça c'est les résultats qu'on peut finalement obtenir en utilisant OpenRouter. Donc en fait en utilisant que des modèles gratuits tout en étant avec OpenCode, tout en étant avec Code ou OpenCode. D'accord ?

Alors pour ceux que ça intéresse vraiment, je vais vous montrer une petite astuce en plus hein. Vous pouvez aller, je crois que je vais chapitrer la vidéo pour que pour avoir différentes astuces et cetera. Là ce que je vais faire, c'est vous expliquer un petit peu comment ça fonctionne et comment choisir votre modèle parce que ici vous allez être perdu. Vous allez pas savoir quoi choisir. Là, vous allez peut-être utiliser les mêmes modèles que moi, mais est-ce que votre carte graphique est la même et cetera, on sait pas. Donc là, je veux juste que vous compreniez. En fait, quand vous arrivez sur un modèle, donc là, ici, vous êtes ici. Euh, je vais l'éjecter celui-ci. J'espère que d'ailleurs ça a pas foiré ma vidéo parce que là, je serais dégoûté parce que je l'ai laissé en fond. Euh, ici, en fait, vous avez différents modèles. Vous avez les Qs, mais je vous les conseille pas. Ils ont tendance à s'arrêter en plein milieu. J'ai toujours pas trouvé de solution pour. Je suis obligé de leur dire continue, continue, continue. En permanence, c'est un calvaire, donc j'utilise pas. Ils ont l'air compétent, mais clairement euh pénible. Donc ce que j'aime beaucoup, c'est les Qwen 3.6 et on va rester sur Qwen. Donc je vais taper par exemple là vous dites "OK, je tape Qwen 3.6". Quel modèle je choisis ? Déjà vous avez les modèles un peu officiels entre guillemets et vous avez des modèles de la communauté et cetera. Ce qu'il faut regarder quand vous téléchargez un modèle, par exemple là, vous avez le 27B ou alors on va prendre le 35B à 3B parce que c'est celui qui va m'intéresser un peu plus. Vous avez différentes différents modèles que vous pouvez télécharger. Vous voyez qu'ils sont plus ou moins gros. Évidemment en fait les modèles même un modèle he le 35B par exemple, je vais pas dire tout à chaque fois 35B à 3B vous voyez duquel je parle. Le 35B en fait vous avez plusieurs possibilités. C'est ce qu'on appelle la quantification. Et donc je vais vous montrer en fait ce qui se passe si je remonte ici ce qui se passe c'est que vous avez votre VRAM. C'est ce que en général si vous avez une carte graphique, vous avez une VRAM ici et vous avez votre RAM de PC. D'accord ? C'est une mémoire qui est faite pour être chargée, déchargée. C'est pas la mémoire de vos disques durs, c'est vraiment la mémoire rapide entre guillemets qui sert de tampon et c'est là où vous chargez toutes vos applications. Donc quand vous chargez un modèle, vous avez une quantité de VRAM qui est fixe. En général, vous avez par exemple, moi j'ai 16 Go de VRAM. Donc le modèle que vous avez vu par exemple qui faisait 20 22 Go bah forcément si je le mets dans ma dans ma VRAM, ça ne rentre pas. Il va forcément dépasser sur la RAM. D'accord ? Donc à vous de trouver des modèles qui peuvent entrer déjà dans votre RAM. C'est ça va vous garantir en fait que le modèle sera rapide parce que s'il est chargé en RAM, ça va être beaucoup plus lent, surtout si vous avez pas un processeur qui est assez rapide euh notamment dans les calculs IA, ça risque de poser des problèmes. Mais il y en a qui ont euh des ordinateurs qui vont avoir quelques par exemple les Mac Mac euh MacBook Pro et cetera, ils ont une sorte de GPU intégré au CPU et cetera et donc ils arrivent quand même à avoir des des calculs euh assez rapides, mais en réalité ça remplacera pas une carte graphique qui a une une VRAM assez importante parce que la carte graphique va vraiment très très vite. Ils ont des débits énormes. Donc en vrai, ce qu'il va falloir faire, c'est peut-être par exemple partir sur le modèle 9B. Par exemple, là vous allez voir, vous vous dites peut-être OK, ben moi dans ce cas-là, je vais prendre un 9B. Alors, peut-être qu'il y en a pas en 3.6 pour l'instant. C'est les 3.5, je crois. Je mettre ça là. Vous voyez, j'ai le modèle 9B et lui il fait 6 Go. Donc il est moins intelligent, mais déjà il va rentrer dans votre. Ensuite, il y a une autre chose en fait, un même modèle. Alors je vais revenir ici. Je vais reprendre un modèle euh 3.6 et je vais prendre le 35B. Si vous allez par exemple sur celui-ci et bien vous voulez que le 35B cette fois-ci il fait que. Alors il y a la classique à 22 Go et vous envoyez certains qui font que 14 13 et cetera. Alors là vous dites bah c'est bizarre, le modèle il est censé avoir 35 milliards de paramètres et cetera. On a quelque chose qui s'appelle la quantification. En gros, c'est une sorte de compression. Ce qu'il faut comprendre, c'est que le modèle il est quand même assez gros. Il a des milliards de paramètres. Ça ça ne bouge pas, mais on peut le compresser d'une certaine manière. Et pour que vous compreniez, on va prendre l'analogie d'une vidéo. Vous pouvez avoir une vidéo et la lire. Vous avez votre film, vous le voyez et il y a pas de problème. Il est en 4K. Mais en réalité peut-être que vous pouvez pas faire tourner la 4K ou vous avez pas assez de de connexion pour télécharger un film en 4K ou je ne sais quoi. Donc vous allez descendre. Vous allez peut-être regarder la vidéo ou même le film la vidéo YouTube en 1080 par exemple ou en 1440 et cetera. vous descendez. Forcément, la qualité, elle est moins bonne, mais vous pouvez quand même apprécier la vidéo. Évidemment, plus vous allez descendre en compression, bah plus la vidéo, elle va être illisible. Peut-être que certaines vidéos, ça sera pas trop dérangeant parce que vous allez pouvoir quand même comprendre la substance et arriver à un résultat peut-être moins bon, mais voilà, vous allez y arriver. Parfois, non, ça sera pas possible. Si par exemple moi je vous fais un tuto et que vous voyez des lignes, si c'est en 5 en en des lignes de code, si vous voyez en 144p ou je ne sais quoi ma vidéo, vous risquez de pas du tout pouvoir lire ce que j'écris. Donc il y a des moments, ça va pas être possible. Mais du coup, ça peut permettre parfois de faire quand même tourner certains modèles. Donc en fait, un même modèle, en réalité, on peut venir ici le réduire en prenant une quantification plus petite. Et on a autre chose. Vous dites "OK, je prends le modèle à euh 15 16 Go !" Donc vous dites "Bah c'est bon, le modèle il rentre." On a un autre problème, on a le contexte. Et votre contexte. Bah si par exemple vous avez pris un modèle qui est vraiment juste et qui rentre juste dans votre RAM, et ben vous allez avoir malheureusement une ici une impossible enfin le contexte va forcément déborder en fait sur votre RAM et là ça va être embêtant. Là tout va ralentir en fait même si votre modèle ici il est il est dans votre VRAM, ralentir. Vous allez avoir deux trois tokens, c'est ça va vraiment pas être terrible. Donc deux trois tokens par seconde qui sont générés. Donc c'est même moins rapide que de le lire. Donc vraiment c'est très long. Donc là ça va être compliqué. Heureusement, on peut faire aussi une chose déjà, c'est vous, on va dire qu'on a quantifié ou on a pris un modèle plus petit et cetera et là vous avez besoin de beaucoup de contexte ou finalement si vous n'en avez pas besoin de beaucoup, vous choisissez. En fait, vous voyez sur LM Studio par exemple, quand je lance un modèle, j'ai des paramètres ici. Là, par exemple, j'ai donné un contexte de 80000 tokens, mais je peux le réduire, d'accord ? Je peux venir ici le bouger. Alors, vous avez le maximum du modèle en question, par exemple, un 9B. Bah là, ici, il peut pas aller à plus de 200 et quelques 200000 tokens, ce qui est pas mal en réalité. Mais voilà. Donc ça déjà, vous pouvez le réduire, mais vous pouvez aussi réduire la quantification. Donc vous allez dans le flash attention ici, flash attention et ensuite vous pouvez quantiser. Donc, plus vous prenez un chiffre petit et plus votre contexte aussi va être réduit. Alors, Q4 c'est j'ai obtenu des bons résultats. Alors, en général quand vous mettez Q4 à 1 en K, vous mettez aussi en V. D'accord ? Alors, moi, je suis pas un expert, donc fait comme je dis pour l'instant ça marche, mais si vous le faites pas, vous risquez d'avoir plus de problèmes. Donc là, par exemple, vous pouvez mettre un contexte comme ça qui se réduit et du coup tout rentre dans votre VRAM. Donc là, ça peut être intéressant. Donc voilà comment choisir un modèle.

Alors ensuite, il y a la particularité des euh des modèles MOE. Alors ici euh c'est pareil, je suis pas un pro, mais j'ai fait pas mal d'essais, j'ai regardé pas mal de de docs et cetera. Euh en réalité au début quand je le faisais tourner le 35B, il était très lent. C'était un enfer. Il m'a mis 45 minutes pour générer mon site, je crois. Donc c'est vraiment un enfer. C'est c'est pas exploitable pour un agent par exemple de code. C'est alors vous pouvez lui envoyer une tâche et puis après vous faites autre chose, pourquoi pas ? Mais ce que je veux dire, c'est que c'est vraiment très lent. Alors, sachant que pour générer des du texte quand même, c'est beaucoup he c'est il générait plus de 20000 tokens. Mais bon, si vous faites ça à trois tokens par seconde, vous comprenez que c'est un peu long, quoi. Donc en réalité, vous pouvez faire une chose. Comme c'est un modèle qui interroge des experts ici, vous pouvez venir le diviser en réalité. Donc, il y a le modèle, une partie des experts en fait qui sera sur votre RAM, d'accord ? et la partie réflexion en fait, elle sera sur votre VRAM. Forcément, ça va euh pas être aussi rapide que si tout le modèle rentrait euh directement dans votre VRAM, mais c'est une manière de faire et ça vous permet d'avoir un contexte aussi qui est euh correct. D'accord ? Donc moi, le 35B que je vous montre concrètement ce que ça veut dire avec des chiffres, le 35B ici normalement il rentre pas dans ma VRAM, il fait euh alors je vais l'agrandir ici. Il fait 22 Go voyez. Donc moi j'ai 16 Go, c'est pas possible. D'accord ? Voilà ce que j'ai fait. J'ai en fait j'ai dit "OK, GPU offload, tu mets tout." Tu es censé mettre tout normalement sur le euh GPU. D'accord ? Euh par contre, ce que j'ai changé ici, c'est le nombre d'experts, j'en ai forcé à aller en RAM parce que eux, c'est pas eux qui vont me ralentir le plus, d'accord ? Donc eux, ils vont aller en RAM. J'ai j'ai trouvé une valeur en fait qui était correcte ici de 20 pour ma. En vrai, vous commencez plus haut, mettez-en plus sur votre RAM et regardez à combien votre VRAM, vous faites Ctrl+Alt+Suppr, vous allez dans les performances, vous regardez combien votre VRAM elle est utilisée. Et ensuite bah vous ajustez cette valeur pour essayer d'en mettre le moins possible évidemment et de saturer au plus votre RAM pour que voilà le le principal soit sur votre RAM. Et ensuite bah là j'ai obtenu des meilleurs résultats. J'ai réussi à obtenir jusqu'à 16 tokens par seconde. Alors en général un modèle comme Claude en général il nous fait du 60 80 tokens par seconde, ça dépend des moments de rush et cetera. Donc on arrive à des on arrive à quatre fois moins rapide, on va dire ça devient correct. D'accord ? Parce que là, si vous avez des tâches de raisonnement qui sont un peu plus complexes, bah là ça va vraiment être efficace. D'accord ? Et c'est surtout qu'en fait ici, vous voyez, j'ai le modèle 35B, je l'ai eu en Q4, donc il réfléchit mieux en réalité. D'accord ? Et en fait, comme il réfléchit mieux, euh j'y pense maintenant, faut aussi enlever le Map. Euh c'est je sais plus, c'est marqué de désactiver. Euh ça veut dire que en gros si le modèle dépasse de votre RAM, c'est mieux de le faire. Je sais pas pourquoi c'est mieux de le faire. C'est marqué, je l'ai fait et bah ça marche bien. Mais donc ce que je voulais dire, c'est que en fait ici, vous voyez, j'ai un autre modèle de 35B ici euh par exemple qui fait 11 euh et j'ai même alors j'en ai d'autres normalement ici des voilà des IQ 2. Donc là vraiment c'est très compressé hein, c'est comme si j'avais du 360p. Euh il fait le taf, il est très rapide. J'ai du 100 tokens par seconde, donc limite je vais plus vite que Cloud Code, mais bon, il rate plus souvent, il me fait plus souvent d'erreurs. Et j'ai eu des fois des boucles par exemple où bah il dit "Ah bah en fait faut que je fasse ça pour corriger ça." Paf et il recommence. "Ah ben en fait faut que je fasse ça pour corriger et il reste comme ça, je suis obligé de l'arrêter." Donc voilà, c'est possible, ça dépend des tâches. Donc à vous de voir ce qui peut passer. Sinon, vous avez toujours aussi OpenRouter et cetera. Voilà.

Donc on arrive à la fin de la vidéo. Ce que je voulais aussi vous montrer, c'est évidemment OpenCode. OpenCode. Pourquoi je vous en parle ? Parce que je vous ai justement dit qu'il y a des forfaits en fait. OpenCode c'est un agent comme CloudCode vraiment et qui fonctionne de la même manière qui est très performant. Je vous ai montré, on a des résultats identiques hein avec avec Open.

Code he par exemple ce ce site là ici ça a été fait avec Open Code et le modèle 35B sur ma carte à moi, ma carte graphique. Sauf que ici vous avez aussi parfois besoin d'utiliser des modèles peut-être plus conséquent, plus à un opus par exemple de dipsic V4.

Et en fait moi j'ai un forfait que j'aime beaucoup, le forfait go que j'ai en plus et j'utilise en réalité énormément. Le Fego, c'est 5 dollars, 5 € on va dire par mois, le premier mois en tout cas, ensuite 10 €. Et honnêtement, j'ai jamais alors contrairement à à Claude Code, j'ai jamais réussi à et même si je m'en sers tous les jours, j'ai jamais réussi à dépasser les limites. Vraiment le coût par exemple de Dieps V4, même le flash mais même le Pro, j'ai utilisé le Pro Max, je lui balançais plein de requettes, le temps qu'il efface et cetera, il me consommait pas mais 5h et cetera.

Donc ça fonctionne comme code, sauf que c'est beaucoup moins cher. Et vous avez plein de modèles open source en fait, donc les Quen, les Minimx, les Deepsic et cetera. Et j'ai eu des résultats assez étonnants quand j'ai utilisé, j'ai un projet sur lequel je travaille et il y a de la transcription YouTube. Et en fait, c'est dans une extension qu'il récupère les transcriptions YouTube. Et Cloud Code n'y arrivait pas, il a bouclé. À chaque fois, il me dis "Ah bah ça doit être cette erreur là." Il a cherché, il n'y arrivait pas et cetera et cetera. Et donc je lui donnais des indices, je lui donnais des logs et cetera et il y arrivait pas.

Je suis passé à Dipsic en me disant tiens on va voir ce qui ça peut être intéressant. Dipsic n'y arrivait pas non plus au début, premier, il a fait les mêmes erreurs un peu que Claud Code. Sauf que très vite au bout du 3ème promte je crois, il s'est dit OK visiblement j'y arrive pas il y a un truc quelque part que je comprends pas et en gros il m'a dit je vais bourrer les logs, je vais mettre des logs partout et tu vas me dire à tel endroit, à tel endroit et à tel endroit ce que tu obtiens. Je l'ai fait, je lui ai montré les logs et il a corrigé le problème directement. C'était un peu tricky ce qu'il était censé faire. C'est pour ça que je pense que le cloud code n'y arrivait pas.

Ce que je veux dire, c'est pas que Dipsic est meilleur que Cloud que Opus 4.7 ou quoi que ce soit, c'est juste que en réalité parfois même un modèle gratuit va être meilleur qu'un modèle dans certains cas qu'un modèle que vous payez. Donc n'utilisez pas tout le temps Cloud Opus. Prenez les forfaits comme ça, ajoutez ce forfait ou utiliser Open Code avec. Euh alors il y a une méthode, il faudrait que je regarde, je vais m'en renseigner un petit peu plus pour utiliser en fait les modèles de GO en fait directement dans Cloud code, hein. Donc vous pouvez utiliser du dipsic V4 directement dans cl dans cloud code. Donc ça peut être intéressant.

Avoir tous les modèles ne parlent pas correctement. par exemple, les GMA 4 ne parlent pas correctement euh avec Claud code et il y a des soucis que j'ai pas réussi à corriger. Donc en fonction des modèles, moi je vous en donne les quen, ça fonctionne très bien. Et donc il y a aussi une technique apparemment pour utiliser votre abonnement GO, donc à seulement 10 € avoir des limites énormément plus conséquentes parce que vraiment le Deepsic V4, il consomme rien du tout. Euh le Quen 3.6 c'est pareil. Donc vraiment vous avez des des limites qui seraient énormes. Là vous avez plus que l'équivalent du max à 200 €. Donc vraiment tester Open Code. Vous avez des résultats qui sont bah similaires en fait si vous savez ce que vous faites. Honnêtement, je vois pas.

Moi c'est très rare en fait. Des fois je reviens sur Cloud Code et je lui dis "OK là ça, j'ai pas réussi à faire ça. Qu'est-ce que tu vois ?" en architecture mais du coup je l'utilise beaucoup moins et ce qui fait qu'en fait moi j'ai un forfait à 20 € sur Cloud Code et qui fonctionne malgré que je code tous les jours. Donc donc enfin je code tous les jours. Oui à peu près en tout cas. Donc voilà, c'est c'est franchement c'est c'est plutôt efficace. Donc je vous conseille cl code, ça fait partie des petites astuces. Euh j'en ai noté ailleurs. Euh est-ce que je les ai tous dit ?

Bah évidemment alors comme je disais utiliser le bon modèle en fonction des tâches que vous utilisez. Même là despic V4, ça sert à rien d'utiliser au max si vous c'est pour changer la couleur d'un bouton. vraiment penser à ça, vider les MCP aussi parce que alors ça c'est le truc que je vois en permanence qui vous consomme énorm en qui vous consomme énormément votre facture sur open code sur Cloud Code pardon parce que vous laissez en arrière-plan vos connecteurs entre guillemets si vous regardez dans dans Cloud code vous avez sûrement des MCP qui tournent et c'est pour ça que en fait vous cramez à une vitesse folle et quand 3 qu promptes moi je l'ai fait l'erreur. Donc je sais euh je suis arrivé au bout en tr ques à ma limite de 5h enfin des des 5h donc j'ai fait un peu la tête donc j'ai compris la leçon. Enlevez vos MCP quand vous en avez pas besoin. Moi j'ai des MCP Figma Notion et cetera. Si je m'en je m'en sers quasiment pas quand je code me sert uniquement de temps en temps et bah je les désactive. D'accord.

Et un autre conseil aussi ne payez jamais d'abonnement à l'année parce que ça change énormément. Euh et il y a euh parfois euh Claude va être super, parfois c'est codex et cetera. Ne soyez pas sectaire, restez pas toujours dans le même euh endroit. Si vous pouvez euh changer euh faites-le. Mais souvent bah on le fait pas parce que on a voulu gagner un peu d'argent en se prenant un abonnement 1 an. Sauf qu'en réalité, on gagne pas forcément parce que bah il est moins bon à un moment donné et cetera. Là, on l'a vu avec Claud Code. Bon ça apparemment c'est mieux maintenant, mais Claud COD pendant un certain temps avait euh une consommation de crédit qui était énorme parce qu'ils avaient pas assez d'infrastructure derrière. Donc voilà, ne prenez pas d'abonnement d'un an. C'était mon dernier conseil.

Voilà, j'espère que ça vous a plu cette vidéo. J'essayé de vraiment d'aller dans le détail pour que économiser, essayer de vous économisiez le plus possible, vous utilisiez au mieux Cloud code avec les différentes possibilités que vous avez. Donc oubliez pas ce fichier settings. D'ailleurs, il y a la même chose en réalité. Si je vais dans Open Code, hein, j'ai fait la même chose, c'est un fichier opencode.gison. Si vous voulez utiliser Open Router ou des choses du genre, vous demandez à à votre préférée et elle va vous donner le script ici de ce qu'il faut remplacer et cetera. D'accord ? Donc voilà, comme je disais, j'espère que cette vidéo vous a plu. Je vous dis à la prochaine pour de nouvelles aventures. Ciao !