Transcription
Une autre technique un peu banger quand même, euh, c'est d'aller dans Cloud Code et de mettre en place une routine depuis que c'est sorti.
Ici, vous avez en fait le tracking d'absolument tout ce que fait Cloud. Cloud utilisait jusqu'à peut-être 50 ou 60 % de token en moins grâce à juste ce plugin.
Vous pouvez aller dans capacité. Moi, ce que je vous conseille de mettre, c'est "charger les outils si nécessaire".
Une autre technique, les gens pensent bien faire en faisant des messages séparés entre 5h et 11h du matin et entre 1h et 7h. Maintenant, j'utilise extrêmement peu de token depuis maintenant plus de 2 ans, et c'est vraiment avec toutes les techniques que je vais vous donner aujourd'hui que vous allez pouvoir réussir à faire ça.
Vous voyez que ma limite hebdomadaire n'a pas été atteinte depuis super longtemps. Je ne me souviens même pas de quand c'est arrivé la dernière fois. Et c'est juste avec quelques petites techniques faciles à mettre en place que vous allez pouvoir réussir à faire ça. Je vais vous donner tout mon playbook, vous allez voir, ce n'est pas si compliqué.
Ce qu'il faut que vous compreniez qui est super important, c'est que Claude passe en fait 98 % de son temps à lire et en fait seulement 2 % à écrire. Un token est égal à environ 3/4 d'un mot. Il faut vraiment que vous économisiez au maximum le nombre de mots qu'il va lire. Et donc, à chaque fois qu'il revient sur la discussion passée, il va tout relire, et c'est là qu'il utilise beaucoup de tokens.
Du coup, par exemple, vous avez ce repository sur GitHub dont tout le monde parle en ce moment, Caveman, où Claude va vous parler comme un homme des cavernes, comme c'est dans le nom. Au lieu de dire toute une phrase, il va juste utiliser les mots-clés, par exemple. Donc, c'est beaucoup moins agréable, c'est beaucoup moins détaillé, c'est sûr, mais c'est vraiment utile si votre but, c'est vraiment juste d'économiser des tokens.
On a vu que Cloud utilisait jusqu'à peut-être 50 ou 60 % de token en moins grâce à juste ce plugin. Je vous mets le lien en description, bien sûr, pour l'installer. Rien de plus simple. Vous avez toutes les commandes juste ici. Donc, imaginons que vous soyez sur cloud code, vous avez juste à taper ça dans votre terminal. Ça marche donc avec tous les agents de code.
Si vous donnez un premier message à Claude, vous pouvez lui demander de modifier ce message. Donc, là, disons que je lui ai posé une mauvaise question. En fait, je vais juste réécrire la question et une fois que c'est fait, vous faites enregistrer. Et là, au lieu de euh, re euh, trompetter pour Claude, il va juste revenir à la base sans relire toute la conversation. Là, déjà, vous économisez énormément de token juste avec ce petit tips.
Donc, comme je vous l'ai déjà expliqué, Claude utilise énormément de token quand vous lui envoyez beaucoup de messages dans la même conversation. Donc, ce que vous pouvez totalement faire. Donc, là, disons que j'ai eu une conversation avec Claude, qu'elle est trop longue, que ça fait 15, 20 messages que je lui ai envoyés. Du coup, je vais lui demander : "Fais un résumé de notre conversation en .md". Ce qu'il a fait. Et donc, là, en fait, vous avez un document .md que vous pouvez par exemple copier ou vous pouvez le télécharger. Et ensuite, vous allez venir ici, créer un nouveau chat et lui donner ce qu'il a généré. Et là, on repart de la base et ensuite vous lui donnez votre prompt.
Une autre technique, les gens pensent bien faire en faisant des messages séparés, donc en donnant des petites tâches une par une. Donc, par exemple : "Résumer cet article", "Maintenant, lister les points clés", "Maintenant, suggérer un titre". Et en fait, à chaque fois, il va recharger tout le contexte, donc tous les messages passés, et c'est là qu'il utilisait énormément de token à chaque fois. Donc, trois fois là où vous pouvez économiser, c'est en évitant le chargement du contexte numéro 1 et le 2. Et donc, vous mettez tout ça ensemble : "Résumer cet article, lister les points clés, suggérer un titre". Et là, vous aurez un seul chargement. En plus de ça, Claude préfère, parce qu'il va avoir tout le contexte d'un coup, et ce qui va lui permettre de donner une meilleure réponse, plus précise.
Cette technique, elle a été game changer pour moi. Ici, vous avez un repo GitHub. Je vous mettrai encore bien sûr le lien dans la description, qui est juste mais parfait. Ici, vous avez en fait le tracking d'absolument tout ce que fait Cloud. Donc, que ça soit avec les modèles, ce qu'il a utilisé. Ici, regardez, vous avez Cloud Plus 4.6, Cloud Sonnet, et cetera. Vous voyez exactement tout ce qui consomme au token près, et donc vous pouvez savoir un petit peu là où vous utilisez trop de token. Et vraiment, je trouve, c'est tellement intuitif. Moi, j'ai adoré ce repo. J'utilise tous les jours.
Tout ce que vous avez besoin de faire, c'est avoir Python installé sur votre télé, sur votre ordinateur, pardon. Et vous tapez soit ses commandes sur Windows, soit celle-ci dans votre terminal, et vous aurez accès à tout ça. C'est génial.
Bon, là, très honnêtement, la technique que je vais vous donner, si vous ne l'avez pas encore faite, c'est juste, je pense que vous avez un peu la flemme, mais je vous conseille vraiment de le faire. C'est aller dans projet. Vous créez un projet, tac, vous lui donnez un nom. Et là, en fait, vous avez un projet qui vient de se créer, et vous pouvez mettre en mémoire toutes vos instructions ou tous vos fichiers. Donc, si par exemple, vous avez un projet, disons, de faire un PowerPoint, vous pouvez lui donner toutes les instructions, donc de préférence dans un seul prompt bien rédigé, avec ce que va être votre projet, en quoi il consiste, quelles sont vos règles, et ici les fichiers. Donc, ça peut être vos images, ça peut être des PDF, ça peut être, vous voulez reprendre le style d'un autre PowerPoint que vous avez eu sur internet, et ben vous le mettez ici. Et là, vous n'aurez pas à redonner tout le contexte à chaque fois que vous commencez une nouvelle conversation ou à chaque fois que vous recommencez un prompt. Ça évitera de réitérer, de recommencer en fait pour la même tâche encore et encore. Là, vous allez aussi beaucoup économiser de token.
Bon, un peu à l'image de la technique qu'on vient de voir, si vous l'avez pas encore mis en place, je pense que c'est juste un peu de flemme. Ce que je peux totalement comprendre. Vous allez dans paramètre, vous pouvez décrire votre fonction professionnelle si vous en avez une, et redécrire un petit peu, bah, quelles sont vos préférences. En fait, tout simplement, ça va être un peu des règles, des préférences que Claude va remettre à chaque conversation, à chaque fois qu'il vous parle. Et c'est vrai que ça économise quand même pas mal de tokens, et surtout, il va vous donner des réponses beaucoup plus associées avec vous, ce que vous recherchez, ce qui évite de reprompter régulièrement.
Bon, vous êtes ici dans les paramètres et vous pouvez aller dans capacité. Moi, ce que je vous conseille de mettre, c'est "charger les outils si nécessaire". Et en fait, ça va charger par exemple les connecteurs ou c'est pour la recherche web aussi. En fait, c'est des fonctionnalités qui vont être utilisées seulement si nécessaire. Et un peu pareil, moi, je vous conseille aussi de désactiver par défaut la réflexion étendue, la deep thinking, et seulement de l'activer quand vous en avez besoin pour des réflexions plus longues sur des problèmes plus complexes.
Choisissez bien votre modèle. Moi, par exemple, j'utilise Sonnet la plupart du temps. Quand par exemple, je vais faire du code et que il a, il a du mal à débugger, je vais utiliser Opus. Et quand disons, je fais juste des recherches ultra basiques, j'utilise Haiku. Si par exemple, je cherche une chaîne YouTube, je sais qu'il va la trouver, bah voilà, Haiku direct.
Passer trop de temps sur cette technique parce qu'elle n'est pas vraiment applicable à tout le monde, mais si vous en avez la possibilité, en fait, vu que les sessions sont des sections sont des sessions de 5h à chaque fois, il faut vraiment que vous répartissiez sur toute votre journée vos sessions et essayez aussi de les lancer le plus tôt possible. Je me lève, je vais sur l'ordi, je fais un premier prompt et hop, comme ça, je sais qu'il a lancé euh le cursus de 5h.
Une autre technique un peu banger quand même, c'est d'aller dans Cloud Code et de mettre en place une routine depuis que c'est sorti. Vous lui mettez en place une nouvelle routine et euh vous lui dites de lancer une session. Par exemple, disons que moi, je me lève à 8h, ben je lui demander de lancer une session à 5h du mat et on lui donne une tâche vraiment ultra basique. Par exemple : "Donne-moi mon nombre d'abonnés gagné depuis hier". Et en fait, juste en créant cette tâche euh tous les matins à 5h, et ben je sais que moi quand je me réveille à 8h, je peux commencer ma session et en fait le compte à rebours d'utilisation aura commencé en fait déjà depuis un moment et il va bientôt être euh restart, il va bientôt être reboot et donc je sais que pendant 2h en me réveillant, je peux bosser un max.
Pas forcément cool, mais maintenant c'est comme ça. On a un des gardiens de tropiques qui a annoncé que entre 5h et 11h du matin et entre 1h et 7h maintenant, donc typiquement des horaires de bureau, les sessions limitent. Ça, c'est vraiment chiant, mais c'est comme ça. Ça a changé depuis le 27 mars. Donc, ce que je vous conseille bien sûr, c'est d'utiliser Claude en dehors de ces horaires-là.