Transcription
Si vous avez codé dans Claude Code, vous avez probablement rencontré le problème du gonflement du contexte. Le problème est que chaque appel d'outil MCP dans Claude Code est ridiculement coûteux, car chacun de ces appels déverse sa sortie complète directement dans la fenêtre de contexte de 200 000 tokens du modèle. Et plus vous avez d'outils dans votre ceinture à outils, plus votre contexte se vide rapidement. Dans certains scénarios, vous pouvez vous attendre à 30 minutes d'utilisation active de l'agent avant que votre contexte ne se compacte. Et c'est à ce moment-là que l'IA commence à oublier des fichiers, des tâches et des décisions cruciales. Sans oublier que vous dépensez beaucoup d'argent pour ces tokens. Mais il existe un serveur MCP qui résout ce problème crucial. Il s'appelle le mode contexte. Dans la vidéo d'aujourd'hui, nous allons examiner ce que fait le mode contexte, comment il fonctionne, et l'essayer nous-mêmes avec une petite démo. Ce sera très amusant. Alors, plongeons-y.
Pour comprendre pourquoi cela se produit, regardons les mathématiques. Un seul instantané Playwright d'une page Web représente environ 56 kilo-octets. La lecture de 20 problèmes GitHub représente 59 kilo-octets. Si nous effectuons ces opérations plusieurs fois dans la phase de planification d'une session, vous avez probablement consommé 70 % de votre fenêtre avant même que l'agent n'ait écrit une seule ligne de code.
Le mode contexte agit comme une couche de virtualisation. Au lieu que l'IA parle directement à votre système d'exploitation, elle parle à un bac à sable. Et au lieu de déverser des sorties massives, le mode contexte les indexe dans une base de données SQLite locale utilisant FTS5, alias recherche en texte intégral. Et le résultat est assez significatif. Par exemple, cet instantané Playwright de 56 Ko est réduit à 299 octets, soit une réduction de 99 %. Ou, par exemple, ce fichier CSV d'analyse est compressé à 222 octets, ce qui représente une réduction de près de 100 %.
Mais économiser des tokens n'est qu'une partie de la solution. La véritable utilité ici est la continuité de la session. Nous avons tous vu comment l'historique de l'agent se compacte et soudainement, vous perdez la trace du code qu'il a écrit 10 minutes plus tôt. Mais le mode contexte utilise des hooks pour surveiller chaque modification de fichier, chaque opération de récupération et chaque tâche de sous-agent. Lorsque votre conversation se compacte, le mode contexte crée un instantané hiérarchisé par priorité, généralement inférieur à deux kilo-octets, et le réinjecte. C'est essentiellement un point de sauvegarde pour votre session de codage. Ainsi, vous pourriez hypothétiquement prolonger la durée de votre session de 30 minutes à environ 3 heures. Il suit également les décisions et les erreurs. Par exemple, si l'IA a essayé une correction qui a échoué il y a 20 minutes, elle ne répétera pas cette erreur même après la réinitialisation du contexte.
Et son installation est très simple. Si vous êtes sur Cloud Code, ajoutez d'abord le marché du mode contexte en exécutant la commande suivante, puis exécutez la commande d'installation du plugin. Et une fois que vous avez terminé, vous êtes prêt à partir. Une fois que vous l'avez installé, il gère automatiquement le serveur MCP, les hooks et les instructions de routage. Si vous êtes sur Gemini CLI ou VS Code Copilot, vous pouvez exécuter `npm install context-mode` et ajouter la configuration à vos paramètres.
Maintenant, voyons le mode contexte en action. J'ai cette simple commande Python ici qui créera un fichier journal d'accès factice contenant une liste d'une série de requêtes API factices et leurs codes de statut. Et chaque centième ligne est un journal d'erreur 500. Maintenant, nous pouvons lancer Claude et demander : "Hé, utilise le mode contexte pour indexer access.log. Je veux trouver tous les modèles d'erreur 500 et résumer les adresses IP qui leur sont associées." Et en arrière-plan, le mode contexte découpe les 5 000 lignes du fichier access.log dans sa propre base de données SQLite FTS5. Et Claude ne reçoit qu'une confirmation que le fichier est indexé, pas les 5 000 lignes brutes du fichier. Et maintenant, Claude peut rechercher intelligemment dans la base de données indexée pour interroger le contenu au lieu d'analyser l'intégralité du fichier. Et ici, nous pouvons voir les résultats renvoyés par Claude.
Mais plus important encore, regardons les économies de coûts. Nous pouvons le faire en exécutant `context-mode --stats` et nous pouvons vérifier la quantité de données économisées par le mode contexte dans la session actuelle. Et vous pouvez voir les résultats ici. Au lieu de déverser les 20 kilo-octets entiers dans la conversation, le mode contexte a conservé environ 5 kilo-octets de ces données brutes dans le bac à sable. Et ce résultat est assez impressionnant pour un petit fichier. Il a épargné environ 1 200 tokens d'entrer dans la fenêtre de contexte. Donc, dans l'ensemble, nous obtenons une belle réduction de 25 % en exécutant ce petit test. Cela peut ne pas sembler beaucoup, mais gardez à l'esprit que dans une session Claude standard, les données resteraient là pour toujours et seraient renvoyées avec chaque message que vous envoyez. Et en les gardant dans le bac à sable, nous avons déjà commencé à prolonger la durée de vie de cette session. Et ce fichier de démonstration est assez petit, mais si vous traitez des fichiers plus volumineux, les économies ici pourraient être énormes. Si vous effectuez un projet de recherche sur un référentiel massif ou analysez des journaux à l'échelle de la production, ces 1 200 tokens économisés peuvent facilement se transformer en 100 000 tokens.
Mais le but ici n'est pas seulement d'économiser de l'argent sur les coûts des API. Bien que ce soit un avantage appréciable. Il s'agit également de maintenir l'intelligence du modèle. Lorsque vous nettoyez le bruit de la fenêtre de contexte, vous laissez plus de place au raisonnement réel. vous donnez à Claude l'espace dont il a besoin pour être un meilleur ingénieur. Donc, si vous construisez des projets complexes avec des agents IA, essayez cet outil et voyez combien de temps vous pouvez prolonger vos sessions avant que l'agent ne commence à se compacter et à oublier des choses. Et si vous avez apprécié cette analyse technique, faites-le moi savoir en écrasant le bouton "j'aime" sous la vidéo. Et n'oubliez pas de vous abonner à notre chaîne. C'était Andras de Better Stack et je vous retrouve dans les prochaines vidéos.