11 techniques pour ne plus jamais atteindre ta limite de tokens sur Claude
Voici comment économiser des tokens sur Claude et tenir toute la semaine sans bloquer, avec 11 réglages concrets testés sur deux ans.
28 juin 2026
Économiser des tokens sur Claude, c'est devenu une compétence à part entière depuis qu'Anthropic a resserré les limites le 27 mars. La bonne nouvelle : j'utilise très peu de tokens depuis plus de deux ans, et ma limite hebdomadaire n'a pas sauté depuis tellement longtemps que je ne me souviens plus de la dernière fois. Voici le playbook complet.
Pourquoi tu brûles tes tokens sans t'en rendre compte
Le point à comprendre avant tout le reste : Claude passe 98 % de son temps à lire et seulement 2 % à écrire. Un token vaut environ trois quarts d'un mot. À chaque fois que tu lui renvoies un message dans une conversation, il relit tout l'historique depuis le début. Plus la discussion est longue, plus chaque nouvelle requête coûte cher. Ton objectif est donc simple : réduire le nombre de mots qu'il doit relire.
Réduire ce que Claude relit
**Parle en mots-clés avec Caveman.** Il y a un repository GitHub dont tout le monde parle en ce moment, Caveman, qui force Claude à répondre comme un homme des cavernes. Au lieu de rédiger des phrases complètes, il sort des mots-clés. C'est moins agréable et moins détaillé, évidemment, mais sur les tests la consommation tombe de 50 à 60 %. Si ton seul but est d'économiser, ça vaut le coup. L'installation tient en une commande dans le terminal et ça marche avec tous les agents de code.
**Modifie ton message au lieu d'en renvoyer un nouveau.** Tu as posé une mauvaise question ? Plutôt que de relancer Claude par-dessus, réécris directement le premier message et enregistre. Il repart de cette base sans relire toute la conversation. C'est un détail, mais sur une longue session tu économises énormément.
**Résume puis repars à zéro.** Quand une conversation atteint quinze ou vingt messages, demande-lui un résumé au format Markdown. Tu télécharges ce fichier, tu ouvres un nouveau chat, tu colles le résumé, et tu continues sur une base propre au lieu de traîner tout l'historique.
**Regroupe tes tâches dans un seul prompt.** Beaucoup de gens croient bien faire en découpant : résume cet article, maintenant liste les points clés, maintenant propose un titre. À chaque message, Claude recharge tout le contexte. Mets les trois demandes dans un seul prompt et tu n'auras qu'un seul chargement. Bonus : avec tout le contexte d'un coup, sa réponse est aussi plus précise. Cette technique a été un déclic pour moi.
Mettre tes réglages au travail
**Crée un projet.** Si tu ne l'as pas fait, c'est sûrement par flemme. Un projet te laisse stocker tes instructions et tes fichiers en mémoire : règles, images, PDF, le style d'un PowerPoint à reprendre. Tu n'as plus à redonner le contexte à chaque nouvelle conversation. Pour une tâche répétée, c'est du token gagné à chaque fois.
**Remplis tes préférences dans les paramètres.** Décris ta fonction et tes préférences une bonne fois. Claude les réinjecte à chaque conversation, tu reformules moins et ses réponses collent mieux à ce que tu cherches.
**Charge les outils seulement si nécessaire.** Dans les paramètres, section capacité, choisis le chargement des outils à la demande. Les connecteurs et la recherche web ne se chargent que quand ils servent. Désactive aussi la réflexion étendue par défaut et ne l'active que pour les problèmes complexes.
**Choisis le bon modèle.** Sonnet pour la plupart des cas, Opus uniquement quand le code coince au débogage, Haiku pour les recherches ultra basiques comme retrouver une chaîne YouTube. Sortir Opus pour une question triviale, c'est gaspiller.
Suivre et étaler ta consommation
**Installe un tracker.** Un autre repo GitHub suit absolument tout ce que fait Claude : quel modèle, combien de tokens, où ça consomme trop. Il te faut juste Python installé, une commande dans le terminal, et tu vois tes points de fuite. Je m'en sers tous les jours.
**Étale tes sessions sur la journée.** Les sessions durent cinq heures. Lance la tienne le plus tôt possible : je me lève, je vais sur l'ordi, je fais un premier prompt, le compteur de cinq heures démarre. Tu peux même créer une routine dans Claude Code qui lance une session à 5h du matin avec une tâche bête, genre « donne-moi mes abonnés gagnés depuis hier ». À ton réveil, le compteur est déjà bien entamé et proche du reboot, donc tu enchaînes sur une nouvelle fenêtre.
Dernier rappel utile : depuis le 27 mars, les limites se resserrent entre 5h et 11h et entre 13h et 19h, soit les horaires de bureau. Pour économiser des tokens sur Claude sans jamais bloquer, le réflexe le plus simple reste de bosser en dehors de ces créneaux.
La vidéo complète est sur la chaîne.