LLM Token Counter: Voyez exactement comment les modèles GPT découpent votre texte.
S’exécute dans votre navigateur — rien de ce que vous collez ne quitte cette page. Comment nous le prouvons
Espace de test du LLM Token Counter
Other vendors (Claude, Gemini, Llama) use different tokenizers — counts here are approximate for them; use the vendor's count endpoint for billing.
Results update as you type — press Enter to run now.
Tokens
o200k_base — GPT-5, GPT-4.1, GPT-4o, o1 / o3 / o4-mini
Collez un prompt, un document ou une charge JSON, choisissez l’encodage o200k_base ou cl100k_base, et obtenez le nombre exact de tokens avec la frontière de chaque token surlignée — ainsi que les caractères, mots, octets et le coût à votre propre prix par million de tokens, le tout calculé dans votre navigateur, sans inscription.
Le fossé
Les modèles lisent des tokens. Vous écrivez des caractères.
Un modèle de langage ne voit jamais votre texte comme des lettres. Un tokenizer le découpe d’abord en tokens — mots courants entiers, morceaux de mots plus rares, ponctuation, suites d’espaces — et le modèle travaille sur leurs identifiants. En anglais, un token fait en moyenne environ quatre caractères, mais ce n’est qu’une moyenne : le code, les nombres, les URL et les écritures non latines se découpent en bien plus de tokens par caractère, et le français coûte généralement un peu plus que l’anglais.
Ce nombre compte trois fois. La fenêtre de contexte est un budget de tokens : elle décide si un document tient ou non. La facturation se fait au token, généralement exprimée par million, avec l’entrée et la sortie à des prix distincts. Les limites de débit sont souvent fixées en tokens par minute, si bien qu’un long prompt peut vous freiner avant le nombre de requêtes. Estimer à partir des caractères, c’est ainsi qu’un prompt qui « devrait tenir » se retrouve tronqué.
En octobre 2026, les modèles actuels d’OpenAI — GPT-5, GPT-4.1, GPT-4o et la série o — utilisent o200k_base, un vocabulaire d’environ 200 000 tokens. GPT-4, GPT-3.5 Turbo et les modèles text-embedding-3 utilisent l’ancien cl100k_base, d’environ 100 000. Le vocabulaire plus large contient davantage de mots entiers hors de l’anglais : c’est pourquoi la même phrase en hindi, dans la référence ci-dessous, coûte 26 tokens avec l’un et 66 avec l’autre.
Claude, Gemini et Llama utilisent leurs propres tokenizers ; pour eux, ces comptes sont donc une approximation — utilisez l’endpoint de comptage de tokens du fournisseur quand il vous faut le chiffre exact.
Le pipeline
Comment ça marche.
Quatre étapes déterministes s’exécutent à chaque changement — toutes dans l’onglet de votre navigateur, avec les mêmes tables d’encodage byte-pair qu’OpenAI publie pour tiktoken.
-
Charger le vocabulaire.
La table de fusions de l’encodage choisi est téléchargée une fois depuis ce site et mise en cache par le navigateur ; passer à l’autre encodage charge sa propre table de la même façon.
-
Découper, puis fusionner.
Une expression régulière découpe le texte en mots, nombres, ponctuation et suites d’espaces ; l’encodage byte-pair fusionne ensuite par rang les octets UTF-8 de chaque morceau en identifiants de tokens.
-
Ramener les tokens au texte.
Les identifiants sont décodés dans l’ordre et regroupés pour qu’un caractère qui exige plusieurs tokens — un emoji, un idéogramme CJK — s’affiche comme un seul segment et non comme des octets cassés.
-
Compter et chiffrer.
Tokens, caractères, mots, octets UTF-8 et caractères par token, plus tokens ÷ 1 000 000 × le prix que vous saisissez. Rien ne quitte l’onglet.
Référence des tokens
Deux encodages, une formule de prix.
Des comptes réels issus du même tokenizer que celui du panneau, et l’arithmétique qui transforme un compte en facture — pour que vous puissiez vérifier les deux à la main.
La même phrase, comptée deux fois
En anglais courant, les deux encodages sont d’accord. Plus une écriture s’éloigne de l’anglais, plus le vocabulaire plus large de o200k_base fait économiser.
Same sentence, two encodings (gpt-tokenizer 4.0.0)
English "Kubernetes schedules pods onto nodes that have enough free CPU and memory."
74 chars · 74 bytes o200k_base 14 cl100k_base 14
German "Kubernetes plant Pods auf Knoten mit genug freier CPU und genügend Speicher ein."
80 chars · 81 bytes o200k_base 17 cl100k_base 21
Japanese "Kubernetes は十分な CPU とメモリがあるノードに Pod を配置します。"
43 chars · 87 bytes o200k_base 20 cl100k_base 26
Hindi "Kubernetes पॉड को उन नोड्स पर शेड्यूल करता है जिनमें पर्याप्त CPU और मेमोरी हो।"
79 chars · 183 bytes o200k_base 26 cl100k_base 66 Des tokens au coût
Divisez par un million, multipliez par votre tarif et chiffrez l’entrée et la sortie séparément. Les tarifs ci-dessous sont des chiffres ronds d’exemple, pas la grille tarifaire d’un fournisseur.
cost = tokens ÷ 1,000,000 × price_per_1M_tokens
prompt (input) 1,840 tokens
reply (output) 420 tokens
rates $1.00 / 1M input · $4.00 / 1M output ← illustrative; use your own
input 1,840 ÷ 1,000,000 × 1.00 = $0.00184
output 420 ÷ 1,000,000 × 4.00 = $0.00168
per call = $0.00352
× 50,000 calls a day = $176.00 a day Étape suivante
Vous faites tourner le modèle vous-même ? Dimensionnez ensuite le GPU.
Un long contexte coûte de la mémoire autant que de l’argent. La LLM VRAM Calculator dimensionne les poids, le cache KV pour votre longueur de contexte et la surcharge d’exécution d’un modèle local, et désigne la plus petite carte qui convient.
"Hello, world!" 13 chars → 4 tokens
Hello | , | world | !
o200k_base = 4
cl100k_base = 4 FAQ
Vos questions, nos réponses.
Appuyez sur une question pour afficher la réponse.
Qu'est-ce qu'un token ?
Un token est l'unité avec laquelle un modèle de langage lit et facture : un mot courant, un morceau d'un mot plus long, un signe de ponctuation ou une suite d'espaces. Le tokenizer découpe le texte selon un vocabulaire fixe appris à l'entraînement, si bien que les mots anglais fréquents font en général un token et les mots rares plusieurs. En ordre de grandeur, la prose anglaise tourne autour de quatre caractères par token, c'est pourquoi le compteur affiche les caractères par token à côté du total.
Quelle différence entre o200k_base et cl100k_base, et quels modèles les utilisent ?
Ce sont les deux encodages byte-pair d'OpenAI, nommés d'après leur vocabulaire d'environ 200 000 et 100 000 tokens. En octobre 2026, o200k_base sert à GPT-5, GPT-4.1, GPT-4o et aux modèles de raisonnement de la série o, et cl100k_base à GPT-4, GPT-3.5 Turbo et aux modèles text-embedding-3. Le vocabulaire plus grand demande en général moins de tokens pour le même texte, surtout hors de l'anglais : choisissez l'encodage du modèle auquel vous envoyez.
Pourquoi le décompte diffère-t-il pour Claude, Gemini ou Llama ?
Chaque famille de modèles a son propre tokenizer avec son propre vocabulaire, donc le même texte se découpe en un nombre différent de tokens. Ce compteur n'implémente que les encodages d'OpenAI : pour tout autre modèle, c'est une approximation, utile pour dimensionner un prompt, pas pour la facturation. Pour un chiffre exact, utilisez le point de terminaison de comptage de tokens du fournisseur ou les chiffres d'usage que renvoie son API.
Pourquoi les emoji et le texte chinois, japonais ou coréen coûtent-ils plus de tokens ?
Les encodages byte-pair travaillent sur des octets UTF-8, et le vocabulaire est dominé par le texte fréquent dans les données d'entraînement. Un emoji ou un caractère CJK occupe trois ou quatre octets, et quand cette suite d'octets n'est pas une entrée du vocabulaire, elle se découpe en plusieurs tokens. Voilà pourquoi une courte ligne d'emoji peut coûter plus qu'une phrase anglaise entière, et pourquoi o200k_base, avec son vocabulaire multilingue plus large, compte souvent moins de tokens que cl100k_base sur du texte CJK.
Comment fonctionne le champ « $ par million de tokens » ?
Saisissez le prix que votre fournisseur facture par million de tokens, et le compteur le multiplie par le nombre de tokens pour afficher un coût estimé. Aucun prix n'est intégré, car ils changent souvent et varient selon le modèle, l'offre et la région. Les tokens d'entrée et de sortie sont en général facturés différemment : saisissez le prix d'entrée pour chiffrer un prompt et le prix de sortie pour une réponse de même longueur.
Le code se tokenise-t-il autrement que la prose ?
Oui. Le code est plein de ponctuation, d'opérateurs, de crochets et d'indentation, et chacun tend à former son propre token ou une courte suite, donc le code donne en général moins de caractères par token que la prose anglaise. Les suites d'espaces fusionnent souvent en un seul token, ce qui aide le code indenté, mais les identifiants inhabituels et les longues chaînes littérales se découpent quand même en plusieurs morceaux. Collez un vrai fichier plutôt que d'estimer d'après sa longueur.
Pourquoi ce décompte diffère-t-il de l'usage renvoyé par l'API de chat ?
Le compteur tokenise exactement le texte collé. Une requête de chat completion enveloppe chaque message de tokens de rôle et de séparation, ce qui ajoute quelques tokens par message plus quelques-uns pour la réponse, et les outils ou un prompt système ajoutent les leurs. Attendez-vous à un usage de prompt légèrement supérieur à ce décompte pour un seul message, et plus encore pour une longue conversation.
Mon texte quitte-t-il un jour le navigateur ?
Non. Le compteur de tokens s'exécute à 100 % côté client : le tokenizer est chargé depuis ce site dans la page et votre texte est tokenisé dans l'onglet de votre navigateur. Rien n'est envoyé à un serveur, il n'y a ni compte ni inscription, vous pouvez donc coller sans risque des prompts ou des documents internes.
More free, private DevOps tools.
Le LLM Token Counter est l’un des outils de OpsCanopy — une canopée grandissante de validateurs, convertisseurs et testeurs dans le navigateur qui ne touchent jamais un serveur.
Outils associés
Vous débutez avec AI & local LLMs ? Lire le guide AI & local LLMs →
42 outils gratuits, tous utilisables hors ligne — opscanopy.com fonctionne sans inscription et sans rien téléverser.
Plus pour les charges d’IA : la LLM VRAM Calculator et le Data Size Converter, ou parcourez le répertoire complet des outils.
Les comptes sont exacts pour les modèles OpenAI qui utilisent ces encodages ; le format de chat ajoute quelques tokens par message et les tokenizers des autres fournisseurs diffèrent, alors vérifiez le rapport d’utilisation de votre fournisseur avant de budgéter. OpsCanopy est gratuit et ouvert.