Outil en ligne

Compteur de tokens

Combien de tokens coûte votre texte ? Exactement pour GPT — le seul éditeur à publier son tokeniseur — et en fourchette honnête pour les autres. Tout est calculé dans votre navigateur : votre texte n'est envoyé nulle part.

Tokens
0
Mots
0
Caractères

Les quatre modèles côte à côte

ModèleTokensFiabilité

Un même texte ne coûte pas le même nombre de tokens partout. En français l'écart est plus marqué qu'en anglais : les tokeniseurs ont été entraînés majoritairement sur de l'anglais, et nos accents comme nos mots longs s'y découpent moins bien.

Comment le texte se découpe

D'où viennent ces chiffres

GPT — exact, tant que le vocabulaire ne change pas
OpenAI publie son tokeniseur. La page embarque o200k_base, ses 199 998 entrées vérifiées une à une contre le fichier de référence. Le découpage et les identifiants affichés sont ceux que le modèle voit réellement.

La correspondance a été vérifiée dans le paquet de référence pour GPT-4o et GPT-5, qui partagent cette même table. Pour les révisions ultérieures, OpenAI n'a pas publié d'autre vocabulaire : le compte vaut donc aussi, aussi longtemps que cela reste vrai. Si un jour la table change sans que la page suive, le compte deviendra faux sans le dire — c'est la limite de la seule ligne exacte des quatre.
Claude — estimation
Anthropic ne publie pas le tokeniseur de ses modèles actuels. Son paquet @anthropic-ai/tokenizer date de juillet 2023 et porte l'avertissement de l'éditeur lui-même : « à partir des modèles Claude 3, cet algorithme n'est plus exact ». Claude en est deux générations plus loin. La documentation Anthropic ajoute qu'un tokeniseur GPT sous-compte Claude de 15 à 20 % sur du texte courant, et davantage sur du code ou du non-anglais — donc sur du français. L'estimation affichée applique cet écart au compte exact GPT : centre à ×1,25, marge de ±8 %, ce qui couvre bien de ×1,15 à ×1,35. Le compte exact s'obtient par l'API count_tokens, ou dans le champ usage de toute réponse.
Gemini — règle officielle de Google
Google ne publie pas de tokeniseur hors ligne, mais donne sa propre règle : « a token is equivalent to about 4 characters », et 100 tokens pour 60 à 80 mots anglais. L'estimation affichée applique cette règle à votre nombre de caractères — elle ne dérive pas du compte GPT. Le « about » de Google justifie la marge de ±10 %. Attention : la règle est énoncée sur de l'anglais. Le français y échappe probablement vers le haut, Google ne le chiffre pas. Le compte exact s'obtient par countTokens.
Mistral — ordre de grandeur, sans source d'éditeur
Mistral ne publie ni tokeniseur hors ligne ni règle de conversion. Les paquets qui circulent sont périmés : mistral-tokenizer-js date de 2023, avant le passage de Mistral à tekken. L'estimation est dérivée du compte GPT — centre à ×1,15, marge de ±9 % — et c'est la moins fiable des quatre lignes.
Ce que coûtent les autres médias — barèmes Gemini
Le texte n'est pas seul à consommer des tokens. Les valeurs publiées par Google pour Gemini, utiles à retenir en formation : une image d'au plus 384 px sur ses deux côtés vaut 258 tokens — au-delà elle est découpée en tuiles de 768 × 768, à 258 tokens chacune ; la vidéo vaut 263 tokens par seconde, soit environ 15 800 pour une minute ; l'audio vaut 32 tokens par seconde, soit 1 920 pour une minute. Une minute de vidéo coûte donc plus cher qu'un long rapport.
Ce qui a été retiré de la version précédente
L'ancienne page affichait des « identifiants de tokens » calculés par hachage du texte, sans le dire. Pour GPT, ils sont désormais les vrais — ceux du vocabulaire o200k_base. Pour les trois autres, aucun éditeur ne publie son vocabulaire : les nombres affichés restent fabriqués ici, dans la plage d'un vocabulaire plausible, et l'écran l'annonce à chaque fois. Ils servent à voir la forme de ce que reçoit un modèle, pas à la connaître.