Outil en ligne
Compteur de tokens
Combien de tokens coûte votre texte ? Exactement pour GPT — le seul éditeur à publier son tokeniseur — et en fourchette honnête pour les autres. Tout est calculé dans votre navigateur : votre texte n'est envoyé nulle part.
—
Tokens
0
Mots
0
Caractères
Les quatre modèles côte à côte
| Modèle | Tokens | Fiabilité |
|---|
Un même texte ne coûte pas le même nombre de tokens partout. En français l'écart est plus marqué qu'en anglais : les tokeniseurs ont été entraînés majoritairement sur de l'anglais, et nos accents comme nos mots longs s'y découpent moins bien.
Comment le texte se découpe
D'où viennent ces chiffres
- GPT — exact, tant que le vocabulaire ne change pas
-
OpenAI publie son tokeniseur. La page embarque
o200k_base, ses 199 998 entrées vérifiées une à une contre le fichier de référence. Le découpage et les identifiants affichés sont ceux que le modèle voit réellement.
La correspondance a été vérifiée dans le paquet de référence pour GPT-4o et GPT-5, qui partagent cette même table. Pour les révisions ultérieures, OpenAI n'a pas publié d'autre vocabulaire : le compte vaut donc aussi, aussi longtemps que cela reste vrai. Si un jour la table change sans que la page suive, le compte deviendra faux sans le dire — c'est la limite de la seule ligne exacte des quatre. - Claude — estimation
-
Anthropic ne publie pas le tokeniseur de ses modèles actuels. Son
paquet
@anthropic-ai/tokenizerdate de juillet 2023 et porte l'avertissement de l'éditeur lui-même : « à partir des modèles Claude 3, cet algorithme n'est plus exact ». Claude en est deux générations plus loin. La documentation Anthropic ajoute qu'un tokeniseur GPT sous-compte Claude de 15 à 20 % sur du texte courant, et davantage sur du code ou du non-anglais — donc sur du français. L'estimation affichée applique cet écart au compte exact GPT : centre à ×1,25, marge de ±8 %, ce qui couvre bien de ×1,15 à ×1,35. Le compte exact s'obtient par l'APIcount_tokens, ou dans le champusagede toute réponse. - Gemini — règle officielle de Google
-
Google ne publie pas de tokeniseur hors ligne, mais donne sa propre
règle : « a token is equivalent to about 4 characters », et
100 tokens pour 60 à 80 mots anglais. L'estimation affichée
applique cette règle à votre nombre de caractères — elle ne dérive
pas du compte GPT. Le « about » de Google justifie la marge de
±10 %. Attention : la règle est énoncée sur de
l'anglais. Le français y échappe probablement vers le haut, Google
ne le chiffre pas. Le compte exact s'obtient par
countTokens. - Mistral — ordre de grandeur, sans source d'éditeur
-
Mistral ne publie ni tokeniseur hors ligne ni règle de conversion.
Les paquets qui circulent sont périmés :
mistral-tokenizer-jsdate de 2023, avant le passage de Mistral à tekken. L'estimation est dérivée du compte GPT — centre à ×1,15, marge de ±9 % — et c'est la moins fiable des quatre lignes. - Ce que coûtent les autres médias — barèmes Gemini
- Le texte n'est pas seul à consommer des tokens. Les valeurs publiées par Google pour Gemini, utiles à retenir en formation : une image d'au plus 384 px sur ses deux côtés vaut 258 tokens — au-delà elle est découpée en tuiles de 768 × 768, à 258 tokens chacune ; la vidéo vaut 263 tokens par seconde, soit environ 15 800 pour une minute ; l'audio vaut 32 tokens par seconde, soit 1 920 pour une minute. Une minute de vidéo coûte donc plus cher qu'un long rapport.
- Ce qui a été retiré de la version précédente
-
L'ancienne page affichait des « identifiants de tokens » calculés
par hachage du texte, sans le dire. Pour GPT, ils sont désormais
les vrais — ceux du vocabulaire
o200k_base. Pour les trois autres, aucun éditeur ne publie son vocabulaire : les nombres affichés restent fabriqués ici, dans la plage d'un vocabulaire plausible, et l'écran l'annonce à chaque fois. Ils servent à voir la forme de ce que reçoit un modèle, pas à la connaître.