Compteur de tokens pour prompts IA

Collez votre prompt ou votre texte pour obtenir une estimation du nombre de tokens avec une fourchette réaliste. Les valeurs reposent sur des mesures faites avec les tokenizers d’OpenAI pour la langue choisie. Votre texte reste dans le navigateur.

Collez avec Ctrl+V. Le comptage se met à jour en direct pendant la saisie.

Votre texte reste dans votre navigateur : il n’est ni envoyé, ni enregistré, ni ajouté à l’adresse de la page.

À nombre de caractères égal, le français demande environ 11 % de tokens en plus que l’anglais.

Résultat

Tokens estimés
≈ 89
Fourchette habituelle
de 73 à 107 tokens
Caractères
309
Caractères sans espaces
256
Mots
53
Lignes
3
Estimation, pas un comptage exact : chaque modèle d’IA découpe le texte avec son propre tokenizer. La fourchette couvre 80 à 90 % de nos textes de mesure (OpenAI o200k_base et cl100k_base).

Comment le calcul est fait

Les tokens sont les unités dans lesquelles un modèle de langage découpe un texte : mots entiers, fragments de mots, signes de ponctuation ou espaces. La facturation et les limites (fenêtre de contexte, longueur maximale de réponse) se comptent en tokens, pas en caractères.

Règle empirique : environ 4 caractères par token — en anglais

OpenAI indique, à propos de son tokenizer tiktoken, qu’un token correspond en moyenne à environ 4 octets ; Google annonce pour Gemini « environ 4 caractères » par token. Ces deux repères valent pour du texte anglais. Les autres langues demandent plus de tokens, car les tokenizers sont entraînés majoritairement sur du texte anglais et des mots comme « bibliothèque municipale » se découpent en plusieurs morceaux.

D’où viennent ces chiffres

Nous avons mesuré les tokenizers d’OpenAI o200k_base (GPT-4o et modèles plus récents) et cl100k_base (GPT-4, GPT-3.5) sur 39 à 56 textes courants par langue (mesure du 27/09/2026). Caractères par token en moyenne :

L’estimation divise le nombre de caractères par la moyenne des deux tokenizers ; la fourchette utilise les 10e et 90e percentiles des textes individuels. Le code informatique, les tableaux, de nombreux chiffres, les émojis ou les langues à écriture différente (chinois, arabe…) peuvent s’écarter nettement de ces valeurs.

Pourquoi pas un compteur exact ?

Un tokenizer exact devrait charger la table complète des tokens — environ 3,6 Mo pour o200k_base. Ce serait disproportionné pour une page rapide. Claude, Gemini et Llama utilisent en plus leurs propres tokenizers ; seuls les chiffres exacts fournis par chaque fournisseur (par exemple via une interface de comptage de tokens) font foi.

Questions fréquentes

Combien de tokens pour 1 000 mots ?

En anglais, il faut en moyenne 1,4 token par mot (mesuré), soit environ 1 300 à 1 400 tokens. Le français demandant environ 11 % de tokens en plus à nombre de caractères égal, comptez plutôt environ 1,5 à 1,6 token par mot, soit environ 1 500 à 1 600 tokens.

Le comptage est-il exact pour ChatGPT ?

Non, c’est une estimation basée sur des mesures faites avec les tokenizers de ChatGPT. Sur nos textes de mesure, 80 à 90 % des valeurs réelles se situaient dans la fourchette affichée ; l’écart médian de la valeur centrale était de 6 à 12 %.

Est-ce valable aussi pour Claude ou Gemini ?

Grosso modo oui, mais chaque modèle a son propre tokenizer. Google annonce aussi pour Gemini environ 4 caractères par token en anglais. Pour un chiffre exact, seule l’interface du fournisseur concerné fait foi.

Mon texte est-il envoyé quelque part ?

Non. Le comptage se fait uniquement dans votre navigateur ; le texte n’est ni envoyé, ni enregistré, ni écrit dans la barre d’adresse.

Pourquoi les espaces et les retours à la ligne comptent-ils aussi ?

Les tokenizers traitent aussi les espaces : une espace s’accroche en général au mot suivant, plusieurs espaces ou retours à la ligne forment leurs propres tokens. L’estimation part donc de l’ensemble des caractères.

Sources et références juridiques

Dernière mise à jour :

Outils similaires