Compteur de tokens pour prompts IA
Collez votre prompt ou votre texte pour obtenir une estimation du nombre de tokens avec une fourchette réaliste. Les valeurs reposent sur des mesures faites avec les tokenizers d’OpenAI pour la langue choisie. Votre texte reste dans le navigateur.
Comment le calcul est fait
Les tokens sont les unités dans lesquelles un modèle de langage découpe un texte : mots entiers, fragments de mots, signes de ponctuation ou espaces. La facturation et les limites (fenêtre de contexte, longueur maximale de réponse) se comptent en tokens, pas en caractères.
Règle empirique : environ 4 caractères par token — en anglais
OpenAI indique, à propos de son tokenizer tiktoken, qu’un token correspond en moyenne à environ 4 octets ; Google annonce pour Gemini « environ 4 caractères » par token. Ces deux repères valent pour du texte anglais. Les autres langues demandent plus de tokens, car les tokenizers sont entraînés majoritairement sur du texte anglais et des mots comme « bibliothèque municipale » se découpent en plusieurs morceaux.
D’où viennent ces chiffres
Nous avons mesuré les tokenizers d’OpenAI o200k_base (GPT-4o et modèles plus récents) et cl100k_base (GPT-4, GPT-3.5) sur 39 à 56 textes courants par langue (mesure du 27/09/2026). Caractères par token en moyenne :
- Anglais : 3,9 (fourchette 3,3–4,5)
- Allemand : 3,6 avec o200k, 3,1 avec cl100k (fourchette 2,7–4,2)
- Français : 3,7 avec o200k, 3,3 avec cl100k (fourchette 2,9–4,2)
- Espagnol : 3,7 avec o200k, 3,3 avec cl100k (fourchette 2,9–4,2)
- Portugais : 3,7 avec o200k, 3,2 avec cl100k (fourchette 2,7–4,2)
L’estimation divise le nombre de caractères par la moyenne des deux tokenizers ; la fourchette utilise les 10e et 90e percentiles des textes individuels. Le code informatique, les tableaux, de nombreux chiffres, les émojis ou les langues à écriture différente (chinois, arabe…) peuvent s’écarter nettement de ces valeurs.
Pourquoi pas un compteur exact ?
Un tokenizer exact devrait charger la table complète des tokens — environ 3,6 Mo pour o200k_base. Ce serait disproportionné pour une page rapide. Claude, Gemini et Llama utilisent en plus leurs propres tokenizers ; seuls les chiffres exacts fournis par chaque fournisseur (par exemple via une interface de comptage de tokens) font foi.
Questions fréquentes
Combien de tokens pour 1 000 mots ?
En anglais, il faut en moyenne 1,4 token par mot (mesuré), soit environ 1 300 à 1 400 tokens. Le français demandant environ 11 % de tokens en plus à nombre de caractères égal, comptez plutôt environ 1,5 à 1,6 token par mot, soit environ 1 500 à 1 600 tokens.
Le comptage est-il exact pour ChatGPT ?
Non, c’est une estimation basée sur des mesures faites avec les tokenizers de ChatGPT. Sur nos textes de mesure, 80 à 90 % des valeurs réelles se situaient dans la fourchette affichée ; l’écart médian de la valeur centrale était de 6 à 12 %.
Est-ce valable aussi pour Claude ou Gemini ?
Grosso modo oui, mais chaque modèle a son propre tokenizer. Google annonce aussi pour Gemini environ 4 caractères par token en anglais. Pour un chiffre exact, seule l’interface du fournisseur concerné fait foi.
Mon texte est-il envoyé quelque part ?
Non. Le comptage se fait uniquement dans votre navigateur ; le texte n’est ni envoyé, ni enregistré, ni écrit dans la barre d’adresse.
Pourquoi les espaces et les retours à la ligne comptent-ils aussi ?
Les tokenizers traitent aussi les espaces : une espace s’accroche en général au mot suivant, plusieurs espaces ou retours à la ligne forment leurs propres tokens. L’estimation part donc de l’ensemble des caractères.
Sources et références juridiques
- OpenAI tiktoken (MIT) – “each token corresponds to about 4 bytes”; o200k_base / cl100k_base used for the measurement
- Google AI for Developers – Understand and count tokens (“about 4 characters”)
- Anthropic – Token counting (exact counts via the Claude API)
Dernière mise à jour :
Outils similaires
- Compteur de mots et de caractèresComptez les caractères avec et sans espaces, les mots, les phrases et le temps de lecture – en direct, avec les limites de X, Instagram, TikTok, LinkedIn, SMS.
- Générateur de mot de passeGénérez un mot de passe aléatoire et sécurisé ou une phrase de passe facile à retenir, avec son entropie en bits, calculé dans votre navigateur.
- Tester la robustesse de votre mot de passeVotre mot de passe est-il sûr ? Testez sa robustesse : entropie en bits et temps de piratage estimés dans votre navigateur, sans envoi ni conservation.
- Comparer deux textes : trouver les différencesComparez deux textes en ligne : différences surlignées par ligne, mot ou caractère, avec un taux de similarité. Gratuit, sans envoi, dans le navigateur.
- Compteur de hashtags et mise en forme de légende InstagramComptez les hashtags et mentions @, repérez les doublons et mettez en forme votre légende Instagram : hashtags à la fin, paragraphes conservés.
- Générateur Lorem ipsum (faux texte)Générateur de Lorem ipsum gratuit : paragraphes, phrases ou nombre de mots exact, début « Lorem ipsum dolor sit amet », balises HTML de paragraphe, à copier.