Contador de Tokens para Prompts de IA

Cole seu prompt ou texto e veja uma estimativa do número de tokens com uma faixa realista. Os valores vêm de medições com tokenizadores da OpenAI para o idioma escolhido. Seu texto fica só no navegador.

Cole com Ctrl+V. A contagem acontece ao vivo, enquanto você digita.

Seu texto fica no seu navegador: não é enviado, não é salvo e não aparece no endereço da página.

Com o mesmo número de caracteres, o português precisa de cerca de 13% mais tokens que o inglês.

Resultado

Tokens estimados
≈ 79
Faixa usual
65 a 99 tokens
Caracteres
272
Caracteres sem espaços
225
Palavras
47
Linhas
3
Estimativa, não uma contagem exata: cada modelo de IA separa o texto com seu próprio tokenizador. A faixa cobriu 80–90% dos nossos textos de teste (OpenAI o200k_base e cl100k_base).

Como o cálculo é feito

Tokens são as unidades em que um modelo de linguagem separa o texto – palavras inteiras, pedaços de palavras, pontuação ou espaços. É em tokens, não em caracteres, que o uso é cobrado e limitado (janela de contexto, tamanho máximo da resposta).

Regra prática: cerca de 4 caracteres por token – em inglês

A OpenAI diz, sobre seu tokenizador tiktoken, que um token equivale em média a cerca de 4 bytes; o Google fala em "cerca de 4 caracteres" por token para o Gemini. Isso vale para texto em inglês. Outros idiomas precisam de mais tokens, porque os tokenizadores foram treinados majoritariamente com texto em inglês, e palavras como "Stadtbibliothek" (alemão para "biblioteca municipal") se dividem em vários pedaços.

De onde vêm os números

Medimos os tokenizadores da OpenAI o200k_base (GPT-4o e modelos mais novos) e cl100k_base (GPT-4, GPT-3.5) em 39 a 56 textos corridos por idioma (dados de 27/09/2026). Caracteres por token, em média:

A estimativa divide o número de caracteres pela média dos dois tokenizadores; a faixa usa o percentil 10 e o percentil 90 dos textos individuais. Código-fonte, tabelas, muitos números, emojis ou idiomas com outras escritas (chinês, árabe…) podem se afastar bastante desses valores.

Por que não um contador exato?

Um tokenizador exato precisaria carregar a tabela completa de tokens – no caso do o200k_base, cerca de 3,6 MB. Isso seria desproporcional para uma página rápida. Além disso, Claude, Gemini e Llama usam tokenizadores próprios; números exatos só vêm da interface do respectivo provedor (por exemplo, um endpoint de contagem de tokens).

Perguntas frequentes

Quantos tokens têm 1.000 palavras?

Em inglês, cerca de 1.300–1.400 tokens (medido: em média 1,4 token por palavra). Outros idiomas precisam de mais: como cada token cobre menos caracteres (por exemplo 3,2–3,7 no português, contra 3,9 no inglês), o mesmo texto gera mais tokens.

A contagem é exata para o ChatGPT?

Não, é uma estimativa baseada em medições com os tokenizadores do ChatGPT. Nos nossos textos de teste, 80–90% dos valores reais ficaram dentro da faixa exibida; o valor central se desviou 6–12% na mediana.

Vale também para Claude ou Gemini?

Em termos gerais, sim, mas cada modelo tem seu próprio tokenizador. O Google também fala em cerca de 4 caracteres por token para o Gemini em inglês. Números exatos só vêm da interface do respectivo provedor.

Meu texto é enviado para algum servidor?

Não. A contagem acontece só no seu navegador; o texto não é enviado, não é salvo e não aparece na barra de endereço.

Por que espaços e quebras de linha também contam?

Tokenizadores também processam espaços em branco: um espaço costuma ficar grudado na palavra seguinte, e vários espaços ou quebras de linha viram tokens próprios. Por isso a estimativa parte de todos os caracteres.

Fontes e base legal

Última atualização:

Ferramentas relacionadas