Licznik tokenów dla promptów AI
Wklej prompt lub tekst, a licznik tokenów pokaże szacowaną liczbę tokenów z realistycznym zakresem. Wartości opierają się na pomiarach tokenizerami OpenAI dla wybranego języka tekstu. Tekst zostaje w przeglądarce.
Jak to obliczamy
Tokeny to jednostki, na które model językowy dzieli tekst – całe słowa, części słów, znaki interpunkcyjne lub spacje. Opłaty i limity (okno kontekstu, maksymalna długość odpowiedzi) liczone są w tokenach, a nie w znakach.
Jak policzyć tokeny
- Wklej prompt lub tekst do pola.
- Wybierz język tekstu – teksty po polsku czy turecku potrzebują wyraźnie więcej tokenów niż angielskie.
- Odczytaj szacowaną liczbę tokenów z zakresem oraz liczbę znaków i słów.
Przykład: polski tekst o długości 2000 znaków to przy średnio 2,72 znaku na token około 2000 / 2,72 ≈ 735 tokenów. Angielski tekst tej samej długości (3,89 znaku na token) to około 2000 / 3,89 ≈ 514 tokenów.
Reguła kciuka: około 4 znaki na token – ale po angielsku
OpenAI podaje, że jego tokenizer tiktoken ma średnio około 4 bajty na token; Google podaje dla Gemini „około 4 znaki” na token. Obie wartości dotyczą tekstu angielskiego. Inne języki potrzebują więcej tokenów, bo tokenizery uczono głównie na tekstach angielskich, a długie słowa z odmianą i polskimi znakami (np. „przewodnikami”) rozpadają się na kilka części.
Skąd pochodzą liczby
Zmierzyliśmy tokenizery OpenAI o200k_base (GPT-4o i nowsze) oraz cl100k_base (GPT-4, GPT-3.5) na 39–56 tekstach na język (stan: 27 września 2026), a dla polskiego i tureckiego na 139 i 128 tekstach (28 września 2026). Średnio znaków na token:
- angielski: 3,9 (zakres 3,3–4,5)
- niemiecki: 3,6 z o200k, 3,1 z cl100k (zakres 2,7–4,2)
- francuski: 3,7 i 3,3 (zakres 2,9–4,2)
- hiszpański: 3,7 i 3,3 (zakres 2,9–4,2)
- portugalski: 3,7 i 3,2 (zakres 2,7–4,2)
- polski: 2,9 i 2,6 (zakres 2,4–3,1)
- turecki: 3,0 i 2,4 (zakres 2,3–3,3)
Szacunek dzieli liczbę znaków przez średnią obu tokenizerów; zakres wynika z 10. i 90. percentyla pojedynczych tekstów. Kod programu, tabele, dużo liczb, emoji lub języki z innym pismem (chiński, arabski…) mogą się wyraźnie różnić.
Dlaczego nie dokładny licznik?
Dokładny tokenizer musiałby wczytać całą tabelę tokenów – dla o200k_base to około 3,6 MB. To nieproporcjonalnie dużo jak na szybką stronę. Poza tym Claude, Gemini i Llama używają własnych tokenizerów; dokładne liczby poda tylko dany dostawca (np. przez interfejs do liczenia tokenów).
Najczęściej zadawane pytania
Ile tokenów ma 1000 słów?
Po angielsku około 1300–1400 tokenów (zmierzona średnia: 1,4 tokenu na słowo). Po polsku jest ich wyraźnie więcej: na ten sam znak przypada około 40% więcej tokenów niż po angielsku, a polskie słowa są zwykle dłuższe. Najpewniej wkleisz tekst i odczytasz wynik.
Czy wynik jest dokładny dla ChatGPT?
Nie, to szacunek oparty na pomiarach tokenizerami ChatGPT. W naszych tekstach testowych 80–90% rzeczywistych wartości mieściło się w pokazanym zakresie; środek zakresu odbiegał w medianie o 6–12%.
Czy działa też dla Claude lub Gemini?
W przybliżeniu tak, ale każdy model ma własny tokenizer. Google również podaje dla Gemini około 4 znaki na token w tekście angielskim. Dokładne liczby dają tylko interfejsy dostawców, np. punkty końcowe do liczenia tokenów OpenAI, Claude lub Gemini.
Czy mój tekst jest gdzieś wysyłany?
Nie. Liczenie odbywa się wyłącznie w przeglądarce; tekst nie jest wysyłany, zapisywany ani dopisywany do paska adresu.
Dlaczego liczone są też spacje i znaki nowego wiersza?
Tokenizery przetwarzają również białe znaki: spacja zwykle dołączana jest do następnego słowa, a kilka spacji lub znaki nowego wiersza tworzą osobne tokeny. Dlatego szacunek opiera się na wszystkich znakach.
Co to jest token?
Token to fragment tekstu, który przetwarza model AI, taki jak ChatGPT – często część słowa. Częste angielskie słowa to zwykle jeden token, a długie lub rzadkie słowa dzielone są na kilka.
Dlaczego polski tekst ma więcej tokenów niż angielski?
Tokenizery budowano głównie na tekstach angielskich, więc polskie słowa z końcówkami odmiany i znakami ą, ę, ł, ś, ż częściej dzielą się na więcej części. W naszych pomiarach polski miał średnio 2,72 znaku na token, angielski 3,89.
Źródła i podstawa prawna
- OpenAI tiktoken (MIT) – “each token corresponds to about 4 bytes”; o200k_base / cl100k_base used for the measurement
- Google AI for Developers – Understand and count tokens (“about 4 characters”)
- Anthropic – Token counting (exact counts via the Claude API)
Stan na:
Podobne narzędzia
- Licznik znaków i licznik słówLicznik znaków online: policz znaki ze spacjami i bez, słowa, zdania, akapity i czas czytania – na żywo, z limitami X, Instagrama, TikToka i SMS.
- Generator hasełGenerator haseł online: twórz silne, losowe hasła i łatwe do zapamiętania frazy z wyrazów, z entropią w bitach – wszystko w przeglądarce, nic nie jest wysyłane.
- Sprawdzanie siły hasłaSprawdzanie siły hasła: czy moje hasło jest silne? Entropia w bitach, słabe wzorce i czas złamania – lokalnie w przeglądarce, hasło nie jest nigdzie wysyłane.
- Czcionki do skopiowaniaZamień tekst na pogrubiony, kursywę, pismo odręczne, gotyk i ponad 20 innych czcionek do skopiowania na Instagram, TikTok lub Discord – z uwagą o dostępności.
- Czytanie tekstu na głos: tekst na mowęCzytanie tekstu na głos online za darmo: wybierz głos, ustaw tempo i wysokość, śledź czytane słowa, wstrzymaj i zatrzymaj. Bez rejestracji, głosy lokalne.
- Generator Lorem IpsumDarmowy generator lorem ipsum: akapity, zdania lub dokładna liczba słów, początek „Lorem ipsum dolor sit amet”, opcjonalnie znaczniki HTML i kopiowanie.