Penghitung token AI untuk prompt
Tempel prompt atau teks Anda, dan penghitung token menampilkan perkiraan jumlah token beserta rentang yang realistis. Angkanya berasal dari pengukuran dengan tokenizer OpenAI untuk bahasa teks yang dipilih. Teks Anda tetap di browser.
Cara menghitung
Token adalah satuan yang dipakai model bahasa untuk memecah teks – kata utuh, potongan kata, tanda baca, atau spasi. Biaya dan batas (jendela konteks, panjang jawaban maksimum) dihitung dalam token, bukan karakter.
Cara menghitung token
- Tempel prompt atau teks Anda ke dalam kotak.
- Pilih bahasa teks – teks bahasa Indonesia, Turki, atau Jepang memerlukan lebih banyak token daripada teks bahasa Inggris.
- Baca perkiraan jumlah token beserta rentangnya, jumlah karakter, dan jumlah kata.
Contoh: teks bahasa Indonesia sepanjang 2.000 karakter, dengan rata-rata 3,28 karakter per token, menjadi sekitar 2.000 / 3,28 ≈ 610 token. Teks bahasa Inggris dengan panjang yang sama (3,89 karakter per token) sekitar 2.000 / 3,89 ≈ 514 token.
Patokan: sekitar 4 karakter per token – tetapi untuk bahasa Inggris
OpenAI menyebut tokenizer tiktoken rata-rata sekitar 4 byte per token, dan Google menyebut sekitar 4 karakter per token untuk Gemini. Kedua angka itu berlaku untuk teks bahasa Inggris. Bahasa lain memerlukan lebih banyak token, karena tokenizer terutama dilatih dengan teks bahasa Inggris. Kata berimbuhan yang panjang seperti “memperkenalkannya” atau “ketidakseimbangan” sering dipecah menjadi beberapa bagian.
Dari mana angkanya?
Tokenizer OpenAI o200k_base (GPT-4o dan yang lebih baru) dan cl100k_base (GPT-4, GPT-3.5) diukur dengan 36–139 teks per bahasa (bahasa Indonesia: 36 teks, 28 September 2026). Rata-rata karakter per token:
- Indonesia: 3,6 dengan o200k dan 3,0 dengan cl100k (rentang 2,7–3,9)
- Inggris: 3,9 (rentang 3,3–4,5)
- Jerman: 3,6 dan 3,1 (rentang 2,7–4,2)
- Prancis dan Spanyol: 3,7 dan 3,3 (rentang 2,9–4,2)
- Turki: 3,0 dan 2,4 (rentang 2,3–3,3)
- Jepang: 1,4 dan 1,1 (rentang 1,0–1,5)
Perkiraan membagi jumlah karakter dengan rata-rata kedua tokenizer; rentangnya berasal dari persentil ke-10 dan ke-90 masing-masing teks. Kode program, tabel, banyak angka, emoji, atau aksara lain bisa menyimpang cukup jauh.
Mengapa bukan penghitung yang pasti?
Tokenizer yang pasti harus memuat seluruh tabel token – untuk o200k_base sekitar 3,6 MB. Untuk halaman yang cepat, itu terlalu besar. Selain itu, Claude, Gemini, dan Llama memakai tokenizer sendiri; jumlah pastinya hanya bisa diberikan oleh penyedia masing-masing (misalnya lewat API penghitung token).
Pertanyaan umum
Apa itu token dalam AI?
Token adalah potongan teks yang diproses model AI seperti ChatGPT – sering kali sebagian dari sebuah kata. Kata bahasa Inggris yang umum biasanya satu token; kata yang panjang atau jarang dipecah menjadi beberapa bagian.
1.000 kata berapa token?
Dalam bahasa Inggris sekitar 1.300–1.400 token. Bahasa Indonesia memerlukan lebih banyak: untuk jumlah karakter yang sama sekitar 20% lebih banyak token, dan kata berimbuhan cenderung panjang. Cara paling pasti adalah menempel teks dan membaca hasilnya.
Apakah hasilnya tepat untuk ChatGPT?
Tidak, ini perkiraan berdasarkan pengukuran dengan tokenizer ChatGPT. Pada teks uji kami, 80–90% nilai sebenarnya berada dalam rentang yang ditampilkan.
Apakah bisa dipakai untuk Claude atau Gemini?
Sebagai perkiraan kasar, ya, tetapi setiap model punya tokenizer sendiri. Google juga menyebut sekitar 4 karakter per token untuk Gemini dalam bahasa Inggris. Angka pasti hanya didapat dari API penyedia, misalnya fitur penghitung token OpenAI, Claude, atau Gemini.
Mengapa bahasa Indonesia memakai lebih banyak token daripada bahasa Inggris?
Tokenizer terutama dibangun dari teks bahasa Inggris. Kata bahasa Indonesia, terutama yang berimbuhan, lebih sering dipecah menjadi beberapa bagian. Dalam pengukuran kami, bahasa Indonesia rata-rata 3,28 karakter per token, bahasa Inggris 3,89.
Apakah teks saya diunggah?
Tidak. Penghitungan hanya berjalan di browser Anda; teks tidak dikirim, tidak disimpan, dan tidak masuk ke URL.
Mengapa spasi dan baris baru ikut dihitung?
Tokenizer juga memproses spasi: spasi biasanya menempel pada kata berikutnya, sedangkan spasi ganda atau baris baru menjadi token tersendiri. Karena itu perkiraan didasarkan pada semua karakter.
Sumber dan dasar hukum
- OpenAI tiktoken (MIT) – “each token corresponds to about 4 bytes”; o200k_base / cl100k_base used for the measurement
- Google AI for Developers – Understand and count tokens (“about 4 characters”)
- Anthropic – Token counting (exact counts via the Claude API)
Diperbarui:
Alat terkait
- Hitung Karakter dan KataHitung karakter online dengan dan tanpa spasi, jumlah kata, kalimat, paragraf, dan waktu baca secara langsung – dengan batas X, Instagram, TikTok, dan SMS.
- Generator passwordBuat password acak yang kuat dan passphrase yang mudah diingat, lengkap dengan entropi dalam bit – dihitung di browser Anda, tidak dikirim dan tidak disimpan.
- Cek Kekuatan PasswordSeberapa aman password Anda? Cek kekuatan password online, entropi dalam bit, dan waktu untuk membobolnya – langsung di peramban, tidak dikirim atau disimpan.
- Bandingkan teks: cek perbedaan dua teksBandingkan dua teks online: tandai perbedaan per baris, kata, atau karakter dan lihat persentase kemiripannya. Gratis, privat, berjalan di browser Anda.
- Font keren copy pasteUbah teks menjadi font keren: tebal, miring, tulisan sambung, gotik dan 20+ tulisan aesthetic lain untuk di-copy paste ke bio Instagram, TikTok atau WA.
- Ubah gambar ke teksUbah gambar ke teks gratis: salin tulisan dari foto, hasil pindaian, dan tangkapan layar. OCR online untuk bahasa Indonesia dan 10 bahasa lain, tanpa unggah.