Penghitung token AI untuk prompt

Tempel prompt atau teks Anda, dan penghitung token menampilkan perkiraan jumlah token beserta rentang yang realistis. Angkanya berasal dari pengukuran dengan tokenizer OpenAI untuk bahasa teks yang dipilih. Teks Anda tetap di browser.

Tempel dengan Ctrl+V. Penghitungan berjalan langsung saat Anda mengetik.

Teks Anda tetap di browser Anda – tidak dikirim, tidak disimpan, dan tidak ditambahkan ke bilah alamat.

Teks bahasa Indonesia memerlukan sekitar 20% lebih banyak token daripada teks bahasa Inggris dengan jumlah karakter yang sama.
Input Anda hanya disimpan di browser ini.

Hasil

Perkiraan token
≈ 86
Rentang umum
72 hingga 105 token
Karakter
281
Karakter tanpa spasi
241
Kata
40
Baris
3
Ini perkiraan, bukan hitungan pasti: setiap model AI memecah teks dengan tokenizer-nya sendiri. Rentang ini mencakup 80–90% teks uji kami (OpenAI o200k_base dan cl100k_base).

Cara menghitung

Token adalah satuan yang dipakai model bahasa untuk memecah teks – kata utuh, potongan kata, tanda baca, atau spasi. Biaya dan batas (jendela konteks, panjang jawaban maksimum) dihitung dalam token, bukan karakter.

Cara menghitung token

  1. Tempel prompt atau teks Anda ke dalam kotak.
  2. Pilih bahasa teks – teks bahasa Indonesia, Turki, atau Jepang memerlukan lebih banyak token daripada teks bahasa Inggris.
  3. Baca perkiraan jumlah token beserta rentangnya, jumlah karakter, dan jumlah kata.

Contoh: teks bahasa Indonesia sepanjang 2.000 karakter, dengan rata-rata 3,28 karakter per token, menjadi sekitar 2.000 / 3,28 ≈ 610 token. Teks bahasa Inggris dengan panjang yang sama (3,89 karakter per token) sekitar 2.000 / 3,89 ≈ 514 token.

Patokan: sekitar 4 karakter per token – tetapi untuk bahasa Inggris

OpenAI menyebut tokenizer tiktoken rata-rata sekitar 4 byte per token, dan Google menyebut sekitar 4 karakter per token untuk Gemini. Kedua angka itu berlaku untuk teks bahasa Inggris. Bahasa lain memerlukan lebih banyak token, karena tokenizer terutama dilatih dengan teks bahasa Inggris. Kata berimbuhan yang panjang seperti “memperkenalkannya” atau “ketidakseimbangan” sering dipecah menjadi beberapa bagian.

Dari mana angkanya?

Tokenizer OpenAI o200k_base (GPT-4o dan yang lebih baru) dan cl100k_base (GPT-4, GPT-3.5) diukur dengan 36–139 teks per bahasa (bahasa Indonesia: 36 teks, 28 September 2026). Rata-rata karakter per token:

Perkiraan membagi jumlah karakter dengan rata-rata kedua tokenizer; rentangnya berasal dari persentil ke-10 dan ke-90 masing-masing teks. Kode program, tabel, banyak angka, emoji, atau aksara lain bisa menyimpang cukup jauh.

Mengapa bukan penghitung yang pasti?

Tokenizer yang pasti harus memuat seluruh tabel token – untuk o200k_base sekitar 3,6 MB. Untuk halaman yang cepat, itu terlalu besar. Selain itu, Claude, Gemini, dan Llama memakai tokenizer sendiri; jumlah pastinya hanya bisa diberikan oleh penyedia masing-masing (misalnya lewat API penghitung token).

Pertanyaan umum

Apa itu token dalam AI?

Token adalah potongan teks yang diproses model AI seperti ChatGPT – sering kali sebagian dari sebuah kata. Kata bahasa Inggris yang umum biasanya satu token; kata yang panjang atau jarang dipecah menjadi beberapa bagian.

1.000 kata berapa token?

Dalam bahasa Inggris sekitar 1.300–1.400 token. Bahasa Indonesia memerlukan lebih banyak: untuk jumlah karakter yang sama sekitar 20% lebih banyak token, dan kata berimbuhan cenderung panjang. Cara paling pasti adalah menempel teks dan membaca hasilnya.

Apakah hasilnya tepat untuk ChatGPT?

Tidak, ini perkiraan berdasarkan pengukuran dengan tokenizer ChatGPT. Pada teks uji kami, 80–90% nilai sebenarnya berada dalam rentang yang ditampilkan.

Apakah bisa dipakai untuk Claude atau Gemini?

Sebagai perkiraan kasar, ya, tetapi setiap model punya tokenizer sendiri. Google juga menyebut sekitar 4 karakter per token untuk Gemini dalam bahasa Inggris. Angka pasti hanya didapat dari API penyedia, misalnya fitur penghitung token OpenAI, Claude, atau Gemini.

Mengapa bahasa Indonesia memakai lebih banyak token daripada bahasa Inggris?

Tokenizer terutama dibangun dari teks bahasa Inggris. Kata bahasa Indonesia, terutama yang berimbuhan, lebih sering dipecah menjadi beberapa bagian. Dalam pengukuran kami, bahasa Indonesia rata-rata 3,28 karakter per token, bahasa Inggris 3,89.

Apakah teks saya diunggah?

Tidak. Penghitungan hanya berjalan di browser Anda; teks tidak dikirim, tidak disimpan, dan tidak masuk ke URL.

Mengapa spasi dan baris baru ikut dihitung?

Tokenizer juga memproses spasi: spasi biasanya menempel pada kata berikutnya, sedangkan spasi ganda atau baris baru menjadi token tersendiri. Karena itu perkiraan didasarkan pada semua karakter.

Sumber dan dasar hukum

Diperbarui:

Alat terkait