AIプロンプトのトークン数計算
プロンプトや文章を貼り付けると、トークン数の目安を現実的な幅つきで表示します。値は、選んだ言語の文章をOpenAIのトークナイザーで実測した結果にもとづいています。入力した文章はブラウザの外に送信されません。
計算方法
トークンとは、言語モデルが文章を区切って扱う単位です。単語、単語の一部、1文字、記号、空白などがトークンになります。料金や上限(コンテキストウィンドウ、最大出力)は文字数ではなくトークン数で決まります。
トークン数の数え方
- プロンプトや文章を入力欄に貼り付けます。
- 文章の言語を選びます。日本語は英語よりも大幅に多くのトークンを使います。
- 推定トークン数と幅、文字数を確認します。
例:2,000文字の日本語の文章は、1トークンあたり平均1.24文字として 2,000 ÷ 1.24 ≈ 1,613トークンです。同じ2,000文字の英文(1トークンあたり3.89文字)なら約514トークンなので、日本語は約3倍になります。
「1トークン=約4文字」は英語の話
OpenAIはトークナイザー tiktoken について「1トークンは平均で約4バイト」と説明し、GoogleもGeminiについて「1トークンは約4文字」としています。どちらも英語の文章が前提です。日本語では1文字がほぼ1トークンになり、漢字によっては1文字が2トークン以上に分かれることもあります。トークナイザーが主に英語の文章をもとに作られているためです。
数値の根拠
OpenAIのトークナイザー o200k_base(GPT-4o以降)と cl100k_base(GPT-4、GPT-3.5)で、言語ごとに36〜139本の文章を実測しました(日本語は41本、2026年9月28日)。1トークンあたりの平均文字数:
- 日本語:o200kで1.39、cl100kで1.08(幅 1.0〜1.5)
- 英語:3.9(幅 3.3〜4.5)
- インドネシア語:3.6 と 3.0(幅 2.7〜3.9)
- ドイツ語:3.6 と 3.1(幅 2.7〜4.2)
- フランス語・スペイン語:3.7 と 3.3(幅 2.9〜4.2)
- トルコ語:3.0 と 2.4(幅 2.3〜3.3)
推定値は、文字数を2つのトークナイザーの平均で割ったものです。幅は、個々の文章の10パーセンタイルと90パーセンタイルから求めています。新しい o200k_base は日本語を効率よく扱えるため、GPT-4o以降のモデルでは推定値より少なめ、古いGPT-4では多めになる傾向があります。プログラムのコード、表、数字の多い文章、絵文字は大きくずれることがあります。
正確なカウンターにしない理由
正確に数えるには、トークン表をまるごと読み込む必要があります。o200k_base では約3.6 MBになり、軽いWebページには大きすぎます。また、Claude、Gemini、Llamaはそれぞれ独自のトークナイザーを使うため、正確な数はその提供元のAPI(トークンカウント用のエンドポイントなど)でしか分かりません。
よくある質問
日本語1文字は何トークンですか?
GPT-4o以降のトークナイザー(o200k_base)では平均で約0.7トークン、GPT-4(cl100k_base)では約0.9トークンでした。ひらがなやよく使う漢字は1文字1トークン以下、珍しい漢字は1文字で2〜3トークンになることがあります。
トークンとは何ですか?
ChatGPTなどのAIモデルが処理する文章の断片です。英語ではよく使う単語が1トークンになることが多く、日本語ではおおむね1文字前後が1トークンになります。
ChatGPTのトークン数はこれで正確に分かりますか?
いいえ、ChatGPTのトークナイザーで実測した値にもとづく推定です。テスト文章では実際の値の80〜90%が表示の幅に収まりました。正確な数はOpenAIのトークナイザーやAPIで確認できます。
ClaudeやGeminiにも使えますか?
おおまかな目安にはなりますが、モデルごとにトークナイザーが異なります。正確な数は各社のAPI(OpenAI、Claude、Geminiのトークンカウント機能など)でのみ得られます。
日本語は英語よりトークンを多く使うのはなぜですか?
トークナイザーは主に英語の文章をもとに作られているため、英語では1単語がまとめて1トークンになるのに対し、日本語は文字ごとに分かれやすいからです。実測では、同じ文字数で日本語は英語の約3倍のトークンになりました。
入力した文章はどこかに送信されますか?
いいえ。カウントはブラウザ内だけで行われ、文章は送信も保存もされず、URLにも含まれません。
単語数が表示されないのはなぜですか?
日本語は単語の間に空白を入れないため、空白で区切る単語数は意味がありません。言語が「日本語」のときは文字数と行数だけを表示します。
出典・根拠
- OpenAI tiktoken (MIT) – “each token corresponds to about 4 bytes”; o200k_base / cl100k_base used for the measurement
- Google AI for Developers – Understand and count tokens (“about 4 characters”)
- Anthropic – Token counting (exact counts via the Claude API)
更新日:
関連ツール
- 文字数カウント文字数カウントツールです。空白・改行を含む文字数と含まない文字数、行数、段落数、読むのにかかる時間をリアルタイムで表示。X(旧Twitter)やSMSの上限もわかります。
- パスワード生成ツール安全なランダムパスワードと覚えやすいパスフレーズを無料で生成。強度をビット数で表示し、生成はブラウザ内で完結。送信も保存もされません。
- パスワード強度チェックパスワードの強度と安全性を無料でチェック。エントロピー(ビット数)と解読にかかる時間を表示します。判定はブラウザ内だけで行い、送信も保存もしません。
- SNS画像サイズ一覧2026インスタ、Facebook、YouTube、LinkedIn、X、Pinterest、Threadsの画像サイズを公式情報だけで一覧に。出典付きで、サイズのコピーや高さの計算もできます。
- インスタのハッシュタグカウンター・キャプション整形インスタのキャプションのハッシュタグと@メンションを数え、重複を表示。ハッシュタグを末尾にまとめ、改行を保ったまま整形できます。無料・登録不要。
- テキスト読み上げ:文章を音声で読み上げる無料の読み上げツールです。文章を貼り付けて声・速度・高さを選ぶだけで、ブラウザーが音声で読み上げます。登録不要、読んでいる単語も表示します。