LLM Token Counter: Sehen Sie genau, wie GPT-Modelle Ihren Text zerlegen.
Läuft in Ihrem Browser — nichts, was Sie einfügen, verlässt diese Seite. Wie wir das belegen
LLM-Token-Counter-Playground
Other vendors (Claude, Gemini, Llama) use different tokenizers — counts here are approximate for them; use the vendor's count endpoint for billing.
Results update as you type — press Enter to run now.
Tokens
o200k_base — GPT-5, GPT-4.1, GPT-4o, o1 / o3 / o4-mini
Fügen Sie einen Prompt, ein Dokument oder eine JSON-Payload ein, wählen Sie das Encoding o200k_base oder cl100k_base, und erhalten Sie die exakte Token-Zahl mit hervorgehobener Grenze jedes Tokens — dazu Zeichen, Wörter, Bytes und die Kosten zu Ihrem eigenen Preis pro Million Tokens, alles in Ihrem Browser berechnet, ohne Anmeldung.
Die Lücke
Modelle lesen Tokens. Sie schreiben Zeichen.
Ein Sprachmodell sieht Ihren Text nie als Buchstaben. Ein Tokenizer zerlegt ihn zuerst in Tokens — ganze häufige Wörter, Teile seltenerer, Satzzeichen, Folgen von Leerzeichen — und das Modell arbeitet mit deren IDs. Im Englischen umfasst ein Token im Schnitt etwa vier Zeichen, aber das ist nur ein Durchschnitt: Code, Zahlen, URLs und nicht-lateinische Schriften zerfallen in deutlich mehr Tokens pro Zeichen — und auch deutsche Komposita kosten mehr als englischer Fließtext.
Die Zahl zählt dreifach. Das Kontextfenster ist ein Token-Budget und entscheidet, ob ein Dokument überhaupt hineinpasst. Abgerechnet wird pro Token, meist pro Million angegeben, mit getrennten Preisen für Ein- und Ausgabe. Rate Limits werden oft in Tokens pro Minute festgelegt, sodass ein langer Prompt Sie drosseln kann, bevor die Anzahl der Anfragen es tut. Wer aus Zeichen schätzt, erlebt, wie ein Prompt, der „passen sollte“, abgeschnitten wird.
Stand Oktober 2026 verwenden die aktuellen Modelle von OpenAI — GPT-5, GPT-4.1, GPT-4o und die o-Serie — o200k_base, ein Vokabular von etwa 200.000 Tokens. GPT-4, GPT-3.5 Turbo und die text-embedding-3-Modelle verwenden das ältere cl100k_base mit etwa 100.000. Das größere Vokabular enthält mehr ganze Wörter außerhalb des Englischen — deshalb kostet derselbe Hindi-Satz in der Referenz unten auf dem einen 26 Tokens und auf dem anderen 66.
Claude, Gemini und Llama verwenden eigene Tokenizer, für sie sind diese Zahlen also eine Näherung — nutzen Sie den Token-Count-Endpunkt des Anbieters, wenn Sie die exakte Zahl brauchen.
Die Pipeline
So funktioniert es.
Vier deterministische Schritte laufen bei jeder Änderung — alle innerhalb Ihres Browser-Tabs, mit denselben Byte-Pair-Encoding-Tabellen, die OpenAI für tiktoken veröffentlicht.
-
Vokabular laden.
Die Merge-Tabelle des gewählten Encodings wird einmal von dieser Website geladen und vom Browser zwischengespeichert; ein Wechsel zum anderen Encoding lädt dessen eigene Tabelle auf dieselbe Weise.
-
Aufteilen, dann zusammenführen.
Ein regulärer Ausdruck teilt den Text in Wörter, Zahlen, Satzzeichen und Leerraum; Byte-Pair-Encoding führt dann die UTF-8-Bytes jedes Stücks nach Rang zu Token-IDs zusammen.
-
Tokens auf Text abbilden.
Die IDs werden der Reihe nach dekodiert und so gruppiert, dass ein Zeichen, das mehrere Tokens braucht — ein Emoji, ein CJK-Zeichen — als ein Abschnitt erscheint statt als kaputte Bytes.
-
Zählen und bepreisen.
Tokens, Zeichen, Wörter, UTF-8-Bytes und Zeichen pro Token, dazu Tokens ÷ 1.000.000 × der Preis, den Sie eingeben. Nichts verlässt den Tab.
Token-Referenz
Zwei Encodings, eine Preisformel.
Echte Zahlen aus demselben Tokenizer, den das Panel ausführt, und die Arithmetik, die aus einer Zahl einen Betrag macht — damit Sie beides von Hand prüfen können.
Derselbe Satz, zweimal gezählt
Im englischen Fließtext stimmen beide Encodings überein. Je weiter eine Schrift vom Englischen entfernt ist, desto mehr spart das größere o200k_base-Vokabular.
Same sentence, two encodings (gpt-tokenizer 4.0.0)
English "Kubernetes schedules pods onto nodes that have enough free CPU and memory."
74 chars · 74 bytes o200k_base 14 cl100k_base 14
German "Kubernetes plant Pods auf Knoten mit genug freier CPU und genügend Speicher ein."
80 chars · 81 bytes o200k_base 17 cl100k_base 21
Japanese "Kubernetes は十分な CPU とメモリがあるノードに Pod を配置します。"
43 chars · 87 bytes o200k_base 20 cl100k_base 26
Hindi "Kubernetes पॉड को उन नोड्स पर शेड्यूल करता है जिनमें पर्याप्त CPU और मेमोरी हो।"
79 chars · 183 bytes o200k_base 26 cl100k_base 66 Von Tokens zu Kosten
Durch eine Million teilen, mit Ihrem Satz multiplizieren und Ein- und Ausgabe getrennt bepreisen. Die Sätze unten sind runde Beispielzahlen, nicht die Preisliste eines Anbieters.
cost = tokens ÷ 1,000,000 × price_per_1M_tokens
prompt (input) 1,840 tokens
reply (output) 420 tokens
rates $1.00 / 1M input · $4.00 / 1M output ← illustrative; use your own
input 1,840 ÷ 1,000,000 × 1.00 = $0.00184
output 420 ÷ 1,000,000 × 4.00 = $0.00168
per call = $0.00352
× 50,000 calls a day = $176.00 a day Nächster Schritt
Sie betreiben das Modell selbst? Bemessen Sie als Nächstes die GPU.
Ein langer Kontext kostet Speicher, nicht nur Geld. Der LLM VRAM Calculator bemisst die Gewichte, den KV-Cache für Ihre Kontextlänge und den Laufzeit-Overhead eines lokalen Modells und nennt die kleinste Karte, die passt.
"Hello, world!" 13 chars → 4 tokens
Hello | , | world | !
o200k_base = 4
cl100k_base = 4 FAQ
Fragen, beantwortet.
Tippen Sie auf eine Frage, um die Antwort aufzuklappen.
Was ist ein Token?
Ein Token ist die Einheit, in der ein Sprachmodell liest und abrechnet: ein häufiges Wort, ein Teil eines längeren Wortes, ein Satzzeichen oder eine Folge von Leerzeichen. Der Tokenizer zerlegt Text anhand eines festen, im Training gelernten Vokabulars, deshalb sind häufige englische Wörter meist ein Token, seltene Wörter dagegen mehrere. Als grobe Faustregel kommt englischer Fließtext auf etwa vier Zeichen pro Token, weshalb der Zähler die Zeichen pro Token neben der Summe anzeigt.
Was unterscheidet o200k_base von cl100k_base, und welche Modelle nutzen sie?
Es sind die beiden Byte-Pair-Encodings von OpenAI, benannt nach ihrer Vokabulargröße von rund 200.000 bzw. 100.000 Tokens. Stand Oktober 2026 nutzen GPT-5, GPT-4.1, GPT-4o und die Reasoning-Modelle der o-Serie o200k_base, während GPT-4, GPT-3.5 Turbo und die text-embedding-3-Modelle cl100k_base verwenden. Das größere Vokabular braucht für denselben Text meist weniger Tokens, besonders außerhalb des Englischen, also wählen Sie das Encoding des Modells, an das Sie senden.
Warum weicht die Zahl bei Claude, Gemini oder Llama ab?
Jede Modellfamilie bringt einen eigenen Tokenizer mit eigenem Vokabular mit, derselbe Text zerfällt also in eine andere Anzahl von Tokens. Dieser Zähler implementiert nur die OpenAI-Encodings und ist für jedes andere Modell eine Näherung — gut, um einen Prompt zu dimensionieren, nicht für die Abrechnung. Für eine exakte Zahl nutzen Sie den Token-Zähl-Endpunkt des Anbieters oder die Usage-Werte, die seine API zurückgibt.
Warum kosten Emoji und chinesischer, japanischer oder koreanischer Text mehr Tokens?
Byte-Pair-Encodings arbeiten auf UTF-8-Bytes, und im Vokabular dominiert Text, der in den Trainingsdaten häufig war. Ein Emoji oder ein CJK-Zeichen belegt drei oder vier Bytes, und ist diese Bytefolge kein eigener Vokabulareintrag, wird sie in mehrere Tokens zerlegt. Deshalb kann eine kurze Zeile Emoji mehr kosten als ein ganzer englischer Satz, und deshalb zählt o200k_base mit seinem größeren mehrsprachigen Vokabular CJK-Text oft niedriger als cl100k_base.
Wie funktioniert das Feld „$ pro 1 Mio. Tokens“?
Tragen Sie den Preis ein, den Ihr Anbieter pro Million Tokens verlangt, und der Zähler multipliziert ihn mit der Token-Zahl zu geschätzten Kosten. Es sind keine Preise eingebaut, weil sie sich oft ändern und je nach Modell, Tarif und Region unterscheiden. Eingabe- und Ausgabe-Tokens werden meist unterschiedlich bepreist, tragen Sie also den Eingabepreis ein, um einen Prompt zu bewerten, und den Ausgabepreis für eine gleich lange Antwort.
Wird Code anders tokenisiert als Fließtext?
Ja. Code steckt voller Satzzeichen, Operatoren, Klammern und Einrückungen, und jedes davon wird meist zu einem eigenen Token oder einer kurzen Folge, daher ergibt Code in der Regel weniger Zeichen pro Token als englischer Fließtext. Folgen von Leerzeichen werden oft zu einem Token zusammengefasst, was eingerücktem Code hilft, ungewöhnliche Bezeichner und lange String-Literale zerfallen aber trotzdem in mehrere Teile. Fügen Sie eine echte Datei ein, statt von ihrer Länge zu schätzen.
Warum weicht diese Zahl von der Usage ab, die die Chat-API meldet?
Der Zähler tokenisiert genau den eingefügten Text. Eine Chat-Completion-Anfrage umhüllt jede Nachricht mit Rollen- und Trenn-Tokens, das kostet einige Tokens pro Nachricht plus einige für die Antwort, und Tools oder ein System-Prompt bringen eigene mit. Rechnen Sie bei einer einzelnen Nachricht mit einer etwas höheren Prompt-Usage der API als hier, bei einer langen Unterhaltung mit einer noch höheren.
Verlässt mein Text jemals den Browser?
Nein. Der Token-Zähler läuft zu 100 % clientseitig: Der Tokenizer wird von dieser Website in die Seite geladen, und Ihr Text wird in Ihrem Browser-Tab tokenisiert. Nichts wird auf einen Server hochgeladen, es gibt kein Konto und keine Anmeldung, Sie können also bedenkenlos interne Prompts oder Dokumente einfügen.
More free, private DevOps tools.
Der LLM Token Counter ist eines der Tools in OpsCanopy — einem wachsenden Schirm browserbasierter Validatoren, Konverter und Tester, die niemals einen Server berühren.
Verwandte Tools
Neu bei AI & local LLMs? Zum AI & local LLMs-Guide →
42 kostenlose Tools, jedes einzelne offlinefähig — opscanopy.com funktioniert ohne Registrierung, und nichts wird hochgeladen.
Mehr für KI-Workloads: der LLM VRAM Calculator und der Data Size Converter, oder durchsuchen Sie das vollständige Tool-Verzeichnis.
Die Zahlen sind exakt für OpenAI-Modelle, die diese Encodings verwenden; das Chat-Format fügt pro Nachricht einige Tokens hinzu, und die Tokenizer anderer Anbieter unterscheiden sich — prüfen Sie daher den Nutzungsbericht Ihres Anbieters, bevor Sie budgetieren. OpsCanopy ist kostenlos und offen.