Pular para o conteúdo

LLM Token Counter: Veja exatamente como os modelos GPT dividem o seu texto.

Roda no seu navegador — nada do que você cola sai desta página. Como comprovamos isso

Ambiente de testes do LLM Token Counter

Examples
Encoding

Other vendors (Claude, Gemini, Llama) use different tokenizers — counts here are approximate for them; use the vendor's count endpoint for billing.

Results update as you type — press Enter to run now.

fig. 41 — llm-token-counter · ai 48 tokens in o200k_base — 244 characters, 5.08 chars per token.
Result
Tokens48
Characters244
Words42
Bytes244
Chars per token5.08
Cost—enter a price above

Tokens

o200k_base — GPT-5, GPT-4.1, GPT-4o, o1 / o3 / o4-mini

Cole um prompt, um documento ou um payload JSON, escolha a codificação o200k_base ou cl100k_base, e receba a contagem exata de tokens com o limite de cada token destacado — além de caracteres, palavras, bytes e o custo pelo seu próprio preço por milhão de tokens, tudo calculado no seu navegador, sem cadastro.

A lacuna

Modelos leem tokens. Você escreve caracteres.

Um modelo de linguagem nunca vê o seu texto como letras. Primeiro um tokenizador o corta em tokens — palavras comuns inteiras, pedaços das mais raras, pontuação, sequências de espaços — e o modelo trabalha com os IDs deles. Em inglês um token tem em média uns quatro caracteres, mas isso é só uma média: código, números, URLs e escritas não latinas se quebram em muito mais tokens por caractere, e o português também costuma custar um pouco mais que o inglês.

A contagem importa três vezes. A janela de contexto é um orçamento de tokens, então decide se um documento cabe ou não. A cobrança é por token, normalmente cotada por milhão, com entrada e saída a preços diferentes. Os limites de taxa muitas vezes são definidos em tokens por minuto, então um prompt longo pode travar você antes do número de requisições. Estimar por caracteres é como um prompt que “deveria caber” acaba truncado.

Em outubro de 2026, os modelos atuais da OpenAI — GPT-5, GPT-4.1, GPT-4o e a série o — usam o200k_base, um vocabulário de cerca de 200.000 tokens. GPT-4, GPT-3.5 Turbo e os modelos text-embedding-3 usam o antigo cl100k_base, de cerca de 100.000. O vocabulário maior guarda mais palavras inteiras fora do inglês, e é por isso que a mesma frase em híndi da referência abaixo custa 26 tokens em um e 66 no outro.

Claude, Gemini e Llama usam tokenizadores próprios, então para eles essas contagens são uma aproximação — use o endpoint de contagem de tokens do fornecedor quando precisar do número exato.

O pipeline

Como funciona.

Quatro passos determinísticos rodam a cada mudança — todos dentro da aba do seu navegador, com as mesmas tabelas de codificação byte-pair que a OpenAI publica para o tiktoken.

  1. Carregue o vocabulário.

    A tabela de fusões da codificação escolhida é baixada uma vez deste site e guardada em cache pelo navegador; trocar para a outra codificação carrega a tabela dela do mesmo jeito.

  2. Divida e depois funda.

    Uma expressão regular divide o texto em palavras, números, pontuação e sequências de espaços; em seguida, a codificação byte-pair funde por ranking os bytes UTF-8 de cada pedaço em IDs de token.

  3. Mapeie os tokens de volta ao texto.

    Os IDs são decodificados em ordem e agrupados para que um caractere que precisa de vários tokens — um emoji, um ideograma CJK — apareça como um trecho só, e não como bytes quebrados.

  4. Conte e precifique.

    Tokens, caracteres, palavras, bytes UTF-8 e caracteres por token, mais tokens ÷ 1.000.000 × o preço que você digitar. Nada sai da aba.

Referência de tokens

Duas codificações, uma fórmula de preço.

Contagens reais do mesmo tokenizador que o painel executa, e a aritmética que transforma uma contagem em conta — para você conferir as duas à mão.

A mesma frase, contada duas vezes

Em inglês corrido as duas codificações concordam. Quanto mais uma escrita se afasta do inglês, mais o vocabulário maior do o200k_base economiza.

fig. 41.1 — o200k-vs-cl100k
Same sentence, two encodings (gpt-tokenizer 4.0.0)

English   "Kubernetes schedules pods onto nodes that have enough free CPU and memory."
          74 chars ·  74 bytes   o200k_base 14   cl100k_base 14

German    "Kubernetes plant Pods auf Knoten mit genug freier CPU und genügend Speicher ein."
          80 chars ·  81 bytes   o200k_base 17   cl100k_base 21

Japanese  "Kubernetes は十分な CPU とメモリがあるノードに Pod を配置します。"
          43 chars ·  87 bytes   o200k_base 20   cl100k_base 26

Hindi     "Kubernetes पॉड को उन नोड्स पर शेड्यूल करता है जिनमें पर्याप्त CPU और मेमोरी हो।"
          79 chars · 183 bytes   o200k_base 26   cl100k_base 66

De tokens a custo

Divida por um milhão, multiplique pela sua tarifa e precifique entrada e saída separadamente. As tarifas abaixo são números redondos de exemplo, não a tabela de preços de nenhum fornecedor.

fig. 41.2 — cost-per-call
cost = tokens ÷ 1,000,000 × price_per_1M_tokens

prompt (input)      1,840 tokens
reply  (output)       420 tokens
rates               $1.00 / 1M input · $4.00 / 1M output   ← illustrative; use your own

input    1,840 ÷ 1,000,000 × 1.00  = $0.00184
output     420 ÷ 1,000,000 × 4.00  = $0.00168
per call                           = $0.00352
× 50,000 calls a day               = $176.00 a day

Próximo passo

Vai rodar o modelo você mesmo? Dimensione a GPU em seguida.

Um contexto longo custa memória, não só dinheiro. A LLM VRAM Calculator dimensiona os pesos, o cache KV para o seu comprimento de contexto e a sobrecarga de execução de um modelo local, e aponta a menor placa em que ele cabe.

tokens.txt
"Hello, world!"   13 chars   →   4 tokens
Hello | , |  world | !

o200k_base   = 4
cl100k_base  = 4

FAQ

Suas perguntas, respondidas.

Toque em uma pergunta para expandir a resposta.

Um token é a unidade com que um modelo de linguagem lê e cobra: uma palavra comum, um pedaço de uma palavra mais longa, um sinal de pontuação ou uma sequência de espaços. O tokenizador divide o texto a partir de um vocabulário fixo aprendido no treinamento, então palavras inglesas frequentes costumam ser um token e palavras raras viram vários. Como referência aproximada, prosa em inglês fica em torno de quatro caracteres por token, e é por isso que o contador mostra os caracteres por token ao lado do total.

São as duas codificações byte-pair da OpenAI, batizadas pelo tamanho do vocabulário, de cerca de 200.000 e 100.000 tokens. Em outubro de 2026, o o200k_base é usado pelo GPT-5, GPT-4.1, GPT-4o e pelos modelos de raciocínio da série o, e o cl100k_base pelo GPT-4, GPT-3.5 Turbo e pelos modelos text-embedding-3. O vocabulário maior costuma precisar de menos tokens para o mesmo texto, principalmente fora do inglês, então escolha a codificação do modelo para o qual você vai enviar.

Cada família de modelos tem seu próprio tokenizador com seu próprio vocabulário, então o mesmo texto se divide em um número diferente de tokens. Este contador implementa só as codificações da OpenAI, por isso é uma aproximação para qualquer outro modelo — útil para dimensionar um prompt, não para cobrança. Para um número exato, use o endpoint de contagem de tokens do fornecedor ou os números de uso que a API dele retorna.

Codificações byte-pair trabalham sobre bytes UTF-8, e o vocabulário é dominado por texto que era comum nos dados de treinamento. Um emoji ou um caractere CJK ocupa três ou quatro bytes, e quando essa sequência de bytes não é uma entrada própria do vocabulário ela é dividida em vários tokens. É por isso que uma linha curta de emoji pode custar mais que uma frase inteira em inglês, e por isso o o200k_base, com seu vocabulário multilíngue maior, costuma contar menos tokens que o cl100k_base em texto CJK.

Digite o preço que seu fornecedor cobra por milhão de tokens, e o contador o multiplica pelo número de tokens para mostrar um custo estimado. Não há preços embutidos, porque eles mudam com frequência e variam por modelo, plano e região. Tokens de entrada e de saída costumam ter preços diferentes, então informe o preço de entrada para estimar um prompt e o de saída para uma resposta do mesmo tamanho.

Sim. Código é cheio de pontuação, operadores, colchetes e indentação, e cada um tende a virar um token próprio ou uma sequência curta, então código costuma render menos caracteres por token do que prosa em inglês. Sequências de espaços muitas vezes se fundem em um único token, o que ajuda código indentado, mas identificadores incomuns e strings longas ainda se partem em vários pedaços. Cole um arquivo real em vez de estimar pelo tamanho.

O contador tokeniza exatamente o texto que você cola. Uma requisição de chat completion envolve cada mensagem em tokens de papel e de separação, o que acrescenta alguns tokens por mensagem e mais alguns para a resposta, e ferramentas ou um prompt de sistema acrescentam os seus. Espere que o uso de prompt da API seja um pouco maior que esta contagem para uma única mensagem, e maior ainda numa conversa longa.

Não. O contador de tokens roda 100% no cliente: o tokenizador é carregado deste site na página e seu texto é tokenizado na aba do seu navegador. Nada é enviado a um servidor, não há conta nem cadastro, então você pode colar prompts ou documentos internos com segurança.

More free, private DevOps tools.

O LLM Token Counter é uma das ferramentas do OpsCanopy — uma copa crescente de validadores, conversores e testadores no navegador que nunca tocam um servidor.

Começando com AI & local LLMs?  Leia o guia de AI & local LLMs →

42 ferramentas gratuitas, todas capazes de funcionar offline — o opscanopy.com não exige cadastro e não envia nada.

Mais para cargas de IA: a LLM VRAM Calculator e o Data Size Converter, ou navegue pelo diretório completo de ferramentas.

As contagens são exatas para os modelos da OpenAI que usam essas codificações; o formato de chat acrescenta alguns tokens por mensagem e os tokenizadores de outros fornecedores diferem, então confirme no relatório de uso do seu fornecedor antes de orçar. OpsCanopy é gratuito e aberto.