LLM Token Counter: Veja exatamente como os modelos GPT dividem o seu texto.
Roda no seu navegador — nada do que você cola sai desta página. Como comprovamos isso
Ambiente de testes do LLM Token Counter
Other vendors (Claude, Gemini, Llama) use different tokenizers — counts here are approximate for them; use the vendor's count endpoint for billing.
Results update as you type — press Enter to run now.
Tokens
o200k_base — GPT-5, GPT-4.1, GPT-4o, o1 / o3 / o4-mini
Cole um prompt, um documento ou um payload JSON, escolha a codificação o200k_base ou cl100k_base, e receba a contagem exata de tokens com o limite de cada token destacado — além de caracteres, palavras, bytes e o custo pelo seu próprio preço por milhão de tokens, tudo calculado no seu navegador, sem cadastro.
A lacuna
Modelos leem tokens. Você escreve caracteres.
Um modelo de linguagem nunca vê o seu texto como letras. Primeiro um tokenizador o corta em tokens — palavras comuns inteiras, pedaços das mais raras, pontuação, sequências de espaços — e o modelo trabalha com os IDs deles. Em inglês um token tem em média uns quatro caracteres, mas isso é só uma média: código, números, URLs e escritas não latinas se quebram em muito mais tokens por caractere, e o português também costuma custar um pouco mais que o inglês.
A contagem importa três vezes. A janela de contexto é um orçamento de tokens, então decide se um documento cabe ou não. A cobrança é por token, normalmente cotada por milhão, com entrada e saída a preços diferentes. Os limites de taxa muitas vezes são definidos em tokens por minuto, então um prompt longo pode travar você antes do número de requisições. Estimar por caracteres é como um prompt que “deveria caber” acaba truncado.
Em outubro de 2026, os modelos atuais da OpenAI — GPT-5, GPT-4.1, GPT-4o e a série o — usam o200k_base, um vocabulário de cerca de 200.000 tokens. GPT-4, GPT-3.5 Turbo e os modelos text-embedding-3 usam o antigo cl100k_base, de cerca de 100.000. O vocabulário maior guarda mais palavras inteiras fora do inglês, e é por isso que a mesma frase em híndi da referência abaixo custa 26 tokens em um e 66 no outro.
Claude, Gemini e Llama usam tokenizadores próprios, então para eles essas contagens são uma aproximação — use o endpoint de contagem de tokens do fornecedor quando precisar do número exato.
O pipeline
Como funciona.
Quatro passos determinísticos rodam a cada mudança — todos dentro da aba do seu navegador, com as mesmas tabelas de codificação byte-pair que a OpenAI publica para o tiktoken.
-
Carregue o vocabulário.
A tabela de fusões da codificação escolhida é baixada uma vez deste site e guardada em cache pelo navegador; trocar para a outra codificação carrega a tabela dela do mesmo jeito.
-
Divida e depois funda.
Uma expressão regular divide o texto em palavras, números, pontuação e sequências de espaços; em seguida, a codificação byte-pair funde por ranking os bytes UTF-8 de cada pedaço em IDs de token.
-
Mapeie os tokens de volta ao texto.
Os IDs são decodificados em ordem e agrupados para que um caractere que precisa de vários tokens — um emoji, um ideograma CJK — apareça como um trecho só, e não como bytes quebrados.
-
Conte e precifique.
Tokens, caracteres, palavras, bytes UTF-8 e caracteres por token, mais tokens ÷ 1.000.000 × o preço que você digitar. Nada sai da aba.
Referência de tokens
Duas codificações, uma fórmula de preço.
Contagens reais do mesmo tokenizador que o painel executa, e a aritmética que transforma uma contagem em conta — para você conferir as duas à mão.
A mesma frase, contada duas vezes
Em inglês corrido as duas codificações concordam. Quanto mais uma escrita se afasta do inglês, mais o vocabulário maior do o200k_base economiza.
Same sentence, two encodings (gpt-tokenizer 4.0.0)
English "Kubernetes schedules pods onto nodes that have enough free CPU and memory."
74 chars · 74 bytes o200k_base 14 cl100k_base 14
German "Kubernetes plant Pods auf Knoten mit genug freier CPU und genügend Speicher ein."
80 chars · 81 bytes o200k_base 17 cl100k_base 21
Japanese "Kubernetes は十分な CPU とメモリがあるノードに Pod を配置します。"
43 chars · 87 bytes o200k_base 20 cl100k_base 26
Hindi "Kubernetes पॉड को उन नोड्स पर शेड्यूल करता है जिनमें पर्याप्त CPU और मेमोरी हो।"
79 chars · 183 bytes o200k_base 26 cl100k_base 66 De tokens a custo
Divida por um milhão, multiplique pela sua tarifa e precifique entrada e saída separadamente. As tarifas abaixo são números redondos de exemplo, não a tabela de preços de nenhum fornecedor.
cost = tokens ÷ 1,000,000 × price_per_1M_tokens
prompt (input) 1,840 tokens
reply (output) 420 tokens
rates $1.00 / 1M input · $4.00 / 1M output ← illustrative; use your own
input 1,840 ÷ 1,000,000 × 1.00 = $0.00184
output 420 ÷ 1,000,000 × 4.00 = $0.00168
per call = $0.00352
× 50,000 calls a day = $176.00 a day Próximo passo
Vai rodar o modelo você mesmo? Dimensione a GPU em seguida.
Um contexto longo custa memória, não só dinheiro. A LLM VRAM Calculator dimensiona os pesos, o cache KV para o seu comprimento de contexto e a sobrecarga de execução de um modelo local, e aponta a menor placa em que ele cabe.
"Hello, world!" 13 chars → 4 tokens
Hello | , | world | !
o200k_base = 4
cl100k_base = 4 FAQ
Suas perguntas, respondidas.
Toque em uma pergunta para expandir a resposta.
O que é um token?
Um token é a unidade com que um modelo de linguagem lê e cobra: uma palavra comum, um pedaço de uma palavra mais longa, um sinal de pontuação ou uma sequência de espaços. O tokenizador divide o texto a partir de um vocabulário fixo aprendido no treinamento, então palavras inglesas frequentes costumam ser um token e palavras raras viram vários. Como referência aproximada, prosa em inglês fica em torno de quatro caracteres por token, e é por isso que o contador mostra os caracteres por token ao lado do total.
Qual é a diferença entre o200k_base e cl100k_base, e quais modelos usam cada um?
São as duas codificações byte-pair da OpenAI, batizadas pelo tamanho do vocabulário, de cerca de 200.000 e 100.000 tokens. Em outubro de 2026, o o200k_base é usado pelo GPT-5, GPT-4.1, GPT-4o e pelos modelos de raciocínio da série o, e o cl100k_base pelo GPT-4, GPT-3.5 Turbo e pelos modelos text-embedding-3. O vocabulário maior costuma precisar de menos tokens para o mesmo texto, principalmente fora do inglês, então escolha a codificação do modelo para o qual você vai enviar.
Por que a contagem é diferente para Claude, Gemini ou Llama?
Cada família de modelos tem seu próprio tokenizador com seu próprio vocabulário, então o mesmo texto se divide em um número diferente de tokens. Este contador implementa só as codificações da OpenAI, por isso é uma aproximação para qualquer outro modelo — útil para dimensionar um prompt, não para cobrança. Para um número exato, use o endpoint de contagem de tokens do fornecedor ou os números de uso que a API dele retorna.
Por que emoji e texto em chinês, japonês ou coreano custam mais tokens?
Codificações byte-pair trabalham sobre bytes UTF-8, e o vocabulário é dominado por texto que era comum nos dados de treinamento. Um emoji ou um caractere CJK ocupa três ou quatro bytes, e quando essa sequência de bytes não é uma entrada própria do vocabulário ela é dividida em vários tokens. É por isso que uma linha curta de emoji pode custar mais que uma frase inteira em inglês, e por isso o o200k_base, com seu vocabulário multilíngue maior, costuma contar menos tokens que o cl100k_base em texto CJK.
Como funciona o campo «$ por 1 mi de tokens»?
Digite o preço que seu fornecedor cobra por milhão de tokens, e o contador o multiplica pelo número de tokens para mostrar um custo estimado. Não há preços embutidos, porque eles mudam com frequência e variam por modelo, plano e região. Tokens de entrada e de saída costumam ter preços diferentes, então informe o preço de entrada para estimar um prompt e o de saída para uma resposta do mesmo tamanho.
Código é tokenizado de forma diferente de prosa?
Sim. Código é cheio de pontuação, operadores, colchetes e indentação, e cada um tende a virar um token próprio ou uma sequência curta, então código costuma render menos caracteres por token do que prosa em inglês. Sequências de espaços muitas vezes se fundem em um único token, o que ajuda código indentado, mas identificadores incomuns e strings longas ainda se partem em vários pedaços. Cole um arquivo real em vez de estimar pelo tamanho.
Por que esta contagem difere do uso que a API de chat informa?
O contador tokeniza exatamente o texto que você cola. Uma requisição de chat completion envolve cada mensagem em tokens de papel e de separação, o que acrescenta alguns tokens por mensagem e mais alguns para a resposta, e ferramentas ou um prompt de sistema acrescentam os seus. Espere que o uso de prompt da API seja um pouco maior que esta contagem para uma única mensagem, e maior ainda numa conversa longa.
Meu texto sai do navegador em algum momento?
Não. O contador de tokens roda 100% no cliente: o tokenizador é carregado deste site na página e seu texto é tokenizado na aba do seu navegador. Nada é enviado a um servidor, não há conta nem cadastro, então você pode colar prompts ou documentos internos com segurança.
More free, private DevOps tools.
O LLM Token Counter é uma das ferramentas do OpsCanopy — uma copa crescente de validadores, conversores e testadores no navegador que nunca tocam um servidor.
Ferramentas relacionadas
Começando com AI & local LLMs? Leia o guia de AI & local LLMs →
42 ferramentas gratuitas, todas capazes de funcionar offline — o opscanopy.com não exige cadastro e não envia nada.
Mais para cargas de IA: a LLM VRAM Calculator e o Data Size Converter, ou navegue pelo diretório completo de ferramentas.
As contagens são exatas para os modelos da OpenAI que usam essas codificações; o formato de chat acrescenta alguns tokens por mensagem e os tokenizadores de outros fornecedores diferem, então confirme no relatório de uso do seu fornecedor antes de orçar. OpsCanopy é gratuito e aberto.