LLM Token Counter: Mira exactamente cómo dividen tu texto los modelos GPT.
Se ejecuta en tu navegador: nada de lo que pegas sale de esta página. Cómo lo demostramos
Área de pruebas del LLM Token Counter
Other vendors (Claude, Gemini, Llama) use different tokenizers — counts here are approximate for them; use the vendor's count endpoint for billing.
Results update as you type — press Enter to run now.
Tokens
o200k_base — GPT-5, GPT-4.1, GPT-4o, o1 / o3 / o4-mini
Pega un prompt, un documento o un payload JSON, elige la codificación o200k_base o cl100k_base, y obtén el recuento exacto de tokens con el límite de cada token resaltado — además de caracteres, palabras, bytes y el coste a tu propio precio por millón de tokens, todo calculado en tu navegador, sin registro.
La brecha
Los modelos leen tokens. Tú escribes caracteres.
Un modelo de lenguaje nunca ve tu texto como letras. Primero un tokenizador lo corta en tokens — palabras comunes enteras, fragmentos de las más raras, puntuación, series de espacios — y el modelo trabaja con sus IDs. En inglés un token equivale de media a unos cuatro caracteres, pero es solo una media: el código, los números, las URL y los alfabetos no latinos se parten en muchos más tokens por carácter, y el español también suele costar algo más que el inglés.
El recuento importa por tres motivos. La ventana de contexto es un presupuesto de tokens, así que decide si un documento cabe o no. La facturación es por token, normalmente expresada por millón y con entrada y salida a precios distintos. Los límites de tasa suelen fijarse en tokens por minuto, de modo que un prompt largo puede frenarte antes que el número de peticiones. Estimar a partir de caracteres es como un prompt que «debería caber» acaba truncado.
A octubre de 2026, los modelos actuales de OpenAI — GPT-5, GPT-4.1, GPT-4o y la serie o — usan o200k_base, un vocabulario de unos 200.000 tokens. GPT-4, GPT-3.5 Turbo y los modelos text-embedding-3 usan el anterior cl100k_base, de unos 100.000. El vocabulario mayor contiene más palabras completas fuera del inglés, por eso la misma frase en hindi de la referencia de abajo cuesta 26 tokens en uno y 66 en el otro.
Claude, Gemini y Llama usan sus propios tokenizadores, así que para ellos estos recuentos son una aproximación — usa el endpoint de recuento de tokens del proveedor cuando necesites la cifra exacta.
El pipeline
Cómo funciona.
Cuatro pasos deterministas se ejecutan con cada cambio — todos dentro de la pestaña de tu navegador, con las mismas tablas de codificación byte-pair que OpenAI publica para tiktoken.
-
Carga el vocabulario.
La tabla de fusiones de la codificación elegida se descarga una vez desde este sitio y el navegador la guarda en caché; cambiar a la otra codificación carga su propia tabla del mismo modo.
-
Divide y luego fusiona.
Una expresión regular divide el texto en palabras, números, puntuación y espacios; después, la codificación byte-pair fusiona por rango los bytes UTF-8 de cada fragmento en IDs de token.
-
Asigna los tokens al texto.
Los IDs se decodifican en orden y se agrupan para que un carácter que necesita varios tokens — un emoji, un ideograma CJK — se muestre como un solo tramo y no como bytes rotos.
-
Cuenta y pon precio.
Tokens, caracteres, palabras, bytes UTF-8 y caracteres por token, más tokens ÷ 1.000.000 × el precio que introduzcas. Nada sale de la pestaña.
Referencia de tokens
Dos codificaciones, una fórmula de precio.
Recuentos reales del mismo tokenizador que ejecuta el panel, y la aritmética que convierte un recuento en una factura — para que puedas comprobar ambos a mano.
La misma frase, contada dos veces
En inglés corriente las dos codificaciones coinciden. Cuanto más se aleja un alfabeto del inglés, más ahorra el vocabulario mayor de o200k_base.
Same sentence, two encodings (gpt-tokenizer 4.0.0)
English "Kubernetes schedules pods onto nodes that have enough free CPU and memory."
74 chars · 74 bytes o200k_base 14 cl100k_base 14
German "Kubernetes plant Pods auf Knoten mit genug freier CPU und genügend Speicher ein."
80 chars · 81 bytes o200k_base 17 cl100k_base 21
Japanese "Kubernetes は十分な CPU とメモリがあるノードに Pod を配置します。"
43 chars · 87 bytes o200k_base 20 cl100k_base 26
Hindi "Kubernetes पॉड को उन नोड्स पर शेड्यूल करता है जिनमें पर्याप्त CPU और मेमोरी हो।"
79 chars · 183 bytes o200k_base 26 cl100k_base 66 De tokens a coste
Divide entre un millón, multiplica por tu tarifa y pon precio a la entrada y a la salida por separado. Las tarifas de abajo son cifras redondas de ejemplo, no la lista de precios de ningún proveedor.
cost = tokens ÷ 1,000,000 × price_per_1M_tokens
prompt (input) 1,840 tokens
reply (output) 420 tokens
rates $1.00 / 1M input · $4.00 / 1M output ← illustrative; use your own
input 1,840 ÷ 1,000,000 × 1.00 = $0.00184
output 420 ÷ 1,000,000 × 4.00 = $0.00168
per call = $0.00352
× 50,000 calls a day = $176.00 a day Siguiente paso
¿Ejecutas el modelo tú mismo? Dimensiona después la GPU.
Un contexto largo cuesta memoria además de dinero. La LLM VRAM Calculator dimensiona los pesos, la caché KV para tu longitud de contexto y la sobrecarga de ejecución de un modelo local, y nombra la tarjeta más pequeña en la que cabe.
"Hello, world!" 13 chars → 4 tokens
Hello | , | world | !
o200k_base = 4
cl100k_base = 4 FAQ
Tus preguntas, respondidas.
Toca una pregunta para desplegar la respuesta.
¿Qué es un token?
Un token es la unidad con la que un modelo de lenguaje lee y factura: una palabra común, un fragmento de una palabra más larga, un signo de puntuación o una serie de espacios. El tokenizador divide el texto según un vocabulario fijo aprendido en el entrenamiento, así que las palabras inglesas frecuentes suelen ser un token y las raras se parten en varios. Como referencia aproximada, la prosa en inglés ronda los cuatro caracteres por token, y por eso el contador muestra los caracteres por token junto al total.
¿Qué diferencia hay entre o200k_base y cl100k_base, y qué modelos los usan?
Son las dos codificaciones byte-pair de OpenAI, llamadas así por su vocabulario de unos 200.000 y 100.000 tokens. A fecha de octubre de 2026, o200k_base lo usan GPT-5, GPT-4.1, GPT-4o y los modelos de razonamiento de la serie o, y cl100k_base lo usan GPT-4, GPT-3.5 Turbo y los modelos text-embedding-3. El vocabulario mayor suele necesitar menos tokens para el mismo texto, sobre todo fuera del inglés, así que elija la codificación del modelo al que va a enviar.
¿Por qué el recuento es distinto para Claude, Gemini o Llama?
Cada familia de modelos trae su propio tokenizador con su propio vocabulario, así que el mismo texto se divide en un número distinto de tokens. Este contador implementa solo las codificaciones de OpenAI, por lo que para cualquier otro modelo es una aproximación: útil para dimensionar un prompt, no para facturar. Para una cifra exacta, use el endpoint de recuento de tokens del proveedor o las cifras de uso que devuelve su API.
¿Por qué los emoji y el texto en chino, japonés o coreano cuestan más tokens?
Las codificaciones byte-pair trabajan sobre bytes UTF-8, y en el vocabulario domina el texto que era frecuente en los datos de entrenamiento. Un emoji o un carácter CJK ocupa tres o cuatro bytes, y si esa secuencia de bytes no es una entrada propia del vocabulario se divide en varios tokens. Por eso una línea corta de emoji puede costar más que una frase entera en inglés, y por eso o200k_base, con su vocabulario multilingüe mayor, suele contar menos tokens que cl100k_base en texto CJK.
¿Cómo funciona el campo «$ por 1 M de tokens»?
Escriba el precio que cobra su proveedor por millón de tokens y el contador lo multiplica por el número de tokens para mostrar un coste estimado. No hay precios incorporados, porque cambian a menudo y varían según el modelo, el plan y la región. Los tokens de entrada y de salida suelen tener precios distintos, así que introduzca el precio de entrada para valorar un prompt y el de salida para una respuesta de la misma longitud.
¿El código se tokeniza de forma distinta a la prosa?
Sí. El código está lleno de puntuación, operadores, corchetes y sangrías, y cada uno tiende a convertirse en su propio token o en una serie corta, así que el código suele dar menos caracteres por token que la prosa en inglés. Las series de espacios a menudo se funden en un solo token, lo que ayuda al código sangrado, pero los identificadores poco comunes y las cadenas largas siguen partiéndose en varios trozos. Pegue un archivo real en lugar de estimar a partir de su longitud.
¿Por qué este recuento difiere del uso que informa la API de chat?
El contador tokeniza exactamente el texto que pega. Una petición de chat completion envuelve cada mensaje en tokens de rol y de separación, lo que añade unos pocos tokens por mensaje más unos pocos para la respuesta, y las herramientas o un prompt de sistema añaden los suyos. Espere que el uso de prompt de la API sea algo mayor que este recuento para un solo mensaje, y mayor aún en una conversación larga.
¿Mi texto sale alguna vez del navegador?
No. El contador de tokens se ejecuta al 100 % en el cliente: el tokenizador se carga desde este sitio en la página y su texto se tokeniza en la pestaña de su navegador. No se sube nada a ningún servidor y no hay cuenta ni registro, así que puede pegar con seguridad prompts o documentos internos.
More free, private DevOps tools.
El LLM Token Counter es una de las herramientas de OpsCanopy — un dosel creciente de validadores, conversores y testers basados en el navegador que nunca tocan un servidor.
Herramientas relacionadas
¿Empiezas con AI & local LLMs? Lee la guía de AI & local LLMs →
42 herramientas gratuitas, todas pueden funcionar sin conexión — opscanopy.com funciona sin registro y sin subir nada.
Más para cargas de IA: la LLM VRAM Calculator y el Data Size Converter, o explora el directorio completo de herramientas.
Los recuentos son exactos para los modelos de OpenAI que usan estas codificaciones; el formato de chat añade unos pocos tokens por mensaje y los tokenizadores de otros proveedores difieren, así que confírmalo con el informe de uso de tu proveedor antes de presupuestar. OpsCanopy es gratuito y abierto.