Al desarrollar con API de LLM, surge con frecuencia la necesidad de comprobar “¿cuántos tokens tiene este prompt?” o “¿cabe en la ventana de contexto?”. El Contador de tokens de LLM solo necesita que pegue texto para comparar de un vistazo los tokens de Claude / GPT / Gemini — todo en su navegador.

Contador de tokens de LLM ― compruebe los tokens de Claude, GPT y Gemini en su navegador

Qué es un token

Un token es la unidad mínima que procesa un LLM (modelo de lenguaje grande). Los modelos no dividen el texto por caracteres ni por palabras, sino en subpalabras mediante un mecanismo llamado tokenizador.

Por ejemplo, el inglés unbelievable puede dividirse en fragmentos como un / believ / able. En inglés, una referencia aproximada es 4 caracteres ≈ 1 token.

El número de tokens importa porque dos cosas dependen de él:

  • El precio de la API — tanto la entrada como la salida se facturan por tarifa de token
  • La ventana de contexto — el límite de texto que el modelo puede manejar a la vez (p. ej., 200K tokens)

Cada modelo usa un tokenizador diferente

El mismo texto produce un número de tokens distinto según el modelo.

ModeloTokenizadorDisponibilidad
GPT-5.5 / GPT-5 / GPT-4o / GPT-4.1o200k_basePúblico (tiktoken)
GPT-4 Turbo / GPT-3.5cl100k_basePúblico (tiktoken)
Claude 3 en adelantePropietarioNo público
GeminiBasado en SentencePieceNo público (solo API de conteo)

OpenAI publica su tokenizador como tiktoken de código abierto, por lo que puede contarse con precisión incluso en JavaScript del navegador. Anthropic, en cambio, no ha publicado el tokenizador de Claude 3 en adelante, y Google tampoco ofrece un tokenizador que funcione del lado del cliente.

Por eso, esta herramienta cuenta GPT con precisión usando o200k_base, y estima Claude y Gemini como “el valor exacto de GPT × un coeficiente de corrección según la composición de caracteres”. La estimación puede tener un margen de error de ±10–20%, por lo que la interfaz muestra explícitamente una insignia de “aproximado”.

El japonés es menos eficiente en tokens

Como el vocabulario del tokenizador se entrena principalmente con texto en inglés, las palabras inglesas frecuentes tienden a agruparse en un solo token, mientras que en japonés no es raro que un solo carácter se divida en más de un token.

Por ejemplo, The quick brown fox jumps over the lazy dog. (44 caracteres) son 10 tokens con o200k_base, pero 吾輩は猫である。名前はまだ無い。 (16 caracteres) son 14 tokens. Esto muestra que el consumo de tokens por carácter es de 3 a 4 veces más pesado en japonés.

Con el mismo contenido, un prompt en japonés tiende a consumir de 1.5 a 2 veces más tokens que uno en inglés, así que escribir en inglés los system prompts que se invocan con mucha frecuencia puede reducir considerablemente el costo. Pegando ambas versiones en la herramienta, puede confirmar la reducción con números concretos.

Cómo usarlo

  1. Abra el Contador de tokens de LLM y pegue un prompt, documento o código en el área de texto.
  2. Al mismo tiempo que escribe, el número de tokens aparece en las tres tarjetas de Claude / GPT / Gemini (el diccionario del tokenizador de GPT se carga en la primera entrada).
  3. En la tabla “Desglose por modelo” bajo las tarjetas, puede consultar el número de tokens, el límite de contexto y el porcentaje de uso de los modelos principales, como GPT-5.5, Claude Opus o Gemini 3 Pro. Las generaciones anteriores a GPT-4 Turbo (cl100k_base) se cuentan por separado, así que también puede ver las diferencias entre generaciones.
  4. También se calculan al mismo tiempo el número de caracteres, palabras y líneas, útil para hacerse una idea del volumen del texto.

El procesamiento se ejecuta enteramente en su navegador, y el texto pegado nunca se envía a un servidor. Puede consultarlo con confianza incluso con prompts o documentos confidenciales que no pueden salir de su organización.

Límites de las estimaciones y cuándo necesita el valor exacto

Los valores de Claude y Gemini son solo estimaciones. Tenga en cuenta lo siguiente:

  • No los use para cálculos de facturación — las estimaciones de factura requieren el conteo exacto de cada proveedor
  • No incluyen el overhead de la API de chat — la estructura de mensajes, los roles y las definiciones de herramientas consumen tokens adicionales
  • El tokenizador cambia entre generaciones — modelos futuros podrían cambiar el método de división

Si necesita un valor exacto, use la API count_tokens de Anthropic o la API countTokens de Google (ambas requieren enviar el texto a la API). Para el uso cotidiano de “quiero saberlo aproximadamente ahora mismo, sin enviarlo a ningún sitio”, una herramienta local en el navegador como esta es la más adecuada.

Preguntas frecuentes

¿Cuánta precisión tiene el recuento de tokens?

Para los modelos GPT es exacto: el tokenizador oficial (o200k_base) se ejecuta en su navegador, así que la cifra coincide con la que le factura la API. Las cifras de Claude y Gemini son estimaciones, porque ninguno de los dos publica un tokenizador; se obtienen aplicando un factor al recuento exacto de GPT según la composición de caracteres. Sirve para presupuestar, pero no lo use cuando esté justo en el límite.

¿El japonés o el chino consumen más tokens que el inglés?

Sí. En inglés una palabra suele corresponder a un solo token, mientras que en CJK es habitual gastar un token por cada uno o dos caracteres, de modo que el mismo contenido puede ocupar dos o tres veces más. Por eso la herramienta desglosa la entrada por tipo de carácter (latinos, dígitos, CJK): cuanto mayor es la proporción de CJK, más se acerca el número de tokens al número de caracteres.

¿Qué ocurre si supero la ventana de contexto?

La API devuelve un error o, según el modelo, descarta en silencio la parte más antigua. En implementaciones que acumulan historial de conversación, el síntoma típico es que el asistente «olvida» de repente el principio. Esta herramienta muestra el uso frente a la ventana de contexto del modelo elegido, así que puede comprobar el margen mientras diseña el prompt.

¿Se envía a algún sitio el texto que pego?

No. El tokenizador se ejecuta en el navegador, de modo que nada de lo que pegue en el contador de tokens se transmite a un servidor. Puede medir documentos internos o prompts que contengan claves de API tal cual.

Resumen

  • Los tokens son la unidad de facturación y del límite de contexto de los LLM. Conocerlos de antemano facilita las estimaciones y el diseño
  • Los modelos GPT pueden contarse con precisión mediante tiktoken (o200k_base). Claude / Gemini son estimaciones porque no son públicos
  • El japonés es menos eficiente en tokens que el inglés, y puede consumir de 1.5 a 2 veces más con el mismo contenido

Si le preocupa la longitud de su prompt, péguelo en el Contador de tokens de LLM y compruébelo.