Los tokens son fragmentos de palabras, así que los recuentos nunca coinciden con el número de palabras. En inglés corriente, un token equivale de media a unos cuatro caracteres o tres cuartos de palabra: 1.000 palabras son aproximadamente 1.300 tokens. El código, los alfabetos no latinos y las palabras poco comunes consumen más tokens por carácter, a veces varias veces más.
Qué es realmente un token
Los modelos de lenguaje no leen caracteres ni palabras. Leen tokens: fragmentos que se obtienen al dividir el texto según un vocabulario fijo aprendido de los datos de entrenamiento.
Las palabras frecuentes suelen ser un solo token. Las palabras raras se dividen en piezas. Los espacios en blanco suelen adjuntarse al principio del token siguiente, por lo que la misma palabra puede contar de forma distinta según empiece o no una frase.
La palabra increíble no es un solo token: probablemente se divide en algo como in + cre + íble. En cambio, el es un único token, y también lo es internacional, porque apareció con suficiente frecuencia en el entrenamiento como para tener su propia entrada.
Por eso los recuentos de tokens parecen impredecibles. La unidad no es lingüística, es estadística. La frecuencia en el corpus de entrenamiento determina si algo es un token o cuatro.
37 caracteres · 7 tokens · unos 5,3 caracteres por token
Una regla aproximada para el inglés: 1 token ≈ 4 caracteres ≈ 0,75 palabras.
El código, los alfabetos no latinos y las palabras poco comunes usan más tokens por carácter.
Reglas aproximadas que sí funcionan
Para texto en inglés:
- 1 token ≈ 4 caracteres
- 1 token ≈ 0,75 palabras
- 1.000 palabras ≈ 1.300 tokens
- Una página estándar (~500 palabras) ≈ 650 tokens
Estas reglas dejan de valer rápidamente fuera del texto corriente:
| Tipo de contenido | Aproximadamente |
|---|---|
| Texto en inglés | 0,75 palabras por token |
| Código | 2–3× más tokens que el texto equivalente |
| JSON con claves largas | Muy alto: la puntuación y las comillas son tokens aparte |
| Chino, japonés, coreano | A menudo 1–2 tokens por carácter |
| Cirílico, devanagari, árabe | Normalmente 2–3× el inglés para el mismo significado |
| URL y hashes | Extremadamente alto: las cadenas aleatorias se tokenizan mal |
| Espacios repetidos | Cada secuencia puede ser un token propio |
La brecha multilingüe es importante y poco conocida: la misma frase en japonés puede costar varias veces lo que cuesta en inglés, lo que afecta tanto al coste como a cuánto cabe en la ventana de contexto.
Por qué el recuento varía entre modelos
Cada familia de modelos usa su propio tokenizador con su propio vocabulario, así que el mismo texto produce recuentos distintos.
Los modelos GPT usan variantes de codificación por pares de bytes: cl100k_base para los modelos de la época de GPT-4 y o200k_base para los más recientes. Claude usa un tokenizador distinto con un vocabulario diferente. Los modelos abiertos como Llama y Mistral tienen, a su vez, los suyos propios.
Diferencias del 10–20 % entre familias sobre el mismo texto en inglés son normales, y la brecha se amplía en el código y el texto en otros idiomas, donde los vocabularios divergen más.
En la práctica, esto significa:
- Un recuento de un tokenizador es una estimación para cualquier otro modelo.
- Solo el tokenizador del propio proveedor da un número exacto para su facturación.
- Presupuesta con margen en lugar de ajustarte exactamente a un límite.
Nuestro Contador de tokens muestra un recuento para GPT-4o y una estimación para Claude lado a lado, lo que suele bastar para saber si un prompt está cómodamente dentro de un límite o incómodamente cerca de él.
Por qué importa el número
Coste. El precio de las API es por token, con la entrada y la salida tarifadas por separado, y la salida suele costar varias veces más. Duplicar un prompt de sistema duplica ese coste en cada llamada: algo invisible en las pruebas y caro a gran escala.
Límites de contexto. La ventana lo abarca todo: el prompt de sistema, el historial de la conversación, los documentos recuperados, el mensaje actual y el espacio reservado para la respuesta. Los chats largos fallan no porque un mensaje concreto sea largo, sino porque el historial se acumula.
Truncamiento. Cuando la entrada supera el límite, algo se descarta, a menudo en silencio y a menudo el contenido más antiguo. Un modelo que «olvidó» tus instrucciones con frecuencia simplemente las perdió por truncamiento.
Fragmentación para recuperación. Dividir documentos para generar embeddings se hace en tokens, no en caracteres. Los fragmentos dimensionados por número de caracteres quedan inconsistentes, y los que cortan una frase por la mitad se recuperan mal. Para dividir textos largos en piezas manejables, Dividir texto en fragmentos corta cerca de los límites de los párrafos en lugar de a mitad de palabra.
Reducir el recuento sin perder significado
Las reducciones con más impacto, aproximadamente en este orden:
- Recorta el historial de la conversación. En un chat largo, eclipsa todo lo demás. Resume los turnos antiguos en lugar de reenviarlos literalmente.
- Elimina instrucciones redundantes. Repetir una regla de tres maneras no hace que se cumpla tres veces más. Lo que sí hace es triplicar el coste de esa regla.
- Quita los artefactos de formato. Los caracteres invisibles, los espacios repetidos y las líneas decorativas de separación también se tokenizan, y una fila de cuarenta guiones puede costar más que la frase que tiene encima. Eliminar caracteres invisibles limpia los que no puedes ver.
- Acorta las claves JSON en los prompts estructurados.
{"n": ...}frente a{"customer_full_name": ...}, multiplicado por mil registros, supone una gran diferencia. - Envía solo los fragmentos relevantes. Recuperar tres párrafos pertinentes es mejor que pegar un documento entero, y suele producir respuestas mejores además de más baratas.
Lo que no ayuda: quitar la puntuación normal, borrar artículos o escribir en un estilo telegráfico entrecortado. El ahorro es marginal y el daño a la calidad del resultado no lo es.
Preguntas frecuentes
¿Cuántos tokens son 1.000 palabras?
Unos 1.300 tokens para texto corriente en inglés, con una media aproximada de 0,75 palabras por token. El código, el JSON y el texto en otros idiomas consumen bastante más: el chino, el japonés y el coreano suelen usar de uno a dos tokens por carácter.
¿Por qué el recuento de tokens es distinto en GPT y en Claude?
Cada familia de modelos usa su propio tokenizador con un vocabulario aprendido diferente, así que el mismo texto se divide de forma distinta. Diferencias del 10–20 % en texto en inglés son normales, y la brecha es mayor en el código y en idiomas distintos del inglés.
¿Qué es un token en un modelo de IA?
Un fragmento de texto del vocabulario fijo del modelo. Las palabras frecuentes suelen ser un solo token, mientras que las raras se dividen en varias piezas, de modo que «increíble» podría convertirse en tres tokens mientras que «internacional» es solo uno.
¿Los espacios y la puntuación cuentan como tokens?
Sí. Los espacios en blanco se adjuntan normalmente al principio del token siguiente, y la puntuación es con frecuencia un token propio. Las secuencias largas de espacios repetidos o las líneas decorativas de separación pueden consumir una cantidad sorprendente.
¿Cómo puedo reducir mi consumo de tokens?
Recorta primero el historial acumulado de la conversación: en los chats largos domina todo lo demás. Después elimina las instrucciones duplicadas, quita los caracteres invisibles y los espacios repetidos, acorta las claves JSON y envía solo el fragmento relevante de un documento en lugar del documento completo.