guía
Cuántos tokens tiene un prompt y cómo contarlos
«Unos cuatro caracteres por token» es la regla que todo el mundo repite, y en español se queda corta con frecuencia. Esta guía explica de dónde sale esa cifra, cuándo miente y cómo obtener el número real antes de que te lo cobren.
Qué cuenta como un token
Un modelo no lee palabras: lee tokens, fragmentos que el tokenizador ha aprendido a partir del texto con el que se entrenó. Las palabras muy frecuentes suelen ser un solo token; las raras se parten en varios.
Eso explica un comportamiento que descoloca al principio: «de» es un token y «desproporcionadamente» pueden ser cinco, aunque una tenga dos letras y la otra veintiuna. Lo que decide no es la longitud, es cuántas veces apareció esa secuencia durante el entrenamiento.
Cuentan también los espacios, los saltos de línea y la puntuación. Un prompt con mucha estructura decorativa —líneas de guiones, separadores, sangrías profundas— paga por todo eso sin que aporte nada a la instrucción.
Por qué la regla de los cuatro caracteres falla en español
La cifra de «cuatro caracteres por token» sale de medir texto en inglés. Los tokenizadores de los modelos grandes se entrenaron sobre corpus donde el inglés domina, así que sus fragmentos están optimizados para el inglés.
En español el reparto empeora. Las palabras son más largas, la conjugación multiplica las formas de cada verbo y los acentos aparecen en secuencias menos frecuentes. El resultado práctico es que el mismo contenido suele ocupar entre un 15 % y un 30 % más de tokens en español que en inglés.
Por eso una cuenta de caracteres sirve como orden de magnitud y no como medida. Si estás decidiendo si un documento cabe en la ventana de contexto, la diferencia entre estimar y medir es la diferencia entre que la llamada funcione o se corte.
Cómo contarlos de verdad
Hay tres formas, y la que sirve depende de lo que necesites.
- El tokenizador del propio modelo. Es la única cifra exacta, porque cada familia de modelos parte el texto a su manera: el mismo prompt no da el mismo número en GPT que en Claude. Anthropic y OpenAI exponen un endpoint de recuento.
- Una biblioteca local, como tiktoken para los modelos de OpenAI. Va sin red y es exacta para esa familia, pero hay que tenerla instalada y actualizada.
- Una estimación por caracteres, dividiendo entre cuatro. Vale para saber si andas por cien o por mil; no vale para decidir si algo cabe.
Cuándo importa el número exacto
No siempre hace falta. Si escribes un prompt suelto en una conversación, la cifra da igual: lo notarás cuando el chat empiece a olvidar el principio.
Importa en dos casos. El primero es el presupuesto: si llamas por API, cada token de entrada se factura en cada llamada, así que un prompt de sistema inflado multiplica su desperdicio por el volumen de tu producto. El segundo es el límite: cuando montas un sistema que mete documentos recuperados en el contexto, necesitas saber cuánto ocupa lo fijo para calcular cuánto queda para lo variable.
En los dos, el número que necesitas es el del modelo que vas a usar, no una media.
Y una vez contados, reducirlos
Contar es el diagnóstico; recortar es el tratamiento. Un prompt medio en español lleva entre un 30 % y un 50 % de texto que no cambia la respuesta: cortesías, muletillas, perífrasis administrativas y repeticiones.
Eso se puede hacer a mano, y para un prompt de sistema fijo es lo razonable: lo repasas una vez y lo dejas escrito. Deja de serlo cuando el texto cambia en cada llamada, porque entonces no hay nada que repasar de antemano.
El optimizador aplica estas reglas mientras escribes, con un diff palabra a palabra para que veas exactamente qué se quita. El plan gratuito no pide tarjeta.