Contador de tokens de IA y ajuste de contexto
Pega cualquier texto para ver en cuántos tokens es probable que se convierta, si cabe en una ventana de contexto dada y cuánto costaría con tus propias tarifas de API. Todo se ejecuta en tu navegador: el texto nunca se sube.
¿Cabe en la ventana de contexto?
| Ventana de contexto | Tu texto | ¿Cabe? |
|---|
La ventana de contexto se reparte entre tu entrada, la respuesta del modelo y todo lo que la app añade entre bastidores (prompt de sistema, documentos recuperados, historial de chat). Deja margen: llenar la ventana hasta el borde es como se consiguen respuestas truncadas.
¿Cuánto costaría?
Cómo funciona esta estimación (y por qué no es exacta)
La tokenización real pasa un vocabulario BPE específico del modelo sobre tu texto, y cada familia de modelos usa uno distinto, así que el recuento «verdadero» cambia según el modelo. Hacerlo bien en el navegador supondría enviar un vocabulario de varios megabytes por familia, lo que volvería lenta esta página por un número que solo necesitas de forma aproximada.
En su lugar, esto usa un estimador basado en caracteres y palabras, ponderado por espacios, puntuación y dígitos, que se queda dentro de un 10–15% aproximadamente en prosa inglesa corriente. Dos sesgos conocidos: el código y el texto muy puntuado se tokenizan de forma más densa de lo que sugiere la estimación, y las escrituras no latinas (chino, japonés, árabe, hindi) usan bastantes más tokens por carácter que el inglés, a menudo de 2 a 3 veces.
Si necesitas exactitud para facturar, usa el endpoint tokenizador de tu proveedor. Para «¿cabrá esto?» y «¿cuánto costará más o menos?», la herramienta adecuada es una estimación.
Qué es realmente un token
Los modelos no leen caracteres ni palabras: leen tokens, fragmentos que están entre ambos. Las palabras comunes suelen ser un token; las largas o raras se parten en varios. «Unbelievable» pueden ser tres tokens; «the» es uno. En prosa inglesa, un token promedia unos cuatro caracteres, o alrededor de tres cuartos de palabra.
Todo se cobra y se limita en tokens: lo que envías, lo que vuelve y cuánto puede sostener el modelo a la vez.
Por qué tu texto es más denso de lo que crees
- El código se tokeniza mal: la indentación, los corchetes y el camelCase cuestan tokens. Un archivo de 500 líneas puede ser mucho más de lo que sugiere su recuento de caracteres.
- El texto que no está en inglés sale caro. Las lenguas que no usan alfabeto latino suelen costar de 2 a 3 veces más tokens por carácter, y por eso el mismo prompt puede costar varias veces más en japonés que en inglés.
- La repetición es barata; la estructura no. El andamiaje de JSON y Markdown se acumula rápido a lo largo de muchas llamadas.
Ventana de contexto ≠ tu presupuesto
Una ventana de un millón de tokens no significa que debas enviar un millón de tokens. La calidad de la atención se degrada hacia el medio de las entradas muy largas, la latencia sube y el coste crece linealmente. La recuperación —traer solo los pasajes relevantes— suele ganarle a atiborrar la ventana, y es más barata.
Preguntas frecuentes
¿Qué precisión tiene este contador?
Dentro de un 10–15% aproximadamente para prosa inglesa corriente. El código y las escrituras no latinas quedan por encima de la estimación. Para cifras exactas de facturación, usa el tokenizador de tu proveedor.
¿Mi texto se sube a algún sitio?
No. El cálculo se hace en tu navegador. No hay petición, ni registro, ni almacenamiento.
¿Por qué no mostráis los precios de los modelos?
Porque cambian, y enseñar un precio caducado con aplomo es peor que no dar ninguno. Introduce las tarifas actuales de tu proveedor y la herramienta hace la aritmética.
¿Las imágenes y el audio consumen tokens?
Sí: las entradas multimodales también se convierten en tokens, a tasas que varían según el proveedor y la resolución. Esta herramienta solo cubre texto.
Relacionado: ¿Qué es RAG? · Qué modelo de IA para qué tarea · Todas las herramientas gratuitas