Contador de tokens de IA e ajuste de contexto

Cole qualquer texto para ver em quantos tokens ele provavelmente vai virar, se cabe numa dada janela de contexto e quanto custaria nas suas próprias tarifas de API. Tudo roda no seu navegador — o texto nunca é enviado.

Nada sai desta página. Teste com um documento que você está pensando em dar a um modelo.
0 tokens estimados ±10–15% — veja abaixo como funciona a estimativa
Caracteres0
Palavras0
Caracteres por tokenmenor = texto mais denso
Tempo de leitura aproximado

Cabe na janela de contexto?

Janela de contextoSeu textoCabe?

A janela de contexto é dividida entre a sua entrada, a resposta do modelo e tudo o que o app acrescenta nos bastidores (prompt de sistema, documentos recuperados, histórico da conversa). Deixe folga — encher a janela até a borda é assim que se ganham respostas truncadas.

Quanto custaria?

Custo de entrada
Custo de saída
Total
Digite você mesmo as tarifas, a partir da página de preços atual do seu provedor. Não fixamos preços de propósito: o preço dos modelos muda com frequência, e um número desatualizado aqui seria pior do que nenhum. Consulte OpenAI, Google, xAI ou DeepSeek.
Como funciona esta estimativa (e por que ela não é exata)

A tokenização de verdade roda um vocabulário BPE específico do modelo sobre o seu texto — e cada família de modelos usa um diferente, então a contagem «verdadeira» muda por modelo. Fazer isso direito no navegador significaria embarcar um vocabulário de vários megabytes por família, o que deixaria esta página lenta por um número de que você só precisa aproximadamente.

Em vez disso, esta ferramenta usa um estimador baseado em caracteres e palavras, ponderado para espaços, pontuação e dígitos, que fica dentro de uns 10–15% para prosa inglesa comum. Dois vieses conhecidos: código e texto muito pontuado tokenizam de forma mais densa do que a estimativa sugere, e escritas não latinas (chinês, japonês, árabe, hindi) usam bem mais tokens por caractere do que o inglês — muitas vezes 2 a 3 vezes.

Se você precisa de exatidão para cobrança, use o endpoint de tokenização do seu provedor. Para «isto vai caber?» e «quanto vai custar mais ou menos?», uma estimativa é a ferramenta certa.

O que é de fato um token

Os modelos não leem caracteres nem palavras — leem tokens, pedaços que ficam entre os dois. Palavras comuns costumam ser um token; as mais longas ou incomuns se dividem em vários. «Unbelievable» pode dar três tokens; «the» é um. Em prosa inglesa, um token tem em média cerca de quatro caracteres, ou aproximadamente três quartos de palavra.

Tudo é cobrado e limitado em tokens: o que você manda, o que volta e quanto o modelo consegue segurar de uma vez.

Por que seu texto é mais denso do que você pensa

Janela de contexto ≠ seu orçamento

Uma janela de um milhão de tokens não significa que você deva enviar um milhão de tokens. A qualidade da atenção se degrada em direção ao meio de entradas muito longas, a latência sobe e o custo cresce linearmente. A recuperação — puxar só os trechos relevantes — costuma ganhar de entupir a janela, e sai mais barato.

Perguntas frequentes

Qual a precisão deste contador?

Dentro de uns 10–15% para prosa inglesa comum. Código e escritas não latinas ficam acima da estimativa. Para números exatos de cobrança, use o tokenizador do seu provedor.

Meu texto é enviado para algum lugar?

Não. O cálculo roda no seu navegador. Não há requisição, nem registro, nem armazenamento.

Por que vocês não mostram os preços dos modelos?

Porque mudam, e mostrar com confiança um preço desatualizado é pior do que não mostrar preço nenhum. Digite as tarifas atuais do seu provedor e a ferramenta faz a conta.

Imagens e áudio consomem tokens?

Sim — entradas multimodais também são convertidas em tokens, a taxas que variam por provedor e resolução. Esta ferramenta cobre apenas texto.

Relacionado: O que é RAG? · Qual modelo de IA para qual tarefa · Todas as ferramentas gratuitas