Contador de tokens de IA e ajuste de contexto
Cole qualquer texto para ver em quantos tokens ele provavelmente vai virar, se cabe numa dada janela de contexto e quanto custaria nas suas próprias tarifas de API. Tudo roda no seu navegador — o texto nunca é enviado.
Cabe na janela de contexto?
| Janela de contexto | Seu texto | Cabe? |
|---|
A janela de contexto é dividida entre a sua entrada, a resposta do modelo e tudo o que o app acrescenta nos bastidores (prompt de sistema, documentos recuperados, histórico da conversa). Deixe folga — encher a janela até a borda é assim que se ganham respostas truncadas.
Quanto custaria?
Como funciona esta estimativa (e por que ela não é exata)
A tokenização de verdade roda um vocabulário BPE específico do modelo sobre o seu texto — e cada família de modelos usa um diferente, então a contagem «verdadeira» muda por modelo. Fazer isso direito no navegador significaria embarcar um vocabulário de vários megabytes por família, o que deixaria esta página lenta por um número de que você só precisa aproximadamente.
Em vez disso, esta ferramenta usa um estimador baseado em caracteres e palavras, ponderado para espaços, pontuação e dígitos, que fica dentro de uns 10–15% para prosa inglesa comum. Dois vieses conhecidos: código e texto muito pontuado tokenizam de forma mais densa do que a estimativa sugere, e escritas não latinas (chinês, japonês, árabe, hindi) usam bem mais tokens por caractere do que o inglês — muitas vezes 2 a 3 vezes.
Se você precisa de exatidão para cobrança, use o endpoint de tokenização do seu provedor. Para «isto vai caber?» e «quanto vai custar mais ou menos?», uma estimativa é a ferramenta certa.
O que é de fato um token
Os modelos não leem caracteres nem palavras — leem tokens, pedaços que ficam entre os dois. Palavras comuns costumam ser um token; as mais longas ou incomuns se dividem em vários. «Unbelievable» pode dar três tokens; «the» é um. Em prosa inglesa, um token tem em média cerca de quatro caracteres, ou aproximadamente três quartos de palavra.
Tudo é cobrado e limitado em tokens: o que você manda, o que volta e quanto o modelo consegue segurar de uma vez.
Por que seu texto é mais denso do que você pensa
- Código tokeniza mal — indentação, colchetes e camelCase custam tokens. Um arquivo de 500 linhas pode ser muito mais do que a contagem de caracteres sugere.
- Texto que não é em inglês sai caro. Línguas que não usam alfabeto latino costumam custar de 2 a 3 vezes mais tokens por caractere, e é por isso que o mesmo prompt pode custar várias vezes mais em japonês do que em inglês.
- Repetição é barata; estrutura não. O andaime de JSON e Markdown soma rápido ao longo de muitas chamadas.
Janela de contexto ≠ seu orçamento
Uma janela de um milhão de tokens não significa que você deva enviar um milhão de tokens. A qualidade da atenção se degrada em direção ao meio de entradas muito longas, a latência sobe e o custo cresce linearmente. A recuperação — puxar só os trechos relevantes — costuma ganhar de entupir a janela, e sai mais barato.
Perguntas frequentes
Qual a precisão deste contador?
Dentro de uns 10–15% para prosa inglesa comum. Código e escritas não latinas ficam acima da estimativa. Para números exatos de cobrança, use o tokenizador do seu provedor.
Meu texto é enviado para algum lugar?
Não. O cálculo roda no seu navegador. Não há requisição, nem registro, nem armazenamento.
Por que vocês não mostram os preços dos modelos?
Porque mudam, e mostrar com confiança um preço desatualizado é pior do que não mostrar preço nenhum. Digite as tarifas atuais do seu provedor e a ferramenta faz a conta.
Imagens e áudio consomem tokens?
Sim — entradas multimodais também são convertidas em tokens, a taxas que variam por provedor e resolução. Esta ferramenta cobre apenas texto.
Relacionado: O que é RAG? · Qual modelo de IA para qual tarefa · Todas as ferramentas gratuitas