Quantos tokens tem meu prompt?

Por que 1.000 palavras nunca são 1.000 tokens, e o que isso significa para os limites de contexto e o custo.

Tokens são fragmentos menores que palavras, então as contagens nunca batem com a contagem de palavras. Em inglês comum, um token equivale em média a cerca de quatro caracteres ou três quartos de uma palavra — ou seja, 1.000 palavras dão aproximadamente 1.300 tokens. Código, escritas em outros idiomas e palavras incomuns consomem mais tokens por caractere, às vezes várias vezes mais.

O que um token realmente é

Os modelos de linguagem não leem caracteres nem palavras. Eles leem tokens: fragmentos produzidos ao dividir o texto conforme um vocabulário fixo, aprendido a partir dos dados de treinamento.

Palavras comuns costumam ser um único token. Palavras raras são quebradas em pedaços. Os espaços em branco normalmente ficam anexados ao início do token seguinte, e é por isso que a mesma palavra pode ter contagens diferentes dependendo de estar ou não no começo da frase.

A palavra unbelievable não é um token só — provavelmente vira algo como Un + believ + able. Já the é um único token, e international também, porque apareceu com frequência suficiente no treinamento para ganhar sua própria entrada.

É por isso que as contagens de tokens parecem imprevisíveis. A unidade não é linguística; é estatística. A frequência no corpus de treinamento determina se algo vira um token ou quatro.

UMA FRASE, SETE TOKENSUnbelievableresultsforthequarter
Tokens são fragmentos menores que palavras, então a contagem de caracteres e de tokens raramente coincide.

37 caracteres · 7 tokens · cerca de 5,3 caracteres por token

Uma regra prática para o inglês: 1 token ≈ 4 caracteres ≈ 0,75 palavras.

Código, alfabetos não latinos e palavras raras usam mais tokens por caractere.

Regras práticas que realmente funcionam

Para texto em inglês:

  • 1 token ≈ 4 caracteres
  • 1 token ≈ 0,75 palavras
  • 1.000 palavras ≈ 1.300 tokens
  • Uma página padrão (~500 palavras) ≈ 650 tokens

Essas regras deixam de valer rapidinho fora do texto comum:

Tipo de conteúdo Aproximadamente
Texto em inglês 0,75 palavras por token
Código 2–3× mais tokens que texto equivalente
JSON com chaves longas Muito alto — pontuação e aspas são tokens separados
Chinês, japonês, coreano Muitas vezes 1–2 tokens por caractere
Cirílico, devanágari, árabe Normalmente 2–3× o inglês para o mesmo significado
URLs e hashes Altíssimo — strings aleatórias tokenizam muito mal
Espaços repetidos Cada sequência pode ser um token próprio

A diferença entre idiomas é significativa e pouco percebida: a mesma frase em japonês pode custar várias vezes mais do que em inglês, o que afeta tanto o custo quanto a quantidade de texto que cabe na janela de contexto.

Por que a contagem muda de um modelo para outro

Cada família de modelos usa seu próprio tokenizador, com seu próprio vocabulário, então o mesmo texto gera contagens diferentes.

Os modelos GPT usam variantes de byte-pair encoding — cl100k_base para os modelos da era GPT-4, o200k_base para os mais novos. O Claude usa um tokenizador diferente, com outro vocabulário. Modelos abertos como Llama e Mistral têm, cada um, o seu próprio.

Diferenças de 10–20% entre famílias no mesmo texto em inglês são normais, e a distância aumenta em código e em textos em outros idiomas, onde os vocabulários divergem mais.

Na prática, isso significa:

  • Uma contagem feita com um tokenizador é uma estimativa para qualquer outro modelo.
  • Só o tokenizador do próprio provedor dá o número exato usado na cobrança.
  • Planeje com margem de folga em vez de tentar encaixar exatamente no limite.

Nosso Contador de tokens mostra lado a lado a contagem do GPT-4o e uma estimativa para o Claude, o que normalmente basta para saber se um prompt está confortavelmente dentro do limite ou perigosamente perto dele.

Por que o número importa

Custo. O preço das APIs é por token, com entrada e saída cobradas separadamente, e a saída costuma custar várias vezes mais. Dobrar o tamanho de um prompt de sistema dobra esse custo em cada chamada — o tipo de coisa que passa despercebida nos testes e fica cara em volume.

Limites de contexto. A janela cobre tudo: prompt de sistema, histórico da conversa, documentos recuperados, a mensagem atual e o espaço reservado para a resposta. Conversas longas falham não porque uma mensagem específica seja longa, mas porque o histórico se acumula.

Truncamento. Quando a entrada excede o limite, algo é descartado — muitas vezes em silêncio, e muitas vezes o conteúdo mais antigo. Um modelo que "esqueceu" suas instruções frequentemente apenas as teve truncadas.

Divisão para recuperação. Dividir documentos para embeddings funciona em tokens, não em caracteres. Partes dimensionadas por contagem de caracteres ficam inconsistentes, e partes cortadas no meio de uma frase são recuperadas com baixa qualidade. Para quebrar textos longos em pedaços utilizáveis, o Dividir texto em partes corta perto dos limites de parágrafo em vez de no meio das palavras.

Como reduzir a contagem sem perder significado

As reduções de maior impacto, mais ou menos nesta ordem:

  1. Enxugue o histórico da conversa. Em chats longos, ele supera todo o resto. Resuma os turnos antigos em vez de reenviá-los na íntegra.
  2. Corte instruções redundantes. Repetir uma regra de três jeitos não a torna três vezes mais obedecida. O que ela faz, com certeza, é triplicar o custo dessa regra.
  3. Remova artefatos de formatação. Caracteres invisíveis, espaços repetidos e linhas decorativas de separação tokenizam, e uma fileira de quarenta hífens pode custar mais que a frase logo acima. O Remover caracteres invisíveis limpa os que você não consegue ver.
  4. Encurte as chaves do JSON em prompts estruturados. {"n": ...} em vez de {"customer_full_name": ...}, multiplicado por mil registros, faz uma diferença enorme.
  5. Envie apenas os trechos relevantes. Recuperar três parágrafos pertinentes é melhor do que colar o documento inteiro, e normalmente gera respostas melhores, além de mais baratas.

O que não ajuda: remover pontuação comum, apagar artigos ou escrever em estilo telegráfico. A economia é marginal e o estrago na qualidade da resposta não é.

Perguntas frequentes

Quantos tokens são 1.000 palavras?

Cerca de 1.300 tokens para texto comum em inglês, com base em aproximadamente 0,75 palavras por token. Código, JSON e textos em outros idiomas ficam bem acima — chinês, japonês e coreano costumam usar de um a dois tokens por caractere.

Por que a contagem de tokens é diferente no GPT e no Claude?

Cada família de modelos usa seu próprio tokenizador, com um vocabulário aprendido diferente, então o mesmo texto é dividido de formas distintas. Diferenças de 10–20% em texto em inglês são normais, e a distância é maior em código e em textos em outros idiomas.

O que é um token em um modelo de IA?

Um fragmento de texto do vocabulário fixo do modelo. Palavras comuns costumam ser um único token, enquanto palavras raras se dividem em vários pedaços — então 'unbelievable' pode virar três tokens enquanto 'international' é apenas um.

Espaços e pontuação contam como tokens?

Sim. Os espaços normalmente ficam anexados ao início do token seguinte, e a pontuação frequentemente vira um token próprio. Longas sequências de espaços repetidos ou linhas decorativas de separação podem consumir uma quantidade surpreendente.

Como posso reduzir meu uso de tokens?

Comece enxugando o histórico acumulado da conversa — em chats longos, ele domina todo o resto. Depois, remova instruções duplicadas, limpe caracteres invisíveis e espaços repetidos, encurte as chaves do JSON e envie apenas o trecho relevante do documento em vez do conteúdo inteiro.

Ferramentas mencionadas neste guia

Guias relacionados