Ao final deste artigo você vai saber o que é um token, estimar quantos tokens tem um texto em português, e calcular em reais quanto custa uma chamada de API e um mês de atendimento com IA, usando preços oficiais conferidos em 09/10/2026. Você também vai ver quatro hábitos que reduzem a conta sem piorar o resultado.
O que é um token?
Token é o pedaço de texto que o modelo de IA usa como unidade. Não é exatamente uma palavra. Pode ser uma palavra inteira comum, um pedaço de palavra, uma sílaba, um sinal de pontuação ou um espaço. O modelo não lê letras nem palavras como nós. Ele recebe uma sequência de tokens, cada um associado a um número, e gera uma sequência de tokens como resposta. O artigo O que é LLM e como funciona um modelo de linguagem mostra onde isso entra no processo.
Para ver na prática, usamos a biblioteca tiktoken (versão 0.14.0), que implementa os tokenizadores da OpenAI, com a codificação o200k_base:
import tiktoken
enc = tiktoken.get_encoding("o200k_base")
print([enc.decode([i]) for i in enc.encode("inteligência artificial")])
print([enc.decode([i]) for i in enc.encode("anticonstitucionalissimamente")])
Saída obtida ao rodar em Python 3.12:
['int', 'elig', 'ência', ' artificial']
['ant', 'icon', 'stit', 'ucional', 'issim', 'amente']
"Inteligência" virou três tokens e "artificial" (com o espaço) virou um. A palavra longa virou seis. Palavras comuns e curtas tendem a ser um token só, e palavras raras ou longas são partidas em pedaços.
Quantos tokens tem um texto em português?
Depende do tokenizador, e cada fornecedor usa o seu. Por isso não existe uma conversão única e exata. Medimos uma frase em português e a sua versão em inglês com dois tokenizadores da OpenAI:
| Texto | Palavras | Tokens (cl100k_base) | Tokens (o200k_base) |
|---|---|---|---|
| "A inteligência artificial ajuda a atender clientes mais rápido, mas é preciso revisar as respostas." | 15 | 24 | 17 |
| "Artificial intelligence helps serve customers faster, but the answers need to be reviewed." | 13 | 16 | 15 |
Duas leituras possíveis. O português gerou mais tokens do que o inglês nos dois casos, porque acentos e palavras mais longas costumam ser quebrados em mais pedaços. E tokenizadores mais novos reduziram a diferença (de 24 para 17 no português). É uma amostra de uma frase, não um estudo, mas mostra por que você deve medir o seu texto, e não confiar numa regra de bolso.
A Anthropic também avisa na página de preços que os modelos Claude 4.7 e posteriores usam um tokenizador novo que produz aproximadamente 30% mais tokens para o mesmo texto, com variação conforme o conteúdo. Ou seja, o mesmo texto pode ter contagens diferentes entre fornecedores e até entre versões de modelos do mesmo fornecedor.
Como regra de bolso, para fazer orçamento use uma estimativa e depois meça. Uma estimativa nossa, a ser confirmada no seu caso, é considerar algo entre 1,1 e 1,6 token por palavra em português. Para medir de verdade, cole o seu texto no tokenizador do portal ou use a contagem de tokens da API do fornecedor.
Por que o token define o custo?
As APIs de IA cobram por token, separando o que você envia (entrada) do que o modelo gera (saída). A saída costuma custar bem mais por token do que a entrada. Os preços são informados por milhão de tokens, abreviado como MTok.
Preços oficiais da Anthropic, conferidos na página de preços em 09/10/2026, por milhão de tokens:
| Modelo | Entrada | Saída |
|---|---|---|
| Claude Sonnet 5.5 | US$ 2 | US$ 10 |
| Claude Haiku 5.5 (prompts até 100 mil tokens) | US$ 0,10 | US$ 0,50 |
| Claude Haiku 5.5 (prompts acima de 100 mil tokens) | US$ 0,50 | US$ 2,50 |
| Claude Opus 5.5 | US$ 4 | US$ 20 |
Para converter em reais usamos o dólar PTAX de venda do Banco Central do Brasil, de 08/10/2026 (cotação mais recente disponível na consulta): R$ 5,0119. A sua fatura real vai usar o câmbio e os impostos do seu cartão ou do seu contrato, então trate os valores em reais como referência.
Como calcular o custo de uma chamada?
A fórmula é simples.
custo (US$) = tokens de entrada x preço de entrada / 1.000.000
+ tokens de saída x preço de saída / 1.000.000
Os tamanhos de entrada e saída abaixo são hipóteses nossas para ilustrar a conta, não medições.
Exemplo 1: uma resposta de atendimento
Hipótese: 800 tokens de entrada (instruções, pergunta e um trecho da base de conhecimento) e 300 tokens de saída.
- Sonnet 5.5: 800 x 2 / 1.000.000 = US$ 0,0016 de entrada; 300 x 10 / 1.000.000 = US$ 0,0030 de saída; total US$ 0,0046, cerca de R$ 0,023.
- Haiku 5.5: US$ 0,00008 mais US$ 0,00015, total US$ 0,00023, cerca de R$ 0,0012.
Se o seu atendimento tiver 1.000 conversas por dia durante 30 dias, com uma chamada por conversa, são 30.000 chamadas. No Sonnet 5.5 dá US$ 138, cerca de R$ 692 por mês. No Haiku 5.5 dá US$ 6,90, cerca de R$ 34,58 por mês. A escolha do modelo, portanto, muda a conta em 20 vezes. A qualidade também muda, então teste os dois com casos reais antes de decidir, como no artigo de avaliação de LLM com evals.
Exemplo 2: resumir um documento longo
Hipótese: um PDF com 20.000 tokens de entrada e um resumo de 700 tokens.
- Sonnet 5.5: 20.000 x 2 / 1.000.000 = US$ 0,040; 700 x 10 / 1.000.000 = US$ 0,007; total US$ 0,047, cerca de R$ 0,24 por documento.
- Cem documentos custam US$ 4,70, cerca de R$ 23,56.
Documentos longos pesam na entrada, e respostas longas pesam na saída. Se o resumo precisa de 200 palavras, peça isso, em vez de deixar o modelo escrever o quanto quiser.
Exemplo 3: por que conversa longa fica cara
Numa conversa, cada nova pergunta reenvia o histórico. Hipótese: 10 trocas, em que a pessoa escreve 100 tokens e o modelo responde 200 em cada uma.
- Na troca k, a entrada é 300 x (k - 1) + 100 tokens. Somando as 10 trocas, a entrada total é 14.500 tokens, e a saída total é 2.000.
- Sonnet 5.5: 14.500 x 2 / 1.000.000 = US$ 0,029; 2.000 x 10 / 1.000.000 = US$ 0,020; total US$ 0,049, cerca de R$ 0,25.
- Se cada pergunta fosse independente, sem histórico, a entrada seria de 1.000 tokens e o total ficaria em US$ 0,022.
A conversa custou mais que o dobro por causa do histórico reenviado. Quanto maior a conversa, mais o custo cresce.
Como reduzir o custo sem piorar a resposta?
- Escolha o modelo certo para cada tarefa. Classificação e extração costumam funcionar bem com modelos menores. Deixe os maiores para raciocínio difícil.
- Corte contexto desnecessário. Envie só os trechos que importam, em vez do documento inteiro. O artigo Chunking: estratégias mostra como dividir bem.
- Use cache de prompt. Para a parte fixa do prompt, a Anthropic lista na mesma página de preços um valor de leitura de cache bem menor que o de entrada normal. Para o Sonnet 5.5, US$ 0,10 por milhão contra US$ 2 da entrada comum, e para o Haiku 5.5, US$ 0,01 contra US$ 0,10. As regras de duração e tamanho mínimo estão na documentação.
- Limite a saída. Peça formato e tamanho, e defina um teto de tokens de saída na chamada.
Para uma visão mais ampla de custos, incluindo GPU e rastreamento, leia FinOps para IA. Para simular com o seu volume, use a calculadora de custo de LLM.
E os planos de assinatura, como o ChatGPT Plus?
Os aplicativos de conversa cobram uma mensalidade fixa com limites de uso, e não por token. A conta por token se aplica a quem usa a API, ou seja, a quem constrói sistemas, ou a empresas que contratam uma solução baseada em API. Para quem decide sobre isso numa empresa, o post do blog A IA ficou mais barata em setembro comenta o efeito dos preços no custo de automatizar.
Resumo
- Token é o pedaço de texto que o modelo processa, e não é o mesmo que palavra.
- Em português, a contagem tende a ser maior que em inglês, e varia por fornecedor. Meça o seu texto.
- O custo é tokens de entrada vezes preço de entrada, mais tokens de saída vezes preço de saída.
- Histórico de conversa, documentos longos e respostas longas são os maiores vilões da conta.
- Modelo menor, menos contexto, cache e limite de saída reduzem custo.
Os preços mudam com frequência. Confira sempre a página oficial antes de decidir.
Fontes
- Anthropic, "Pricing" (preços por milhão de tokens e nota sobre o tokenizador), consultado em 09/10/2026: platform.claude.com/docs/en/about-claude/pricing
- Banco Central do Brasil, cotação PTAX do dólar (venda R$ 5,0119 em 08/10/2026), API Olinda, consultada em 09/10/2026: bcb.gov.br
- OpenAI, biblioteca tiktoken 0.14.0, usada para contar tokens: github.com/openai/tiktoken
- Os tamanhos de entrada e saída dos exemplos e a faixa de 1,1 a 1,6 token por palavra (calculada a partir das duas frases medidas acima) são estimativas da equipe, não medições gerais.