Pular para o conteúdo
FundamentosIniciante

O que é token em IA e por que ele define o seu custo

Entenda o que é token em IA, como contar tokens de um texto em português e calcular o custo em reais de uma chamada de API com preços oficiais datados.

Por Equipe IAUAI Estudos · 7 de outubro de 2026 · 9 min de leitura

Nesta página

Ao final deste artigo você vai saber o que é um token, estimar quantos tokens tem um texto em português, e calcular em reais quanto custa uma chamada de API e um mês de atendimento com IA, usando preços oficiais conferidos em 09/10/2026. Você também vai ver quatro hábitos que reduzem a conta sem piorar o resultado.

O que é um token?

Token é o pedaço de texto que o modelo de IA usa como unidade. Não é exatamente uma palavra. Pode ser uma palavra inteira comum, um pedaço de palavra, uma sílaba, um sinal de pontuação ou um espaço. O modelo não lê letras nem palavras como nós. Ele recebe uma sequência de tokens, cada um associado a um número, e gera uma sequência de tokens como resposta. O artigo O que é LLM e como funciona um modelo de linguagem mostra onde isso entra no processo.

Para ver na prática, usamos a biblioteca tiktoken (versão 0.14.0), que implementa os tokenizadores da OpenAI, com a codificação o200k_base:

import tiktoken

enc = tiktoken.get_encoding("o200k_base")
print([enc.decode([i]) for i in enc.encode("inteligência artificial")])
print([enc.decode([i]) for i in enc.encode("anticonstitucionalissimamente")])

Saída obtida ao rodar em Python 3.12:

['int', 'elig', 'ência', ' artificial']
['ant', 'icon', 'stit', 'ucional', 'issim', 'amente']

"Inteligência" virou três tokens e "artificial" (com o espaço) virou um. A palavra longa virou seis. Palavras comuns e curtas tendem a ser um token só, e palavras raras ou longas são partidas em pedaços.

Quantos tokens tem um texto em português?

Depende do tokenizador, e cada fornecedor usa o seu. Por isso não existe uma conversão única e exata. Medimos uma frase em português e a sua versão em inglês com dois tokenizadores da OpenAI:

Texto Palavras Tokens (cl100k_base) Tokens (o200k_base)
"A inteligência artificial ajuda a atender clientes mais rápido, mas é preciso revisar as respostas." 15 24 17
"Artificial intelligence helps serve customers faster, but the answers need to be reviewed." 13 16 15

Duas leituras possíveis. O português gerou mais tokens do que o inglês nos dois casos, porque acentos e palavras mais longas costumam ser quebrados em mais pedaços. E tokenizadores mais novos reduziram a diferença (de 24 para 17 no português). É uma amostra de uma frase, não um estudo, mas mostra por que você deve medir o seu texto, e não confiar numa regra de bolso.

A Anthropic também avisa na página de preços que os modelos Claude 4.7 e posteriores usam um tokenizador novo que produz aproximadamente 30% mais tokens para o mesmo texto, com variação conforme o conteúdo. Ou seja, o mesmo texto pode ter contagens diferentes entre fornecedores e até entre versões de modelos do mesmo fornecedor.

Como regra de bolso, para fazer orçamento use uma estimativa e depois meça. Uma estimativa nossa, a ser confirmada no seu caso, é considerar algo entre 1,1 e 1,6 token por palavra em português. Para medir de verdade, cole o seu texto no tokenizador do portal ou use a contagem de tokens da API do fornecedor.

Por que o token define o custo?

As APIs de IA cobram por token, separando o que você envia (entrada) do que o modelo gera (saída). A saída costuma custar bem mais por token do que a entrada. Os preços são informados por milhão de tokens, abreviado como MTok.

Preços oficiais da Anthropic, conferidos na página de preços em 09/10/2026, por milhão de tokens:

Modelo Entrada Saída
Claude Sonnet 5.5 US$ 2 US$ 10
Claude Haiku 5.5 (prompts até 100 mil tokens) US$ 0,10 US$ 0,50
Claude Haiku 5.5 (prompts acima de 100 mil tokens) US$ 0,50 US$ 2,50
Claude Opus 5.5 US$ 4 US$ 20

Para converter em reais usamos o dólar PTAX de venda do Banco Central do Brasil, de 08/10/2026 (cotação mais recente disponível na consulta): R$ 5,0119. A sua fatura real vai usar o câmbio e os impostos do seu cartão ou do seu contrato, então trate os valores em reais como referência.

Como calcular o custo de uma chamada?

A fórmula é simples.

custo (US$) = tokens de entrada x preço de entrada / 1.000.000
            + tokens de saída   x preço de saída   / 1.000.000

Os tamanhos de entrada e saída abaixo são hipóteses nossas para ilustrar a conta, não medições.

Exemplo 1: uma resposta de atendimento

Hipótese: 800 tokens de entrada (instruções, pergunta e um trecho da base de conhecimento) e 300 tokens de saída.

  • Sonnet 5.5: 800 x 2 / 1.000.000 = US$ 0,0016 de entrada; 300 x 10 / 1.000.000 = US$ 0,0030 de saída; total US$ 0,0046, cerca de R$ 0,023.
  • Haiku 5.5: US$ 0,00008 mais US$ 0,00015, total US$ 0,00023, cerca de R$ 0,0012.

Se o seu atendimento tiver 1.000 conversas por dia durante 30 dias, com uma chamada por conversa, são 30.000 chamadas. No Sonnet 5.5 dá US$ 138, cerca de R$ 692 por mês. No Haiku 5.5 dá US$ 6,90, cerca de R$ 34,58 por mês. A escolha do modelo, portanto, muda a conta em 20 vezes. A qualidade também muda, então teste os dois com casos reais antes de decidir, como no artigo de avaliação de LLM com evals.

Exemplo 2: resumir um documento longo

Hipótese: um PDF com 20.000 tokens de entrada e um resumo de 700 tokens.

  • Sonnet 5.5: 20.000 x 2 / 1.000.000 = US$ 0,040; 700 x 10 / 1.000.000 = US$ 0,007; total US$ 0,047, cerca de R$ 0,24 por documento.
  • Cem documentos custam US$ 4,70, cerca de R$ 23,56.

Documentos longos pesam na entrada, e respostas longas pesam na saída. Se o resumo precisa de 200 palavras, peça isso, em vez de deixar o modelo escrever o quanto quiser.

Exemplo 3: por que conversa longa fica cara

Numa conversa, cada nova pergunta reenvia o histórico. Hipótese: 10 trocas, em que a pessoa escreve 100 tokens e o modelo responde 200 em cada uma.

  • Na troca k, a entrada é 300 x (k - 1) + 100 tokens. Somando as 10 trocas, a entrada total é 14.500 tokens, e a saída total é 2.000.
  • Sonnet 5.5: 14.500 x 2 / 1.000.000 = US$ 0,029; 2.000 x 10 / 1.000.000 = US$ 0,020; total US$ 0,049, cerca de R$ 0,25.
  • Se cada pergunta fosse independente, sem histórico, a entrada seria de 1.000 tokens e o total ficaria em US$ 0,022.

A conversa custou mais que o dobro por causa do histórico reenviado. Quanto maior a conversa, mais o custo cresce.

Como reduzir o custo sem piorar a resposta?

  1. Escolha o modelo certo para cada tarefa. Classificação e extração costumam funcionar bem com modelos menores. Deixe os maiores para raciocínio difícil.
  2. Corte contexto desnecessário. Envie só os trechos que importam, em vez do documento inteiro. O artigo Chunking: estratégias mostra como dividir bem.
  3. Use cache de prompt. Para a parte fixa do prompt, a Anthropic lista na mesma página de preços um valor de leitura de cache bem menor que o de entrada normal. Para o Sonnet 5.5, US$ 0,10 por milhão contra US$ 2 da entrada comum, e para o Haiku 5.5, US$ 0,01 contra US$ 0,10. As regras de duração e tamanho mínimo estão na documentação.
  4. Limite a saída. Peça formato e tamanho, e defina um teto de tokens de saída na chamada.

Para uma visão mais ampla de custos, incluindo GPU e rastreamento, leia FinOps para IA. Para simular com o seu volume, use a calculadora de custo de LLM.

E os planos de assinatura, como o ChatGPT Plus?

Os aplicativos de conversa cobram uma mensalidade fixa com limites de uso, e não por token. A conta por token se aplica a quem usa a API, ou seja, a quem constrói sistemas, ou a empresas que contratam uma solução baseada em API. Para quem decide sobre isso numa empresa, o post do blog A IA ficou mais barata em setembro comenta o efeito dos preços no custo de automatizar.

Resumo

  • Token é o pedaço de texto que o modelo processa, e não é o mesmo que palavra.
  • Em português, a contagem tende a ser maior que em inglês, e varia por fornecedor. Meça o seu texto.
  • O custo é tokens de entrada vezes preço de entrada, mais tokens de saída vezes preço de saída.
  • Histórico de conversa, documentos longos e respostas longas são os maiores vilões da conta.
  • Modelo menor, menos contexto, cache e limite de saída reduzem custo.

Os preços mudam com frequência. Confira sempre a página oficial antes de decidir.

Fontes

  • Anthropic, "Pricing" (preços por milhão de tokens e nota sobre o tokenizador), consultado em 09/10/2026: platform.claude.com/docs/en/about-claude/pricing
  • Banco Central do Brasil, cotação PTAX do dólar (venda R$ 5,0119 em 08/10/2026), API Olinda, consultada em 09/10/2026: bcb.gov.br
  • OpenAI, biblioteca tiktoken 0.14.0, usada para contar tokens: github.com/openai/tiktoken
  • Os tamanhos de entrada e saída dos exemplos e a faixa de 1,1 a 1,6 token por palavra (calculada a partir das duas frases medidas acima) são estimativas da equipe, não medições gerais.

Aprenda jogando

Caça-Tokens

Combine tokens para liberar espaço antes que a janela de contexto estoure.

Jogar Caça-Tokens

Teste seu conhecimento

Teste o que você aprendeu sobre tokens e custo

Pergunta 1 de 7

O que é um token?

Um conteúdo prático por quinzena

Deixe o seu e-mail para receber um conteúdo prático de IA e cloud a cada quinzena. Sem spam, e você pede a exclusão quando quiser.

Continue lendo