Ao terminar este artigo você vai saber explicar o que é um LLM, como ele produz uma resposta palavra por palavra, por que às vezes inventa informações e o que significam termos como parâmetros, janela de contexto e temperatura. Você também vai rodar um miniexemplo em Python que mostra a ideia central de prever a próxima palavra, em menos de 30 linhas.
O que é um LLM?
LLM vem do inglês Large Language Model, ou grande modelo de linguagem. É um modelo de inteligência artificial treinado com uma quantidade enorme de texto para uma tarefa aparentemente simples, prever qual pedaço de texto vem a seguir. ChatGPT, Claude e Gemini são produtos construídos sobre LLMs.
Se você ainda não leu o artigo de base, vale começar por O que é inteligência artificial. Aqui o foco é o motor que está dentro dos assistentes de texto.
Como um LLM produz uma resposta?
O processo tem quatro passos, repetidos várias vezes.
- O texto que você escreve é quebrado em pedaços chamados tokens. Um token pode ser uma palavra, parte de uma palavra ou um sinal de pontuação. O artigo O que é token em IA detalha isso.
- Cada token vira uma lista de números, e o modelo faz cálculos com esses números.
- O resultado do cálculo é uma distribuição de probabilidades sobre qual token poderia vir em seguida. Por exemplo, depois de "o céu está", o modelo dá probabilidade alta para "azul" ou "nublado" e muito baixa para "geladeira".
- O sistema escolhe um token dessa distribuição, acrescenta ao texto e repete o processo, agora com o texto um token maior. A resposta inteira surge assim, token por token.
Isso explica um comportamento que você já deve ter notado. A resposta aparece "digitando", porque está sendo gerada aos poucos.
Exemplo mínimo em Python: prever a próxima palavra
Um LLM de verdade tem bilhões de números. A ideia, porém, cabe numa tabela de contagem. O código abaixo lê um texto curtíssimo e conta quais palavras aparecem depois de cada palavra. Depois calcula a probabilidade da próxima.
from collections import Counter, defaultdict
texto = (
"o gato subiu no telhado . o gato dormiu no sofa . "
"o cachorro dormiu no tapete . o gato subiu no muro ."
)
palavras = texto.split()
# conta quantas vezes cada palavra aparece depois de outra
seguintes = defaultdict(Counter)
for atual, proxima in zip(palavras, palavras[1:]):
seguintes[atual][proxima] += 1
def prever(palavra):
contagem = seguintes[palavra]
total = sum(contagem.values())
return [(p, n / total) for p, n in contagem.most_common()]
print(prever("gato"))
print(prever("no"))
Saída obtida ao rodar com Python 3.12:
[('subiu', 0.6666666666666666), ('dormiu', 0.3333333333333333)]
[('telhado', 0.25), ('sofa', 0.25), ('tapete', 0.25), ('muro', 0.25)]
Depois de "gato", "subiu" tem 2 chances em 3, porque aparece duas vezes nesse texto. Depois de "no", as quatro opções empatam. Esse modelo enxerga só uma palavra para trás, então não sabe se a frase fala de um gato ou de um cachorro quando chega ao "no". Um LLM usa o texto inteiro que veio antes, e é essa diferença que faz o resultado parecer inteligente.
O que é a arquitetura Transformer?
A maior parte dos LLMs atuais usa uma arquitetura chamada Transformer, apresentada em 2017 no artigo "Attention Is All You Need". A peça central é o mecanismo de atenção. Para cada token, o modelo calcula quanto cada um dos outros tokens do texto importa para entendê-lo.
Na frase "A Maria entregou o livro para a Ana porque ela precisava dele", o que "ela" representa? Um modelo precisa ligar "ela" à pessoa certa, e a atenção é o mecanismo que permite essa ligação ao olhar para o texto todo ao mesmo tempo. Você não precisa entender a matemática para usar a ferramenta, mas é útil saber que a qualidade da resposta depende do que está no texto que o modelo recebe.
Como um LLM é treinado?
O treinamento tem em geral duas grandes etapas.
A primeira é o pré-treinamento. O modelo lê uma quantidade muito grande de texto e aprende a prever a próxima palavra. Nessa fase ele absorve gramática, fatos, estilos e padrões de raciocínio presentes nos textos. A cada erro de previsão, os parâmetros são ajustados um pouco.
A segunda é o ajuste para ser um assistente. O modelo bruto só completa texto. Para que ele siga instruções, responda com educação e recuse pedidos perigosos, os desenvolvedores o treinam com exemplos de boas conversas e com avaliações humanas, em técnicas como o aprendizado por reforço com feedback humano, descrito pela OpenAI em 2022 no artigo do InstructGPT. Cada empresa tem o seu método, e os detalhes variam.
O que são parâmetros?
Parâmetros são os números internos ajustados durante o treino. Quando se diz que um modelo tem "70 bilhões de parâmetros", fala-se de 70 bilhões desses números. Em geral, mais parâmetros dão mais capacidade, mas também exigem mais memória e mais computação, o que encarece rodar o modelo. Modelos menores são mais baratos e rápidos, e podem bastar para tarefas simples como classificar mensagens. Para ver um modelo pequeno rodando na sua máquina, leia LLM local com Ollama.
O que é janela de contexto?
É a quantidade máxima de tokens que o modelo consegue considerar de uma vez, somando o que você enviou e o que ele responde. Funciona como a mesa de trabalho do modelo. O que está na mesa ele enxerga, e o que ficou de fora é como se não existisse.
Isso tem consequências práticas. Numa conversa longa, o histórico precisa ser reenviado a cada pergunta, o que consome contexto e aumenta o custo. Se um documento é maior que a janela, é preciso dividir ou buscar só os trechos relevantes, técnica conhecida como RAG, explicada em RAG na prática. Mesmo dentro do limite, modelos podem dar menos atenção a certos trechos de um contexto muito longo, então organizar bem o que se envia faz diferença.
O que é temperatura?
No passo em que o sistema escolhe o próximo token, existe um controle de aleatoriedade chamado temperatura. Com temperatura baixa, o modelo tende a escolher quase sempre o token mais provável, o que dá respostas mais previsíveis, bom para extrair dados ou classificar. Com temperatura mais alta, escolhe também opções menos prováveis, o que traz variedade, útil para brainstorming. Nem todos os produtos expõem esse controle, então confira a documentação do serviço que você usa.
Por que o LLM alucina?
O modelo é treinado para produzir texto plausível, não para verificar se o texto é verdadeiro. Quando não tem a informação, ele ainda assim completa a frase de um jeito que soa convincente. Isso é a chamada alucinação. Ela aparece mais em datas, números, nomes de leis, citações e referências.
Algumas medidas reduzem o problema. Dê ao modelo o texto-fonte e peça para responder apenas com base nele, permita que ele diga "não sei", peça que cite o trecho usado e confira o que for importante. Mesmo assim, a revisão humana continua necessária. Para medir a taxa de erro num sistema real, veja Avaliação de LLM com evals.
LLM é a mesma coisa que ChatGPT?
Não. ChatGPT é um produto. O LLM é o modelo dentro dele. Uma empresa pode oferecer o mesmo modelo por um aplicativo de conversa, por uma API para desenvolvedores ou embutido em outro software. Também existem modelos de código aberto que você baixa e roda por conta própria.
O que os LLMs não são
- Não são bancos de dados. Eles não guardam fatos como linhas de uma tabela, e sim padrões em números.
- Não têm acesso automático à internet ou aos seus arquivos. Isso depende de ferramentas adicionais.
- Não aprendem com a sua conversa em tempo real. O modelo em si não muda a cada pergunta, o que muda é o contexto que ele recebe. Se o serviço usa as suas conversas para treinar versões futuras é uma questão de política do provedor, e vale conferir.
- Não "entendem" como uma pessoa. Fazem um trabalho muito bom de modelar linguagem, e isso resolve muita tarefa útil, mas a confiança deve vir da verificação.
Resumo
- Um LLM é um modelo treinado para prever o próximo token, e uma resposta é uma sequência dessas previsões.
- A arquitetura Transformer, com atenção, permite considerar o texto inteiro ao prever.
- Parâmetros são os números ajustados no treino, e a janela de contexto é o limite de tokens por chamada.
- Alucinação é consequência de gerar texto plausível sem verificar fatos.
- Para praticar a ideia de tokens, jogue Caça-Tokens e experimente o tokenizador.
Fontes
Consultadas em 09/10/2026. O código acima foi executado em Python 3.12 (imagem python:3.12-slim).
- Vaswani et al., "Attention Is All You Need", 2017: arxiv.org/abs/1706.03762
- Ouyang et al., "Training language models to follow instructions with human feedback" (InstructGPT), 2022: arxiv.org/abs/2203.02155