Pular para o conteúdo
FundamentosIniciante

O que é LLM e como funciona um modelo de linguagem

Entenda o que é um LLM, como ele prevê a próxima palavra, por que alucina e o que são treino, parâmetros e janela de contexto, com um exemplo em Python.

Por Equipe IAUAI Estudos · 8 de setembro de 2026 · 9 min de leitura

Nesta página

Ao terminar este artigo você vai saber explicar o que é um LLM, como ele produz uma resposta palavra por palavra, por que às vezes inventa informações e o que significam termos como parâmetros, janela de contexto e temperatura. Você também vai rodar um miniexemplo em Python que mostra a ideia central de prever a próxima palavra, em menos de 30 linhas.

O que é um LLM?

LLM vem do inglês Large Language Model, ou grande modelo de linguagem. É um modelo de inteligência artificial treinado com uma quantidade enorme de texto para uma tarefa aparentemente simples, prever qual pedaço de texto vem a seguir. ChatGPT, Claude e Gemini são produtos construídos sobre LLMs.

Se você ainda não leu o artigo de base, vale começar por O que é inteligência artificial. Aqui o foco é o motor que está dentro dos assistentes de texto.

Como um LLM produz uma resposta?

O processo tem quatro passos, repetidos várias vezes.

  1. O texto que você escreve é quebrado em pedaços chamados tokens. Um token pode ser uma palavra, parte de uma palavra ou um sinal de pontuação. O artigo O que é token em IA detalha isso.
  2. Cada token vira uma lista de números, e o modelo faz cálculos com esses números.
  3. O resultado do cálculo é uma distribuição de probabilidades sobre qual token poderia vir em seguida. Por exemplo, depois de "o céu está", o modelo dá probabilidade alta para "azul" ou "nublado" e muito baixa para "geladeira".
  4. O sistema escolhe um token dessa distribuição, acrescenta ao texto e repete o processo, agora com o texto um token maior. A resposta inteira surge assim, token por token.

Isso explica um comportamento que você já deve ter notado. A resposta aparece "digitando", porque está sendo gerada aos poucos.

Exemplo mínimo em Python: prever a próxima palavra

Um LLM de verdade tem bilhões de números. A ideia, porém, cabe numa tabela de contagem. O código abaixo lê um texto curtíssimo e conta quais palavras aparecem depois de cada palavra. Depois calcula a probabilidade da próxima.

from collections import Counter, defaultdict

texto = (
    "o gato subiu no telhado . o gato dormiu no sofa . "
    "o cachorro dormiu no tapete . o gato subiu no muro ."
)
palavras = texto.split()

# conta quantas vezes cada palavra aparece depois de outra
seguintes = defaultdict(Counter)
for atual, proxima in zip(palavras, palavras[1:]):
    seguintes[atual][proxima] += 1

def prever(palavra):
    contagem = seguintes[palavra]
    total = sum(contagem.values())
    return [(p, n / total) for p, n in contagem.most_common()]

print(prever("gato"))
print(prever("no"))

Saída obtida ao rodar com Python 3.12:

[('subiu', 0.6666666666666666), ('dormiu', 0.3333333333333333)]
[('telhado', 0.25), ('sofa', 0.25), ('tapete', 0.25), ('muro', 0.25)]

Depois de "gato", "subiu" tem 2 chances em 3, porque aparece duas vezes nesse texto. Depois de "no", as quatro opções empatam. Esse modelo enxerga só uma palavra para trás, então não sabe se a frase fala de um gato ou de um cachorro quando chega ao "no". Um LLM usa o texto inteiro que veio antes, e é essa diferença que faz o resultado parecer inteligente.

O que é a arquitetura Transformer?

A maior parte dos LLMs atuais usa uma arquitetura chamada Transformer, apresentada em 2017 no artigo "Attention Is All You Need". A peça central é o mecanismo de atenção. Para cada token, o modelo calcula quanto cada um dos outros tokens do texto importa para entendê-lo.

Na frase "A Maria entregou o livro para a Ana porque ela precisava dele", o que "ela" representa? Um modelo precisa ligar "ela" à pessoa certa, e a atenção é o mecanismo que permite essa ligação ao olhar para o texto todo ao mesmo tempo. Você não precisa entender a matemática para usar a ferramenta, mas é útil saber que a qualidade da resposta depende do que está no texto que o modelo recebe.

Como um LLM é treinado?

O treinamento tem em geral duas grandes etapas.

A primeira é o pré-treinamento. O modelo lê uma quantidade muito grande de texto e aprende a prever a próxima palavra. Nessa fase ele absorve gramática, fatos, estilos e padrões de raciocínio presentes nos textos. A cada erro de previsão, os parâmetros são ajustados um pouco.

A segunda é o ajuste para ser um assistente. O modelo bruto só completa texto. Para que ele siga instruções, responda com educação e recuse pedidos perigosos, os desenvolvedores o treinam com exemplos de boas conversas e com avaliações humanas, em técnicas como o aprendizado por reforço com feedback humano, descrito pela OpenAI em 2022 no artigo do InstructGPT. Cada empresa tem o seu método, e os detalhes variam.

O que são parâmetros?

Parâmetros são os números internos ajustados durante o treino. Quando se diz que um modelo tem "70 bilhões de parâmetros", fala-se de 70 bilhões desses números. Em geral, mais parâmetros dão mais capacidade, mas também exigem mais memória e mais computação, o que encarece rodar o modelo. Modelos menores são mais baratos e rápidos, e podem bastar para tarefas simples como classificar mensagens. Para ver um modelo pequeno rodando na sua máquina, leia LLM local com Ollama.

O que é janela de contexto?

É a quantidade máxima de tokens que o modelo consegue considerar de uma vez, somando o que você enviou e o que ele responde. Funciona como a mesa de trabalho do modelo. O que está na mesa ele enxerga, e o que ficou de fora é como se não existisse.

Isso tem consequências práticas. Numa conversa longa, o histórico precisa ser reenviado a cada pergunta, o que consome contexto e aumenta o custo. Se um documento é maior que a janela, é preciso dividir ou buscar só os trechos relevantes, técnica conhecida como RAG, explicada em RAG na prática. Mesmo dentro do limite, modelos podem dar menos atenção a certos trechos de um contexto muito longo, então organizar bem o que se envia faz diferença.

O que é temperatura?

No passo em que o sistema escolhe o próximo token, existe um controle de aleatoriedade chamado temperatura. Com temperatura baixa, o modelo tende a escolher quase sempre o token mais provável, o que dá respostas mais previsíveis, bom para extrair dados ou classificar. Com temperatura mais alta, escolhe também opções menos prováveis, o que traz variedade, útil para brainstorming. Nem todos os produtos expõem esse controle, então confira a documentação do serviço que você usa.

Por que o LLM alucina?

O modelo é treinado para produzir texto plausível, não para verificar se o texto é verdadeiro. Quando não tem a informação, ele ainda assim completa a frase de um jeito que soa convincente. Isso é a chamada alucinação. Ela aparece mais em datas, números, nomes de leis, citações e referências.

Algumas medidas reduzem o problema. Dê ao modelo o texto-fonte e peça para responder apenas com base nele, permita que ele diga "não sei", peça que cite o trecho usado e confira o que for importante. Mesmo assim, a revisão humana continua necessária. Para medir a taxa de erro num sistema real, veja Avaliação de LLM com evals.

LLM é a mesma coisa que ChatGPT?

Não. ChatGPT é um produto. O LLM é o modelo dentro dele. Uma empresa pode oferecer o mesmo modelo por um aplicativo de conversa, por uma API para desenvolvedores ou embutido em outro software. Também existem modelos de código aberto que você baixa e roda por conta própria.

O que os LLMs não são

  • Não são bancos de dados. Eles não guardam fatos como linhas de uma tabela, e sim padrões em números.
  • Não têm acesso automático à internet ou aos seus arquivos. Isso depende de ferramentas adicionais.
  • Não aprendem com a sua conversa em tempo real. O modelo em si não muda a cada pergunta, o que muda é o contexto que ele recebe. Se o serviço usa as suas conversas para treinar versões futuras é uma questão de política do provedor, e vale conferir.
  • Não "entendem" como uma pessoa. Fazem um trabalho muito bom de modelar linguagem, e isso resolve muita tarefa útil, mas a confiança deve vir da verificação.

Resumo

  • Um LLM é um modelo treinado para prever o próximo token, e uma resposta é uma sequência dessas previsões.
  • A arquitetura Transformer, com atenção, permite considerar o texto inteiro ao prever.
  • Parâmetros são os números ajustados no treino, e a janela de contexto é o limite de tokens por chamada.
  • Alucinação é consequência de gerar texto plausível sem verificar fatos.
  • Para praticar a ideia de tokens, jogue Caça-Tokens e experimente o tokenizador.

Fontes

Consultadas em 09/10/2026. O código acima foi executado em Python 3.12 (imagem python:3.12-slim).

Aprenda jogando

Caça-Tokens

Combine tokens para liberar espaço antes que a janela de contexto estoure.

Jogar Caça-Tokens

Teste seu conhecimento

Teste o que você aprendeu sobre LLM

Pergunta 1 de 7

O que um LLM faz, em essência, para gerar uma resposta?

Um conteúdo prático por quinzena

Deixe o seu e-mail para receber um conteúdo prático de IA e cloud a cada quinzena. Sem spam, e você pede a exclusão quando quiser.

Continue lendo