Rodando um LLM local com Ollama
Configure um LLM local com Ollama em 5 minutos. Entenda quantização (Q4, Q8), RAM necessário e quando local compensa frente a APIs pagas.
Conteúdo
Código que roda, números reais e o trade-off explícito de quando não usar. Filtre por categoria, nível ou tag.
Configure um LLM local com Ollama em 5 minutos. Entenda quantização (Q4, Q8), RAM necessário e quando local compensa frente a APIs pagas.
Reduza sua imagem Docker de 1,2 GB para 80 MB com multi-stage. Dockerfile antes e depois, cache de layer, imagens base e .dockerignore com exemplos medidos.
Workflow GitHub Actions: lint, testes, build, deploy. Cache de dependências, matriz de versões, secrets seguros, aprovação manual, armadilhas de custo.
Estruture prompts para produção com papel, contexto, tarefa, formato, exemplos. Teste, versione e force schema JSON.
Traduza Compose em Kubernetes manifest por manifest. Pod, Deployment, Service, ConfigMap e por que depends_on não existe.
Crie infra com código, não com clicks. Init, plan, apply, destroy: o ciclo de vida explicado com exemplo real.