💻 Cap 18: Inferência Local e Open-Source: Ollama, vLLM, Formatos GGUF e Técnicas de Quantização (4-bit/8-bit)
🗺️ O Espectro de Inferência: Modelos Proprietários na Nuvem vs Open-Source Local
flowchart LR
subgraph CLOUD ["Provedores Proprietários (OpenAI / Anthropic)"]
C1["Fácil de usar, modelos de ponta (GPT-4o, Claude 3.5 Sonnet),\nmas gera dependência de fornecedor, custos por token e envio de dados confidenciais! ⚠️"]
end
subgraph LOCAL ["Inferência Open-Source Local & On-Premise"]
L1["Llama 3, DeepSeek-R1, Mistral, Qwen"]
L1 --> QUANT["Quantização GGUF / AWQ (FP16 -> 4-bit / Q4_K_M)\n(Reduz a VRAM necessária de 32 GB para 8 GB!) ⚡"]
QUANT --> RUNTIME["Runtimes de Alta Vazão:\n- Ollama (Simplicidade desktop/docker)\n- vLLM (Continuous Batching & PagedAttention para produção corporativa)"]
RUNTIME --> PRIVACY["100% Privacidade, Zero Custo por Token e Latência Determinística! 🛡️"]
end
style CLOUD fill:#ffebee,stroke:#d32f2f,stroke-width:2px
style LOCAL fill:#e8f5e9,stroke:#4caf50,stroke-width:2px
style QUANT fill:#fff3e0,stroke:#ff9800,stroke-width:1.5px
style RUNTIME fill:#e1f5fe,stroke:#03a9f4,stroke-width:2px
style PRIVACY fill:#00897b,stroke:#004d40,stroke-width:2px,color:#ffffff
📖 Fundamentos e Aplicação
A dependência exclusiva de APIs de nuvem traz riscos de conformidade regulatória (LGPD / GDPR), vazamento de segredos industriais e custos imprevisíveis em escala. Em 2025/2026, modelos de pesos abertos (Llama 3.3, DeepSeek, Qwen 2.5) atingiram paridade com os melhores modelos proprietários comerciais.
Tecnologias-Chave de Inferência Local:
- Quantização (GGUF / AWQ / GPTQ): Converte pesos flutuantes de 16 bits (
FP16) em inteiros de 4 ou 8 bits com perda desprezível de perplexidade, permitindo rodar modelos de 8 bilhões de parâmetros em GPUs de entrada ou CPUs com aceleração AVX/Metal. - Ollama: Empacota pesos, configurações e prompts em arquivos Modelfile, expondo uma API REST idêntica à da OpenAI localmente.
- vLLM e PagedAttention: O padrão de produção para clusters que gerencia a memória de KV Cache dividindo-a em páginas lógicas (semelhante à memória virtual de sistemas operacionais), multiplicando a vazão de requisições concorrentes por 5x a 10x!
🧭 Navegação Rápida
| 📖 Teoria | 📊 Slides | 🧠 Quiz | 💻 Exemplos | 🧩 Exercícios | | :— | :— | :— | :— | :— | | Ler Tópico | Ver Slides | Fazer Quiz | Ver Código | Praticar |
🧭 Navegação do Capítulo: ⬅️ Capítulo Anterior · 📚 Sumário do Módulo · ➡️ Próximo Capítulo