🗺️ O Espectro de Inferência: Modelos Proprietários na Nuvem vs Open-Source Local

flowchart LR
    subgraph CLOUD ["Provedores Proprietários (OpenAI / Anthropic)"]
        C1["Fácil de usar, modelos de ponta (GPT-4o, Claude 3.5 Sonnet),\nmas gera dependência de fornecedor, custos por token e envio de dados confidenciais! ⚠️"]
    end

    subgraph LOCAL ["Inferência Open-Source Local & On-Premise"]
        L1["Llama 3, DeepSeek-R1, Mistral, Qwen"]
        L1 --> QUANT["Quantização GGUF / AWQ (FP16 -> 4-bit / Q4_K_M)\n(Reduz a VRAM necessária de 32 GB para 8 GB!) ⚡"]
        QUANT --> RUNTIME["Runtimes de Alta Vazão:\n- Ollama (Simplicidade desktop/docker)\n- vLLM (Continuous Batching & PagedAttention para produção corporativa)"]
        RUNTIME --> PRIVACY["100% Privacidade, Zero Custo por Token e Latência Determinística! 🛡️"]
    end

    style CLOUD fill:#ffebee,stroke:#d32f2f,stroke-width:2px
    style LOCAL fill:#e8f5e9,stroke:#4caf50,stroke-width:2px
    style QUANT fill:#fff3e0,stroke:#ff9800,stroke-width:1.5px
    style RUNTIME fill:#e1f5fe,stroke:#03a9f4,stroke-width:2px
    style PRIVACY fill:#00897b,stroke:#004d40,stroke-width:2px,color:#ffffff

📖 Fundamentos e Aplicação

A dependência exclusiva de APIs de nuvem traz riscos de conformidade regulatória (LGPD / GDPR), vazamento de segredos industriais e custos imprevisíveis em escala. Em 2025/2026, modelos de pesos abertos (Llama 3.3, DeepSeek, Qwen 2.5) atingiram paridade com os melhores modelos proprietários comerciais.

Tecnologias-Chave de Inferência Local:

  1. Quantização (GGUF / AWQ / GPTQ): Converte pesos flutuantes de 16 bits (FP16) em inteiros de 4 ou 8 bits com perda desprezível de perplexidade, permitindo rodar modelos de 8 bilhões de parâmetros em GPUs de entrada ou CPUs com aceleração AVX/Metal.
  2. Ollama: Empacota pesos, configurações e prompts em arquivos Modelfile, expondo uma API REST idêntica à da OpenAI localmente.
  3. vLLM e PagedAttention: O padrão de produção para clusters que gerencia a memória de KV Cache dividindo-a em páginas lógicas (semelhante à memória virtual de sistemas operacionais), multiplicando a vazão de requisições concorrentes por 5x a 10x!

🧭 Navegação Rápida

| 📖 Teoria | 📊 Slides | 🧠 Quiz | 💻 Exemplos | 🧩 Exercícios | | :— | :— | :— | :— | :— | | Ler Tópico | Ver Slides | Fazer Quiz | Ver Código | Praticar |


🧭 Navegação do Capítulo: ⬅️ Capítulo Anterior · 📚 Sumário do Módulo · ➡️ Próximo Capítulo