📊 Cap 19: Avaliação & LLMOps
AI Engineering • Métricas RAG Triad, Ragas e Observabilidade Contínua
🗺️ As Três Pontas da RAG Triad para Diagnóstico de Falhas
flowchart TD
Q["Query do Usuário"]
C["Contexto Recuperado"]
A["Resposta Gerada pelo LLM"]
Q <--> |"Context Relevance (Recuperador foi bem?)"| C
C <--> |"Groundedness / Faithfulness (Houve alucinação?)"| A
Q <--> |"Answer Relevance (Respondeu o que foi pedido?)"| A
style Q fill:#ede7f6,stroke:#512da8,stroke-width:2px
style C fill:#e1f5fe,stroke:#03a9f4,stroke-width:2px
style A fill:#e8f5e9,stroke:#4caf50,stroke-width:2px
🎯 Slide 1: Por Que Não Dá para Confiar em “Vibe Checks”?
-
Testar prompts manualmente em 5 exemplos não garante estabilidade em produção.
- Problemas Críticos:
- Mudanças sutis de prompt podem resolver um caso e quebrar outros 20.
- Alucinações ocorrem em frequências difíceis de prever sem testes automatizados contínuos.
🎯 Slide 2: O Framework Ragas & LLM-as-a-Judge
-
Usa modelos de alta capacidade (como GPT-4o) para avaliar modelos de menor custo (como GPT-4o-mini ou Llama 3 local).
- Métricas Principais:
- Faithfulness: Se a resposta só contém fatos presentes no contexto.
- Answer Relevance: Se a resposta não contém enrolação desnecessária.
- Context Precision & Recall: Qualidade do ranqueador de busca.
🎯 Slide 3: Tracing e Gestão de Custos com LangSmith
- Visibilidade de cada nó no grafo:
- Tempo gasto em cada chamada de API.
- Tokens de entrada vs tokens de saída.
- Gráficos de custos em dólares por usuário, endpoint e departamento!
🔗 Navegação do Capítulo 19
| 📖 Ler Conteúdo Completo | 🧠 Fazer Quiz | 💻 Ver Exemplos | 🧩 Exercícios |
Slide 1 de 1
Atalhos: ← → Navegar • Espaço Avançar • F Tela Cheia • Home Início • End Fim