🕸️ Cap 08: Grafos de Conhecimento e GraphRAG: Extração de Entidades, Comunidades Semânticas e RAG Estruturado
🗺️ O Pipeline de Indexação e Busca do GraphRAG
flowchart TD
DOCS["Documentos Textuais Não Estruturados"]
--> EXTRACT["LLM Extrator de Entidades e Relações (Triplets: Sujeito - Predicado - Objeto)"]
EXTRACT --> GRAPH["Grafo de Conhecimento (Nós: Entidades | Arestas: Relacionamentos)"]
GRAPH --> COMMUNITY["Detecção de Comunidades Semânticas (Algoritmo de Leiden / Louvain)"]
COMMUNITY --> SUMMARIZE["LLM Gerador de Resumos Comunitários (Hierarquia de Tópicos Globais)"]
USER["Pergunta Global: 'Quais os principais temas e riscos operacionais?'"]
--> SEARCH{"Estratégia de Busca"}
SEARCH -- "Busca Global" --> SUMMARIZE
SEARCH -- "Busca Local" --> GRAPH
SUMMARIZE --> ANSWER["Resposta Holística e Conectada com Alta Cobertura Semântica ⚡"]
GRAPH --> ANSWER
style DOCS fill:#ede7f6,stroke:#512da8,stroke-width:2px
style EXTRACT fill:#fff3e0,stroke:#ff9800,stroke-width:1.5px
style GRAPH fill:#e1f5fe,stroke:#03a9f4,stroke-width:2px
style COMMUNITY fill:#fff9c4,stroke:#fbc02d,stroke-width:1.5px
style SUMMARIZE fill:#e8f5e9,stroke:#4caf50,stroke-width:2px
style USER fill:#b2dfdb,stroke:#00796b,stroke-width:1.5px
style ANSWER fill:#00897b,stroke:#004d40,stroke-width:2px,color:#ffffff
📖 Fundamentos e Aplicação
Enquanto o RAG tradicional baseado em vetores recupera apenas fragmentos isolados de texto que contêm similaridade pontual com a pergunta, o GraphRAG (Graph Retrieval-Augmented Generation) resolve a incapacidade dos modelos de responder a perguntas do tipo “Sense-Making” Global (ex.: “Qual o resumo temático de toda a base?” ou “Como o projeto X se conecta indiretamente ao departamento Y?”).
Elementos Centrais do GraphRAG:
- Extração de Entidades e Relações: O LLM processa chunks de texto identificando nós (Pessoas, Organizações, Projetos) e arestas direcionadas tipadas (TRABALHA_EM, DEPENDE_DE).
- Clusterização de Comunidades: Aplicação do algoritmo de Leiden para agrupar entidades densamente interconectadas em múltiplos níveis de abstração hierárquica.
- Resumos Comunitários Pré-Calculados: Cada cluster recebe um sumário sintetizado pelo LLM, permitindo consultas temáticas agregadas com altíssima precisão e economia de tokens em tempo de execução.
🧭 Navegação Rápida
| 📖 Teoria | 📊 Slides | 🧠 Quiz | 💻 Exemplos | 🧩 Exercícios | | :— | :— | :— | :— | :— | | Ler Tópico | Ver Slides | Fazer Quiz | Ver Código | Praticar |
🧭 Navegação do Capítulo: ⬅️ Capítulo Anterior · 📚 Sumário do Módulo · ➡️ Próximo Capítulo