🗺️ O Pipeline de Indexação e Busca do GraphRAG

flowchart TD
    DOCS["Documentos Textuais Não Estruturados"]
    --> EXTRACT["LLM Extrator de Entidades e Relações (Triplets: Sujeito - Predicado - Objeto)"]
    EXTRACT --> GRAPH["Grafo de Conhecimento (Nós: Entidades | Arestas: Relacionamentos)"]
    GRAPH --> COMMUNITY["Detecção de Comunidades Semânticas (Algoritmo de Leiden / Louvain)"]
    COMMUNITY --> SUMMARIZE["LLM Gerador de Resumos Comunitários (Hierarquia de Tópicos Globais)"]
    
    USER["Pergunta Global: 'Quais os principais temas e riscos operacionais?'"]
    --> SEARCH{"Estratégia de Busca"}
    SEARCH -- "Busca Global" --> SUMMARIZE
    SEARCH -- "Busca Local" --> GRAPH
    
    SUMMARIZE --> ANSWER["Resposta Holística e Conectada com Alta Cobertura Semântica ⚡"]
    GRAPH --> ANSWER

    style DOCS fill:#ede7f6,stroke:#512da8,stroke-width:2px
    style EXTRACT fill:#fff3e0,stroke:#ff9800,stroke-width:1.5px
    style GRAPH fill:#e1f5fe,stroke:#03a9f4,stroke-width:2px
    style COMMUNITY fill:#fff9c4,stroke:#fbc02d,stroke-width:1.5px
    style SUMMARIZE fill:#e8f5e9,stroke:#4caf50,stroke-width:2px
    style USER fill:#b2dfdb,stroke:#00796b,stroke-width:1.5px
    style ANSWER fill:#00897b,stroke:#004d40,stroke-width:2px,color:#ffffff

📖 Fundamentos e Aplicação

Enquanto o RAG tradicional baseado em vetores recupera apenas fragmentos isolados de texto que contêm similaridade pontual com a pergunta, o GraphRAG (Graph Retrieval-Augmented Generation) resolve a incapacidade dos modelos de responder a perguntas do tipo “Sense-Making” Global (ex.: “Qual o resumo temático de toda a base?” ou “Como o projeto X se conecta indiretamente ao departamento Y?”).

Elementos Centrais do GraphRAG:

  1. Extração de Entidades e Relações: O LLM processa chunks de texto identificando nós (Pessoas, Organizações, Projetos) e arestas direcionadas tipadas (TRABALHA_EM, DEPENDE_DE).
  2. Clusterização de Comunidades: Aplicação do algoritmo de Leiden para agrupar entidades densamente interconectadas em múltiplos níveis de abstração hierárquica.
  3. Resumos Comunitários Pré-Calculados: Cada cluster recebe um sumário sintetizado pelo LLM, permitindo consultas temáticas agregadas com altíssima precisão e economia de tokens em tempo de execução.

🧭 Navegação Rápida

| 📖 Teoria | 📊 Slides | 🧠 Quiz | 💻 Exemplos | 🧩 Exercícios | | :— | :— | :— | :— | :— | | Ler Tópico | Ver Slides | Fazer Quiz | Ver Código | Praticar |


🧭 Navegação do Capítulo: ⬅️ Capítulo Anterior · 📚 Sumário do Módulo · ➡️ Próximo Capítulo