RAG Data Ingestion & Quality Gate

Automated Document Ingestion & Quality Audit Pipeline

Moteur d'ingestion documentaire continu et d'audit automatisé prévenant les échecs de RAG. Support multi-format, découpage Strategy Pattern (Fixe, Structurel, Sémantique) et calcul du ratio de rétention de caractères.

Python 3.11+ Strategy Pattern Chunking Pydantic V2 Strict Retention Ratio Audit Orphan Block Detector Typer & Rich CLI Structlog Telemetry
Ingestion & Qualité RAG

Les 4 Piliers du Pipeline d'Ingestion Documentaire

Éliminer le bruit et la perte de contexte avant la vectorisation

📑

1. Parsing & Loaders Multi-Formats

Architecture de chargeurs extensibles (`TextLoader`, `MarkdownLoader`) préservant la hiérarchie des titres (H1-H6), les blocs de code et les tableaux.

🧩

2. Stratégies de Chunking Adaptatives

Pattern Strategy permettant d'alterner dynamiquement entre découpage fixe (fenêtre glissante), structurel (Markdown aware) et découpage sémantique.

📊

3. Audit du Ratio de Rétention

Calcul mathématique strict du ratio de rétention (caractères extraits vs caractères bruts) avec détection et alerte des blocs de texte orphelins.

🛡️

4. Télémétrie JSON Structurée & Quality Gate

Export d'un rapport JSON d'audit structuré via `structlog` bloquant l'indexation vectorielle si le taux de perte de contexte dépasse le seuil toléré.

Spécifications Techniques

Architecture du Pipeline ETL RAG

Flux de traitement des documents et barrières de contrôle qualité

+--------------------+      +-----------------------+      +--------------------------+
| Heterogeneous Docs | ---> | Multi-Format Loaders | ---> | Strategy Pattern Chunker |
| (PDF, MD, Text)    |      | (Normalization)       |      | (Fixed / Struct / Sem)   |
+--------------------+      +-----------------------+      +--------------------------+
                                                                     |
                                                                     v
+--------------------+      +-----------------------+      +--------------------------+
| Vector DB Storage  | <--- | Quality Audit Gate    | <--- | Retention Ratio &        |
| (Qdrant / PGVector)|      | (JSON Telemetry & Pass|      | Orphan Block Detector    |
+--------------------+      +-----------------------+      +--------------------------+
          
Playground Interactif

Simulateur d'Ingestion Documentaire & Audit

Testez en direct les stratégies de découpage et le contrôle d'absence de perte de contexte

Environnement de Démonstration (Simulateur Mock Client) :
Ce dashboard interactif est une simulation client (Simulateur d'Ingestion Mock) reproduisant le parsing de document, les stratégies de chunking, le calcul du ratio de rétention et la détection de blocs orphelins.

⚙️ Configuration du Document & Chunking

📊 Résultats de l'Audit Qualité

Source Chars 0
Chunks 0
Rétention % 100%
Orphelins 0
PASS (100% Quality)
{}
Docs & Sources

Ressources & Code Source sur GitHub

Consultez la documentation technique et le code source complet de la suite d'ingestion

📖 Documentation Ingestion (README.md)

Spécifications détaillées des loader patterns, du chunker et des métriques d'audit.

Voir sur GitHub ↗

🔬 Rapport d'Audit & Quality Metrics

Guide d'implémentation de la détection de blocs orphelins et des tests Pytest.

Voir audit.md ↗
🚀 Parcourir le Dépôt GitHub du Projet 6_RAG_pipeline ↗