Assistant Documentaire d'Entreprise ("Chat with your Doc")
Plateforme RAG d'entreprise de niveau production garantissant zéro hallucination sur des corpus de plus de 5 000 pages. Recherche hybride dense (Qdrant) + lexicale (BM25) avec fusion RRF (k=60), re-ranking cross-encoder FlashRank/Cohere, garde-fou de confiance strict (Smin ≥ 0.35), citations obligatoires vérifiées, cache déterministe SHA-256 et streaming SSE.
Les 6 Piliers du RAG d'Entreprise Haute Fidélité
Garantir des réponses déterministes, sourcées mot à mot et économiquement maîtrisées
1. Recherche Hybride & Fusion RRF (k=60)
La fusion RRF (Reciprocal Rank Fusion) réunit la précision lexicale exacte (BM25 Okapi) et la compréhension sémantique des embeddings denses (Qdrant 1536 dim).
2. Re-Ranking Cross-Encoder
Raffinement ultra-rapide des candidats via FlashRank local (ms-marco-MiniLM-L-6-v2) ou Cohere, éliminant les faux positifs et isolant le Top-5 pertinent.
3. Garde-Fou de Confiance & Honnêteté
Seuil de coupure strict (Smin ≥ 0.35). Si les extraits sont sous le seuil de pertinence, le système formule un refus explicite plutôt que d'halluciner.
4. Moteur de Citations & Traçabilité
Les balises [Doc: nom | Page: N] sont extraites et validées à 100% contre le contexte injecté, garantissant une provenance vérifiable.
5. Ingestion Multi-Formats & Découpage
Parseurs natifs pour PDF, Word DOCX et Markdown avec découpage structurel récursif et suivi différentiel SHA pour ne jamais réindexer de fichiers inchangés.
6. Télémétrie FinOps & Cache SHA-256
Comptage précis des tokens via tiktoken, calcul des coûts USD en temps réel par modèle, et cache persistant déterministe avec écriture atomique sur disque.
Architecture en Couches & Isolation Stricte
Séparation hermétique : Présentation → Domaine Métier → Infrastructure → Données
┌─────────────────────────────────────────────────────────────────────────────┐
│ PRESENTATION LAYER │
│ React 18+ / Vite / TypeScript UI ◄──► FastAPI SSE Routes │
│ (/api/v1/chat • /api/v1/debug/retrieval • API Key Auth) │
└──────────────────────────────────────┬──────────────────────────────────────┘
│ POST /api/v1/chat
▼
┌─────────────────────────────────────────────────────────────────────────────┐
│ CORE DOMAIN LAYER │
│ Dual Search Orchestrator ──► RRF Fusion (k=60) ──► Re-Ranker (Top 5) │
│ │ │
│ Grounded Generation (T=0.0) ◄── Confidence Guard (S>=0.35) ◄ │
│ │ │
│ ▼ │
│ Citation Engine & FinOps Collector ──► SSE Event Stream │
└───────────────────┬─────────────────────────────────────┬───────────────────┘
│ │
▼ ▼
┌──────────────────────────────────────┐ ┌───────────────────────────────────┐
│ INFRASTRUCTURE LAYER │ │ DATA LAYER │
│ • OpenAI / Gemini Embeddings │ │ • Qdrant Vector Store (dim=1536) │
│ • FlashRank / Cohere Cross-Encoder │ │ • rank-bm25 In-Memory Index │
│ • PDF, DOCX, Markdown Parsers │ │ • SHA-256 Persistent Disk Cache │
│ • Tenacity Exponential Backoff │ │ • Golden Evaluation Datasets │
└──────────────────────────────────────┘ └───────────────────────────────────┘
Objectifs Qualité d'Entreprise & Audit Certifié
Audit rigoureux mesuré sur 52 requêtes d'évaluation annotées (42 faits documentés, 10 refus hors-corpus)
Simulateur RAG Hybride & Assistant Documentaire
Posez des questions sur le corpus technique pour observer la recherche hybride, le score de confiance et les citations
💬 Posez votre question au corpus documentaire
1. Chunks Extraits & Re-Rankés (Top-K) :
2. Réponse Ancrée (Grounded Answer) :
⚙️ Télémétrie RAG & Métriques Session
Pipeline d'Indexation & Modèles Actifs :
• Sparse : BM25 Okapi Lexical Index
• Fusion : Reciprocal Rank Fusion (k=60)
• Reranker : FlashRank ms-marco-MiniLM-L-6-v2
• Filtre de Confiance : Smin ≥ 0.35 (Refus net si hors-corpus)
• Cache : Empreinte SHA-256 & écriture atomique sur disque
Documentation Technique & Dépôt GitHub
Consultez les spécifications d'ingénierie, les rapports de benchmark et le code source complet
📖 Spécifications Techniques (specifications.md)
Architecture détaillée de la recherche hybride, seuils de confiance et formule RRF k=60.
Voir specifications.md ↗📊 Rapport d'Audit & Benchmark (retrieval_report.md)
Audit complet sur 52 requêtes : précision@5 (1.000), honnêteté (0.900), latence p95 (0.7ms).
Voir retrieval_report.md ↗🏛️ Architecture & Isolation (architecture.md)
Isolation stricte des 4 couches (Présentation, Domaine, Infra, Données) et modèles immuables Pydantic V2.
Voir architecture.md ↗🐳 Orchestration Multi-Services (docker-compose.yml)
Stack multi-conteneurs sécurisée (API FastAPI, DB Vectorielle Qdrant, UI React Nginx) en utilisateur non-root UID 10001.
Voir docker-compose.yml ↗