RAG documentaire multi-sources
Contribution à un moteur de recherche documentaire combinant recherche lexicale, recherche vectorielle et reranking.
Contexte
Contribution sur un fork open source d'un système de recherche documentaire basé sur le paradigme RAG (Retrieval-Augmented Generation). Le périmètre présenté ici se limite aux contributions confirmées par les commits du dépôt.
Problème
Améliorer la pertinence d'un moteur de recherche documentaire : une recherche purement vectorielle ou purement lexicale a des limites. Combiner les deux approches et réordonner les résultats permet de retrouver les passages réellement pertinents dans un grand corpus.
Rôle exact
Contributeur sur un fork open source. Contributions apportées :
- Recherche hybride BM25 + dense
- Fusion RRF (Reciprocal Rank Fusion)
- Reranking des résultats
- Cache Streamlit
- Amélioration de l'interface conversationnelle
Solution
Un pipeline RAG combinant une base vectorielle, une recherche lexicale, une fusion hybride et une étape de reranking, exposé à travers une interface de chat en langage naturel avec réponses sourcées.
Fonctionnalités vérifiées
- Ingestion de documents (parquet) et indexation vectorielle
- Recherche hybride : BM25 (lexicale) + dense (vectorielle)
- Fusion RRF et reranking des résultats
- Interface conversationnelle Streamlit
Stack réelle
Démonstration

Résultat observable
Un moteur de recherche documentaire fonctionnel, avec une recherche hybride et un reranking qui améliorent la pertinence des réponses, consultable dans le dépôt public.
Limites & statut
Il s'agit d'une contribution sur un fork : le socle du projet n'a pas été développé par Donovan. Aucune métrique de performance n'est publiée, car aucune n'a été mesurée de façon reproductible. Le sujet du corpus original étant sensible, aucune capture issue de données réelles n'est affichée.
Un corpus de documents à explorer ou un assistant IA documentaire à construire ?
Discuter de mon besoin