← Retour aux projets
Contribution open source

RAG documentaire multi-sources

Contribution à un moteur de recherche documentaire combinant recherche lexicale, recherche vectorielle et reranking.

Résultats clés
3
techniques de recherche (BM25 + dense + reranking)
1
contribution open source

Contexte

Contribution sur un fork open source d'un système de recherche documentaire basé sur le paradigme RAG (Retrieval-Augmented Generation). Le périmètre présenté ici se limite aux contributions confirmées par les commits du dépôt.

Problème

Améliorer la pertinence d'un moteur de recherche documentaire : une recherche purement vectorielle ou purement lexicale a des limites. Combiner les deux approches et réordonner les résultats permet de retrouver les passages réellement pertinents dans un grand corpus.

Rôle exact

Contributeur sur un fork open source. Contributions apportées :

  • Recherche hybride BM25 + dense
  • Fusion RRF (Reciprocal Rank Fusion)
  • Reranking des résultats
  • Cache Streamlit
  • Amélioration de l'interface conversationnelle

Solution

Un pipeline RAG combinant une base vectorielle, une recherche lexicale, une fusion hybride et une étape de reranking, exposé à travers une interface de chat en langage naturel avec réponses sourcées.

Fonctionnalités vérifiées

  • Ingestion de documents (parquet) et indexation vectorielle
  • Recherche hybride : BM25 (lexicale) + dense (vectorielle)
  • Fusion RRF et reranking des résultats
  • Interface conversationnelle Streamlit

Stack réelle

PythonLangChainChromaDBStreamlitOllamaGroq / OpenRoutersentence-transformers (BGE)rank_bm25

Démonstration

Démonstration du moteur RAG : une question sur la politique de télétravail et les passages pertinents retrouvés par recherche hybride sur un corpus synthétique.
Démonstration réalisée sur un corpus synthétique. Recherche hybride (BM25 + vectorielle) avec fusion RRF.

Résultat observable

Un moteur de recherche documentaire fonctionnel, avec une recherche hybride et un reranking qui améliorent la pertinence des réponses, consultable dans le dépôt public.

Limites & statut

Il s'agit d'une contribution sur un fork : le socle du projet n'a pas été développé par Donovan. Aucune métrique de performance n'est publiée, car aucune n'a été mesurée de façon reproductible. Le sujet du corpus original étant sensible, aucune capture issue de données réelles n'est affichée.

Un corpus de documents à explorer ou un assistant IA documentaire à construire ?

Discuter de mon besoin