IA appliquée · Recherche documentaire

Assistant documentaire interne avec RAG

Interroger un corpus interne, classer les documents les plus pertinents et restituer une réponse traçable avec ses sources pour accélérer l'accès à l'information métier.

01 Question métier

L'utilisateur formule son besoin en langage naturel.

02 Recherche

Le corpus est parcouru et les documents sont classés selon leur pertinence.

03 Sources

Les passages utiles sont retenus avec leur identifiant et leur origine.

04 Réponse assistée

Une restitution fondée sur les sources est présentée à l'utilisateur.

Contexte métier

Les procédures, référentiels et guides internes sont souvent dispersés entre plusieurs espaces. Les équipes passent du temps à rechercher la bonne information, à vérifier sa version et à identifier la source suffisamment fiable pour prendre une décision.

Problématique

Comment permettre à un collaborateur de poser une question simplement, retrouver les documents pertinents et obtenir une réponse traçable sans masquer l'origine de l'information ni inventer une réponse lorsque les sources sont insuffisantes ?

Approche

Un système RAG, pour Retrieval-Augmented Generation ou génération augmentée par la recherche, commence par retrouver les informations utiles avant de produire une réponse. Cette démonstration se concentre sur cette couche de recherche et remplace volontairement la génération par une synthèse extractive locale afin que chaque résultat reste vérifiable.

Corpus fictif Quatorze documents métier couvrant Data, IA, sécurité, finance et reporting.
Recherche pondérée Le titre, les tags, la source et le contenu contribuent différemment au score.
Sources classées Les documents les plus pertinents sont ordonnés et conservés comme références.
Réponse traçable La restitution cite explicitement les documents utilisés et signale les recherches sans résultat.

Ce que montre la démo

Interrogez un corpus documentaire fictif

Saisissez une question ou choisissez un exemple. La démonstration classe les documents, affiche le meilleur extrait et cite les sources retenues. Le score est un indicateur transparent fondé sur les termes retrouvés, pas une probabilité calculée par un modèle d'IA.

Questions d'exemple

Filtres documentaires

Démonstration front-end : le corpus JSON, la recherche, le classement et la synthèse sont exécutés localement. Aucun modèle génératif ni service distant n'est appelé.

Réponse assistée

Synthèse extractive locale

Posez une question pour afficher l'extrait le plus pertinent et les documents qui le justifient.

Sources retrouvées

Chargement du corpus...
Chargement du corpus documentaire...

Valeur apportée

Accès plus rapide Réduction du temps consacré à parcourir plusieurs espaces documentaires.
Réponse traçable Conservation des documents utilisés pour vérifier et approfondir le résultat.
Connaissance partagée Mise à disposition plus homogène des procédures et référentiels internes.
Risque mieux maîtrisé Signalement des recherches insuffisantes au lieu de produire une réponse non fondée.

De la démonstration à la production

Une architecture réelle pourrait ingérer des documents depuis SharePoint ou Azure Blob Storage, les découper en passages, calculer leurs embeddings - des représentations numériques du sens - puis les indexer dans Azure AI Search. Azure OpenAI pourrait ensuite formuler une réponse à partir des passages autorisés, avec citations, contrôle des accès, journalisation et tests de qualité.

Ingestion Collecte, nettoyage, découpage et suivi des versions documentaires.
Index vectoriel Recherche par proximité de sens avec filtres métier et droits d'accès.
Génération contrôlée Réponse limitée au contexte retrouvé avec citations et règles de refus.
Évaluation continue Jeu de questions de référence, suivi des erreurs et validation métier.
Le point essentiel n'est pas seulement le modèle utilisé. La qualité dépend aussi du corpus, des droits d'accès, de la fraîcheur des documents, de la stratégie de recherche et des évaluations.

Aller plus loin

Ce type d'assistant peut soutenir un support interne, une base de procédures, un dispositif de conformité ou l'accès à une documentation Data et BI, avec un niveau de contrôle adapté aux informations traitées.