Intelligence artificielle

Assistant IA sur base documentaire

Un assistant qui répond sans citer ses sources est inutilisable en entreprise : personne ne peut vérifier, donc personne ne s'en sert.

Conversation avec l'assistant : analyses, indicateurs clés, sources documentaires et aperçu de document.
Illustration d'interface, reconstituée pour la présentation. Ce n'est pas une capture du livrable final.

Contexte

Dans beaucoup d'organisations, l'information existe mais reste introuvable : elle est répartie entre des documents, des comptes rendus et des échanges accumulés au fil des années. La recherche par mot-clé ne suffit pas, parce que la question posée n'emploie presque jamais les mots du document qui contient la réponse.

Le problème

Un assistant conversationnel branché naïvement sur un corpus pose trois problèmes immédiats.

  • Il peut produire une réponse plausible mais fausse, sans que rien ne le signale
  • Il peut exposer à un utilisateur un document auquel il n'a pas accès
  • Il devient coûteux si chaque question déclenche un traitement complet du corpus
  • Il se périme dès que les documents évoluent, si l'index n'est pas tenu à jour

La solution

Une architecture de récupération augmentée : on cherche d'abord les passages pertinents, on ne fait générer que la synthèse, et on cite systématiquement les documents utilisés.

  • Ingestion et découpage des documents en passages exploitables
  • Indexation vectorielle permettant une recherche sur le sens, pas seulement sur les mots
  • Récupération des passages pertinents avant toute génération
  • Réponse en langue naturelle, accompagnée des documents sources et d'un aperçu
  • Filtrage par droits d'accès appliqué à la recherche, en amont de la génération
  • Réindexation des documents modifiés, pour que l'index suive le corpus

Mon rôle

Conception de la chaîne d'ingestion et d'indexation, de la stratégie de découpage, du mécanisme de récupération, de l'intégration du modèle et de l'interface de conversation, ainsi que du filtrage par droits.

Contraintes

  • Les droits d'accès doivent s'appliquer à la recherche, jamais après coup sur la réponse
  • Chaque réponse doit être rattachée à ses sources, pour être vérifiable
  • Coût des appels au modèle à contenir, ce qui impose de ne transmettre que les passages utiles
  • Corpus vivant : l'index doit refléter les documents à jour
  • Documents parfois confidentiels, ce qui pèse sur les choix d'hébergement et de traitement

Résultat

Un assistant qui répond en langue naturelle et affiche les documents sur lesquels il s'appuie, ce qui rend chaque réponse vérifiable.

  • La citation des sources rend l'outil utilisable dans un contexte professionnel
  • Le filtrage par droits est appliqué à la recherche, donc structurellement respecté
  • Le coût par question reste maîtrisé, puisque seuls les passages pertinents sont transmis

Les résultats sont décrits par la capacité livrée. Aucune mesure de performance commerciale n'est avancée ici : les chiffres d'usage appartiennent au client, et je ne publie pas de métriques que je ne peux pas justifier.

Un projet de cette nature ?

Décrivez votre besoin en quelques lignes. Je vous réponds sur ce qui est faisable, ce qui ne l'est pas, et par où commencer.

Me contacter