Contexte

Pour l’APHP (AP-HP, Assistance Publique – Hôpitaux de Paris), alors que j’étais System Analyst chez IBM France (2023 – 2024, Paris), j’ai conçu l’E-Reply System : une plateforme de suivi médical augmentée par l’IA pour l’analyse automatisée des échanges avec les patients. Elle intègre des LLM, du RAG et de la recherche vectorielle pour améliorer la pertinence des réponses et assister les équipes médicales, dans un environnement aux exigences très fortes de sécurité et de confidentialité des données.

Problème

Les équipes médicales reçoivent des échanges de patients qui appellent des réponses rapides et pertinentes. Lire et répondre à chaque message à la main ne passe pas à l’échelle, mais un système automatisé dans un contexte hospitalier doit être assez précis pour aider les cliniciens et assez confidentiel pour qu’on lui confie des données de patients. La rapidité compte parce qu’une réponse tardive a un coût réel pour la personne qui attend, et la pertinence compte parce qu’une mauvaise réponse coûte plus cher qu’une réponse en retard.

Décisions d’architecture

Des LLM et du RAG pour améliorer la pertinence des réponses

Les LLM sont associés à la génération augmentée par recherche (RAG), de sorte que les réponses s’appuient sur des contenus retrouvés plutôt que sur le seul modèle. L’objectif est d’améliorer la pertinence des réponses et d’assister les équipes médicales, pas de les remplacer.

Compromis : le RAG ajoute un composant de recherche à construire et à évaluer. En contrepartie, les réponses sont ancrées dans des contenus retrouvés, plus faciles à vérifier qu’une génération libre.

La recherche vectorielle Vespa AI

J’ai mis en œuvre la recherche vectorielle Vespa AI comme couche de recherche derrière l’assistant, ce qui a réduit de 70 % le temps de réponse aux e-mails.

Compromis : un moteur de recherche vectorielle dédié est un système de plus à exploiter. On le choisit pour la qualité et la vitesse de la recherche plutôt qu’un stockage généraliste.

La sécurité et la confidentialité comme contraintes de conception

La plateforme a été construite dans un environnement très exigeant en sécurité et en confidentialité des données, et ces exigences ont façonné la conception dès le départ plutôt que d’être vérifiées à la fin.

Compromis : des contraintes strictes réduisent le choix des outils et de l’hébergement et ralentissent l’expérimentation. Elles rendent aussi le système acceptable pour les personnes responsables des données.

Résultats

La recherche vectorielle Vespa AI a réduit de 70 % le temps de réponse aux e-mails, et la plateforme assiste les équipes médicales grâce à l’analyse automatisée des échanges avec les patients.

Stack

  • LLMs
  • RAG
  • Vespa AI
  • Vector search