Assistant patient LLM : 62 % de demandes répétitives en moins
Un assistant patient RAG doté de garde-fous cliniques a réduit en 8 semaines les demandes répétitives à l’accueil de 62 % et le délai de réponse de 68 %.
Cette clinique traitait les demandes d’abord par téléphone. Les questions répétitives sur les consignes de préparation, l’assurance et les médicaments submergeaient l’équipe et allongeaient l’attente en ligne. Les procédures (SOP) étaient dispersées entre des documents et des e-mails : les réponses variaient d’une personne à l’autre et la formation des nouvelles recrues était lente.
Personne ne répondait en dehors des heures d’ouverture, si bien qu’un arriéré se formait chaque matin. Il n’existait aucun suivi du taux de résolution en autonomie (deflection) ni du délai de réponse. Objectifs à 8 semaines : au moins 50 % de demandes répétitives en moins, un délai de réponse médian inférieur à 90 secondes pour les questions courantes, et un CSAT en hausse avec moins de rappels.
Nous avons constitué un corpus de référence (SOP, guides de préparation, FAQ sur l’assurance), versionné dans un dépôt sécurisé, avec un circuit éditorial de relecture par des cliniciens. Nous avons ensuite construit un pipeline RAG (LlamaIndex/LangChain) qui fournit des réponses avec leurs sources, en limitant les PHI (données de santé protégées) au strict nécessaire et en chiffrant les données au repos et en transit.
Le périmètre de la conversation a été volontairement restreint aux sujets administratifs et à la préparation : horaires, accès, assurance, formulaires, consignes pré et postopératoires. Les garde-fous comprenaient une mention explicite indiquant que l’assistant ne donne pas d’avis médical, des règles de refus, des déclencheurs d’escalade par mot-clé et par intention, le masquage des PHI, des limites de débit et un traitement des cas limites par un humain. Chaque passage à un membre de l’équipe est accompagné d’un résumé de la conversation.
Le déploiement a été omnicanal : un widget web React sur tout le site, SMS et WhatsApp via Twilio, et un renvoi depuis le serveur vocal interactif (SVI) vers le libre-service, avec réponse automatique en dehors des heures d’ouverture. Un module d’aide à l’admission recueille le type de consultation, l’assureur et des listes de contrôle sur les allergies et les médicaments (sans diagnostic), puis envoie les consignes de préparation propres à chaque intervention. Des tableaux de bord PostHog suivaient la résolution en autonomie, le délai de réponse, les escalades et le CSAT. Des revues hebdomadaires des transcriptions ont guidé l’extension de la couverture et le réglage du ton.
Après 8 semaines : les demandes répétitives traitées par l’accueil ont baissé de 62 %, le délai de réponse médian aux questions courantes a diminué de 68 % (de 4 min 10 à 1 min 20), le CSAT mesuré par la micro-enquête après échange a progressé de 18 %, et 40 % des échanges hors horaires d’ouverture ont été résolus en autonomie.
Transformer un savoir non écrit en SOP validées a aussi réduit le temps de formation de l’équipe sur les questions fréquentes. Dès la troisième semaine, l’arriéré du matin avait disparu.
Dès la troisième semaine, l’arriéré du matin avait disparu. Les patients arrivent avec la bonne préparation, et l’équipe peut enfin souffler.
Nos études de cas publiées sont majoritairement nord-américaines. Tous les montants sont en dollars US. Le client est anonymisé.


