
Les dossiers de traitement de la tuberculose arrivent dans une base clinique distincte et manquent souvent des identifiants uniques utilisés dans six cohortes de recherche, rompant le lien entre le traitement d'un patient et son inclusion d'origine.
Faute d'identifiant commun, la réconciliation manuelle des dossiers de traitement avec six études était lente, sujette aux erreurs et non extensible, laissant les issues de traitement déconnectées des données d'inclusion et de dépistage.
J'ai construit un moteur de couplage probabiliste en deux étapes — recherche exacte par hachage du téléphone, puis appariement démographique flou (rapidfuzz sur les noms, filtré par âge et sexe) avec score pondéré — qui relie chaque dossier de traitement au bon participant et synchronise le résultat dans la base d'issues centrale, avec un suivi des cibles du programme national par-dessus.
Les dossiers de traitement sont désormais reliés automatiquement à leurs dossiers d'inclusion et réécrits dans la base centrale, et trois tableaux de bord Power BI suivent l'avancement du traitement par rapport aux cibles du programme national, par site et par région.