Ingénierie de données de recherche clinique — couplage d'enregistrements pour les issues de traitement

Couplage probabiliste d'enregistrements : reconnecter les dossiers de traitement TB à leur inclusion d'origine

garantir que chaque patient sous traitement est relié à son dossier de dépistage

TB treatment medication and a treatment-monitoring consultation.
Reconnecter chaque dossier de traitement TB à son inclusion d'origine, à travers six cohortes de recherche.

Les dossiers de traitement de la tuberculose arrivent dans une base clinique distincte et manquent souvent des identifiants uniques utilisés dans six cohortes de recherche, rompant le lien entre le traitement d'un patient et son inclusion d'origine.

Le problème

Faute d'identifiant commun, la réconciliation manuelle des dossiers de traitement avec six études était lente, sujette aux erreurs et non extensible, laissant les issues de traitement déconnectées des données d'inclusion et de dépistage.

Ce que j'ai fait

J'ai construit un moteur de couplage probabiliste en deux étapes — recherche exacte par hachage du téléphone, puis appariement démographique flou (rapidfuzz sur les noms, filtré par âge et sexe) avec score pondéré — qui relie chaque dossier de traitement au bon participant et synchronise le résultat dans la base d'issues centrale, avec un suivi des cibles du programme national par-dessus.

6 cohorts
Consolidées et appariées
2-stage
Téléphone + appariement démographique flou
0.80
Seuil de confiance d'appariement
Hourly
Rafraîchissement Airflow automatisé
record-linkagerapidfuzzREDCapAirflowPower BIPython
Résultat

Les dossiers de traitement sont désormais reliés automatiquement à leurs dossiers d'inclusion et réécrits dans la base centrale, et trois tableaux de bord Power BI suivent l'avancement du traitement par rapport aux cibles du programme national, par site et par région.

DISCUTONS

Prêt à commencer ?

Parlez-moi de votre projet, question ou objectif. Je réponds sous 24 heures, en anglais ou en français.

Me contacter