
Une étude de test de la tuberculose en proximité des soins, menée dans des centres de santé communautaires, recueille des données de terrain à code QR sur des formulaires de dépistage, de prélèvement et de laboratoire qui doivent être réconciliés dans trois bases cliniques et suivis par rapport à un protocole d'étude.
Le test de terrain génère des dumps de données désordonnés et propices aux doublons, répartis sur de nombreux formulaires et sites, sans moyen automatique de détecter les problèmes de qualité ni de suivre l'avancement par rapport aux cibles de test par site.
J'ai construit un pipeline de bout en bout qui déduplique et téléverse les dumps de terrain dans trois projets REDCap (treize formulaires), puis exécute un moteur de qualité des données configurable qui note les enregistrements sur plusieurs dimensions, conserve le cycle de vie des requêtes et construit des cibles de test quotidiennes et mensuelles par région à l'aide d'un calendrier de jours ouvrés intégrant les jours fériés camerounais.
Les données de terrain passent automatiquement de la collecte à des dossiers REDCap propres et notés en qualité, avec des rapports de suivi quotidiens et des cibles par site qui permettent à l'étude de suivre la couverture des tests et la qualité des données en quasi temps réel.