
Les appareils de test moléculaire GeneXpert de dix-sept laboratoires camerounais exportent des fichiers CSV bruts qui varient selon la langue et l'encodage des caractères, alimentant plusieurs études de recherche sur la TB et un manuscrit sur l'efficacité diagnostique.
Les exports bruts variaient selon la langue de la machine (anglais/français) et l'encodage (UTF-16-LE, UTF-8-SIG, windows-1252, latin-1), les identifiants d'étude étaient malformés ou saisis à la main, les tests groupés produisaient des doublons, et les tests à cheval sur minuit donnaient des durées négatives invalides.
J'ai construit un parseur haute performance doté d'une cascade d'encodage (BOM puis chardet) et d'un pool de processus qui bascule automatiquement en mode streaming au-delà de dix mille fichiers, puis une couche de nettoyage qui applique plus de 200 correspondances français→anglais, extrait les identifiants d'étude par expressions régulières propres à chaque projet, corrige les passages de minuit et résout les cartouches groupées en prélèvements individuels.
Une seule exécution automatisée consolide 1 721 exports bruts d'appareils en un jeu de données de 133 556 lignes prêt à l'analyse, et une analyse des tests groupés sur 14 404 pools a quantifié les situations où le regroupement économise des cartouches sans manquer de cas.