Doc2Text
Partenaires
Le Centre Hospitalier Universitaire (CHU) de Brest est un acteur de référence dans le domaine de la santé publique, de la recherche clinique et de l’innovation en santé numérique. Il s’appuie notamment sur son Entrepôt de Données de Santé (EDS), structuré au sein du service du Département d’Information Médicale (DIM), dirigé par le Dr Lorenn BELLAMY, cheffe de service du DIM du CHU et du GHT.
Le Centre de Données Cliniques (CDC) est l’équipe en charge de l’EDS. Elle a été renforcée en 2024, comptant aujourd’hui six membres aux compétences complémentaires : data scientists, bio-informaticiens, épidémiologistes et experts en sécurité des données. Cette équipe pluridisciplinaire joue un rôle central dans l’exploitation des données hospitalières à des fins de recherche, d’amélioration des soins, et de soutien à l’innovation.
Le CDC se compose actuellement de 8 professionnels aux compétences complémentaires.
Le CDC travaille en étroite collaboration avec la Direction de la Recherche et de l’Innovation du CHU, une direction support certifiée ISO 9001, qui garantit un accompagnement de qualité, de gouvernance et de gestion des projets de recherche.
Contexte
Les Entrepôts de Données de Santé (EDS) ont besoin de disposer de comptes rendus médicaux structurés et pseudonymisés pour garantir la confidentialité des patients.
Or, une part importante de ces comptes rendus, souvent anciens, est encore stockée au format Word 97–2003 (.doc), un format informatique obsolète. Ces documents contiennent des informations médicales précieuses, mais restent largement sous-exploités faute d’outils adaptés pour en extraire le contenu de manière fiable.
Aujourd’hui, la solution la plus courante consiste à convertir ces fichiers en PDF afin d’en extraire le texte. Mais cette solution est imparfaite : le PDF ne conserve pas la structure du document original. Il devient alors compliqué de distinguer le contenu médical pertinent des éléments parasites, comme les en-têtes ou les pieds de page, ce qui dégrade la qualité des données et complique leur pseudonymisation.
A l’inverse, les fichiers Word sont organisés de manière plus claire (paragraphe, tableaux, champs dédiés). Certains utilisent même des modèles qui insèrent automatiquement les informations du patient, ce qui facilite à la fois l’analyse des textes, et la pseudonymisation des données, de manière fiable et supervisée.
Récemment, Microsoft a rendu publique la spécification technique officielle du format Word 97, c’est-à-dire le “mode d'emploi” qui explique exactement comment les fichiers sont structurés et comment en extraire le contenu de manière fiable. Cette ouverture crée une nouvelle opportunité : celle de développer un outil dédié capable de lire directement ces fichiers anciens, sans passer par des conversions approximatives.
Objectif du projet
Le projet Doc2text, porté par le CHU de Brest, vise à développer un outil open source simple permettant d’extraire automatiquement le texte contenu dans d’anciens fichiers Word (format Word 97-2003). Dans un contexte où la qualité et la fiabilité des données sont devenues essentielles, en particulier pour l’entraînement et l’usage des modèles de langage en santé, Doc2text propose une solution concrète pour transformer des documents anciens et difficilement exploitables en données textuelles de qualité, prêtes à être utilisées pour la recherche et l’innovation.
Méthodologie et caractère innovant
L’outil sera conçu pour être simple à installer, sans dépendances complexes, et utilisable sous Linux. Il pourra être déployé facilement via des gestionnaires standards et sera capable de traiter en parallèle plusieurs millions de documents, ce qui le rend adapté aux volumes manipulés par les EDS.
L’outil sera développé en langage Rust, reconnu pour ses performances et sa fiabilité, avec une interface Python afin de faciliter son intégration dans des chaînes de traitement existantes. Contrairement aux solutions actuelles, il permettra une extraction sélective et structurée du texte, en distinguant les différentes zones du document, ce qui améliore fortement la qualité des données extraites.
L’évaluation de l’outil repose sur un corpus représentatif de 100 000 documents Word. Deux critères seront analysés :
- la performance, en comparant les temps d’extraction à ceux d’outils existants comme Apache Tika, dans un contexte de calcul massivement parallèle ;
- la qualité, en mesurant la pertinence de l’extraction des zones de texte, notamment par comparaison avec des méthodes utilisées sur des fichiers PDF.
Résultat / Livrable attendu
L’outil développé sera mis à disposition de la communauté scientifique en open source.