Prédiction automatique des codes CIM-10 des comptes rendus hospitaliers (cas d’usage 2 projet PARTAGES)
Objectif(s) de la recherche et intérêt pour la santé publique
Finalité de l'étude
Objectifs poursuivis
Domaines médicaux investigués
Bénéfices attendus
Contexte de l’étude :
Comme dans tous les domaines scientifiques, le domaine médical utilise de nombreuses classifications. Ces classifications en normalisant les données permettent de créer des groupes cohérents qui sont utilisés pour mener des études statistiques, épidémiologiques, de recherche clinique ou de suivi des politiques de santé publique. Ce besoin de normalisation a conduit la communauté scientifique à s’unir autour de classifications communes permettant de partager de l’information sur les patients et leurs pathologies. Parmi celles-ci, la classification internationale des maladies (CIM) a une place à part puisqu’elle est utilisée depuis plus d’un siècle par de nombreux pays pour suivre les causes de décès. En France comme dans de nombreux pays ayant mis en place un système de financement des hôpitaux à l’activité, la CIM est utilisée pour décrire le contenu des séjours hospitaliers. Chaque venue en hospitalisation donne lieu à la production de résumés standardisés de sortie (RSS) contenant les codes CIM-10 décrivant les pathologies prises en charge. La constitution et la transmission aux tutelles de ces données est obligatoire pour les établissements de santé depuis 1991 (PMSI).
Aujourd’hui le PMSI est le pilier de l'analyse de l'activité des établissements et pierre angulaire du SNDS, et le pilier du système de financement dans le cadre de la tarification à l’activité. Néanmoins la production de ces informations est très chronophage. Depuis plus de 30 ans intense activité de recherche sur les méthodes d'automatisation. Le projet national PARTAGES vise à développer et évaluer des outils open source d’intelligence artificielle appliqués aux données de santé, notamment textuelles, en s’appuyant sur une approche distribuée et fédérée. Cette approche permet d’évaluer les outils au plus près des données, sans transfert de données de santé hors des établissements. Dans le cadre de PARTAGES l’objectif du CU2 est de montrer la capacité des modèles de langue à répondre de façon efficace aux défis posés par le codage des situations cliniques à partir des comptes rendus d’hospitalisation.
Objectif principal : Évaluer les performances d’un pipeline de traitement automatique du langage pour le codage CIM10 à partir de comptes rendus réels, en conditions locales hospitalières.
Objectifs secondaires : Les objectifs secondaires sont d’étudier l’apport des données fictives utilisées pour le développement initial, d’évaluer différentes approches de modélisation, notamment par prompting et fine-tuning de modèles de type LLM, d’évaluer la robustesse des modèles sur des comptes rendus issus de plusieurs établissements, et de produire un modèle, un code open source, une documentation méthodologique et des résultats d’évaluation reproductibles
Méthode : Le pipeline CU2 repose sur des modèles de langage spécialisés pour le domaine médical. Il vise à prédire le code CIM du diagnostic principal des séjours de chirurgie ambulatoire. Les sorties du pipeline sont comparées au codage de référence présent dans les données PMSI. Les performances sont évaluées à l’aide de métriques standards (par exemple précision, rappel, F‑mesure). Une analyse qualitative des erreurs est également réalisée.
Population : Patients ayant bénéficié d’une chirurgie ambulatoire au cours des 3 dernières années (2023-2025) en chirurgie viscérale, orthopédie et urologie. Le choix de limiter le périmètre aux séjours de chirurgie ambulatoire de 3 spécialités s’explique par le faible nombre de CRH fictifs disponibles dans le jeu d’entraînement.
Aucune inclusion prospective, aucun contact direct avec les patients et aucune modification de la prise en charge ne sont réalisés.
Nature des données :
• Compte rendu opératoire en texte libre, issus de la pratique clinique courante (incluant le diagnostic principal).
• Données administratives (durée du séjour = 0, âge, sexe, codage PMSI observé par des médecins DIM)
Méthode de sélection : Les patients sont sélectionnés sur la base du groupe homogène de malade (GHM) présent dans le résumé standardisé de sortie (RSS). Une liste est fournie en annexe.
Critères d’exclusion : Patients opposés à la réutilisation de leurs données dans le cadre de la recherche
Volume de données : Entre 150 et 1000 sélectionnés comptes rendus par établissement, selon la disponibilité locale des données.
Ce volume de données a été déterminé selon des considérations statistiques de robustesse des méthodes d’évaluation classiques de LLM et opérationnelles pour les établissements de santé évaluateurs.
Volume attendu pour l’évaluation du cas d’usage codage DIM :
• minimum : 100 comptes rendus par établissement
• idéal : 400 comptes rendus par établissement
• maximum : 1000 comptes rendus par établissement
Le projet PARTAGES est un projet d’ampleur nationale dont le mode d'organisation entre les partenaires et implique la présence d'une multitude d'établissements de santé évaluateurs (à la fois responsables de la mise en œuvre et destinataires des données). Le détail de l'architecture du projet est décrit dans le protocole scientifique.
Données utilisées
Catégories de données utilisées
Source de données utilisées
Autre(s) source(s) de donnée(s) mobilisée(s)
Appariement entre les sources de données mobilisées
Variables sensibles utilisées
Recours au numéro d'identification des professionnels de santé
Plateforme utilisée pour l'analyse des données
Acteurs finançant et participant à l'étude
Responsable(s) de traitement
Type de responsable de traitement 1
Responsable de traitement 1
Localisation du responsable de traitement 1
Représentant du responsable de traitement 1
Calendrier du projet
Base légale pour accéder aux données
Encadrement réglementaire
Durée de conservation aux fins du projet (en années)
2
Existence d'une prise de décision automatisée
Fondement juridique
Article 6 du RGPD (Licéité du traitement)
Article 9 du RGPD (Exception permettant de traiter des données de santé)
Transfert de données personnelles vers un pays hors UE
Droits des personnes
En plus de la remise d'une note d'information par les établissements de santé évaluateur à destination de leurs patients, les informations relatives au projet PARTAGES seront publiées sur le portail de transparence sur le site des établissements évaluateurs concernés.
L'AP-HP, en tant que responsable de traitement, s'assure que les personnes concernées sont informées conformément à la MR-004 de la CNIL. L'AP-HP détermine le contenu de l'information à transmettre aux personnes concernées. Les modalités précises de remise de l'information relèvent néanmoins du cadre mis en place par chaque établissement évaluateur pour l’usage secondaire de ses données. En effet, le projet PARTAGES repose sur la sollicitation des entrepôts de données de santé des établissements participants, lesquels disposent déjà de circuits d'information éprouvés (portails de transparence). Chaque établissement évaluateur, par le biais de son portail de transparence ou d’une note d’information individuelle dédiée (voir le modèle soumis en annexe), est chargé d’informer les personnes concernées de la réutilisation de leurs données personnelles dans le cadre de cette recherche. Cette responsabilité sera écrite dans le contrat de sous-traitance établi entre l'AP-HP et chaque établissement évaluateur. Ce même contrat précisera que l'établissement évaluateur sera désigné comme point de contact privilégié des personnes concernées pour l'exercice de leurs droits. Ce schéma est optimal aussi bien du point de vue de la confidentialité médicale que d'un point de vue efficacité, l'AP-HP n'ayant pas accès aux données de participants dont les comptes-rendus ont été sélectionnés. Bien entendu, le même schéma est en vigueur pour l'AP-HP concernant ses propres patients.