Évaluation d'un pipeline de traitement automatique du langage pour l'extraction de la réponse au traitement à partir de comptes rendus de consultation - Cas d'usage 5b du projet PARTAGES. - PARTAGES CU5b - DATA250263
Objectif(s) de la recherche et intérêt pour la santé publique
Finalité de l'étude
Objectifs poursuivis
Domaines médicaux investigués
Bénéfices attendus
Préambule - Description générale de PARTAGES :
Le projet PARTAGES est un projet national collaboratif visant à développer et évaluer des outils open source d'intelligence artificielle (IA) permettant de faciliter la structuration des données médicales, en particulier aux comptes rendus médicaux.
Il repose sur une approche fédérée et distribuée, permettant l'évaluation des modèles d'IA directement au sein des établissements de santé, sans transfert de données, dans le respect du cadre réglementaire et des règles de protection des données personnelles. Ce projet est coordonné par le Health Data Hub.
Le projet PARTAGES est structuré en plusieurs cas d'usage cliniques. Le projet est structuré en plusieurs cas d'usage cliniques. Le cas d'usage CU5b est consacré à l'extraction automatique de la réponse au traitement à partir de comptes rendus de consultation. Ce cas d'usage est piloté par l’Institut Curie (Responsable de Traitement). D’autres centres « évaluateurs » testeront l’algorithme et enverront la qualité de la structuration automatique.
Contexte et justification scientifique du cas d'usage :
L’ambition principale du projet PARTAGES est de permettre une démocratisation massive des techniques d’IA générative.
Pour cela, une base open source inédite de comptes-rendus médicaux fictifs (associés à des patients fictifs) annotés sera créée. Des algorithmes d’IA/LLM génératifs (Qwen3-8B-Base, Mistral-7B, EuroLLM-9B, Apertus-8B, Gaperon-8B) seront créés et entrainés lors de cas d’usage à fort impact pour la recherche et l’innovation en santé ainsi que le système de soins (cf Note de description du projet PARTAGES).
L’Institut Curie a été désigné Etablissement de Santé Leader du Cas d’usage en Oncologie 5b : Modèle de structuration automatique des données médicales dans des CRs – CU5b : Réponse aux traitements. Ce Cas d’usage permettra d’extraire automatiquement des comptes-rendus de consultation d’oncologie les éléments de réponse au traitement dans un format standard, pour appuyer la recherche en oncologie avec des données de vie réelle structurées.
Le cas d’usage implique la spécialisation d’un LLM sur la tâche de classification des documents selon la réponse au traitement mentionnée, à partir des données synthétiques disponibles, puis l’évaluation de l’algorithme sur les données réelles dans les centres participant. Ce modèle permettra d’évaluer l’efficacité d’un traitement donné en structurant à partir de comptes rendus la réponse au traitement dans les bases de données de soins, afin de faciliter la recherche en oncologie.
Objectifs :
Evaluation des performances des modèles LLM de structuration et d’analyse des données médicales de la réponse aux traitements des CR médicaux d’oncologie en :
• Affinant la définition du problème à résoudre et de son évaluation (rattachement au traitement, à la date, à la tumeur, standard, etc)
• Obtenant une performance suffisante pour usage sans "human in the loop" dans certains cas d’usage
• Démonstrant de l'intérêt des LLM pour structurer les variables réputées complexes avec un datas et annoté "petit"
Bénéfice du projet pour la société :
- Amélioration des connaissances scientifiques sur l'extraction automatisée d'informations médicales.
- Contribution à des outils open source en intelligence artificielle pour la santé.
- Perspectives à moyen terme d'amélioration de la structuration des données médicales pour la recherche.
Données utilisées
Catégories de données utilisées
Source de données utilisées
Autre(s) source(s) de donnée(s) mobilisée(s)
Appariement entre les sources de données mobilisées
Variables sensibles utilisées
Justification du recours à cette(ces) variable(s) sensible(s)
Pour répondre aux objectifs de la recherche
Recours au numéro d'identification des professionnels de santé
Plateforme utilisée pour l'analyse des données
Acteurs finançant et participant à l'étude
Responsable(s) de traitement
Type de responsable de traitement 1
Responsable de traitement 1
Localisation du responsable de traitement 1
Représentant du responsable de traitement 1
Calendrier du projet
Base légale pour accéder aux données
Encadrement réglementaire
Durée de conservation aux fins du projet (en années)
2
Existence d'une prise de décision automatisée
Fondement juridique
Article 6 du RGPD (Licéité du traitement)
Article 9 du RGPD (Exception permettant de traiter des données de santé)
Transfert de données personnelles vers un pays hors UE
Droits des personnes
L'Institut Curie, en tant que responsable du traitement, garantit les droits des articles 15 à 20 du RGPD dans les conditions prévues par le réglementation en vigueur. Ainsi, le responsable de traitement prend des mesures appropriées pour procéder à toute communication au titre des articles 15 à 20 du RGPD à la personne concernée d'une façon concise, transparente, compréhensible et aisément accessible, en des termes clairs et simples. Les informations sont fournies par écrit ou par d'autres moyens y compris, lorsque c'est approprié, par voie électronique. Le responsable du traitement facilite l'exercice des droits conférés à la personne concernée au titre des articles 15 à 20 du RGPD. Le responsable du traitement fournit à la personne concernée des informations sur les mesures prises à la suite d'une demande formulée en application des articles 15 à 20, dans les meilleurs délais et en tout état de cause dans les délais fixés par les dispositions légales.