N° 31984575

DANTE

Partager

Objectif(s) de la recherche et intérêt pour la santé publique

Finalité de l'étude

Recherche, étude, évaluation

Objectifs poursuivis

Prise en charge des patients

Domaines médicaux investigués

Cancérologie

Bénéfices attendus

Le projet répond à un problème concret et récurrent du système de santé : la collecte des données de suivi des patients sous accès précoce repose aujourd'hui sur une saisie manuelle par les professionnels de santé, qui est chronophage, source d'erreurs et d'oublis, et aboutit fréquemment à des dossiers incomplets. Or ces données conditionnent la qualité du suivi en vie réelle des traitements innovants et l'appui à la régulation de ces accès précoces. DANTE s'inscrit ainsi dans une finalité d'amélioration du système de santé, de qualité des données d'usage en vie réelle et de transparence scientifique autour des accès précoces.

Objectifs poursuivis
L'objectif central est méthodologique et comparatif : évaluer si l'extraction automatisée par intelligence artificielle (traitement automatisé du langage) permet de produire des données plus fiables, plus complètes et plus faciles à exploiter que la saisie manuelle traditionnelle, tout en allégeant la charge de travail des équipes médicales. Concrètement, l'étude vise à :

- évaluer la complétude, l'exactitude et la cohérence des données collectées par IA versus manuellement ;
- identifier si l'IA peut fiabiliser la collecte de données en vie réelle ;
- contribuer à des usages d'intérêt général (optimisation des recommandations thérapeutiques, évaluation en vie réelle des innovations).

Éléments de méthode
L'étude repose sur une comparaison à deux (ou trois) bras :

- Bras IA (phase 1) : extraction automatisée des données à partir des dossiers patients informatisés (DPI), sans intervention humaine, avec pseudonymisation locale avant tout transfert — sous couvert de la méthodologie de référence MR-004 de la CNIL ;

- Bras de référence / gold standard (phase 2) : saisie des mêmes variables par des attachés de recherche clinique consultant directement le DPI source (sur site ou à distance) — soumise à autorisation CNIL spécifique, non encore obtenue à ce stade ;

- Bras « traditionnel » : données déjà collectées par les industriels dans le cadre de leurs propres obligations réglementaires d'accès précoce (référentiel RS-003).

- Une CRO centrale indépendante (RCTs), agissant comme tiers de confiance, fusionne et chaîne ces bases pour produire un score d'exactitude et documenter la comparaison selon des indicateurs de qualité, de complétude et de fiabilité. Le set de données est strictement limité à 22 variables prédéfinies, issues des quatre fiches officielles du PUT-RD validées par la HAS (demande d'accès, instauration, suivi, arrêt du traitement).
Population d'étude

La population est constituée des patients bénéficiant d'un accès précoce à des traitements innovants en oncologie, pris en charge dans des établissements de santé partenaires (CHU, CLCC, CHG, ESPIC…). Le projet prévoit une répartition équilibrée entre centres, aucun établissement ne pouvant représenter plus de 15 % des patients inclus (soit 22 patients maximum par centre), afin de limiter la concentration excessive de données sur un même point d'entrée.

Données utilisées

Catégories de données utilisées

Informations relatives aux pathologies des personnes concernées
Informations relatives à la prise en charge sanitaire, médico-sociale et financière associées à chaque bénéficiaire

Autre(s) catégorie(s) de donnée(s) utilisée(s)

Au-delà des données cliniques et de prise en charge (statut ECOG, posologie, dates de traitement, effets indésirables, dates d'interruption/arrêt), le projet DANTE collecte une catégorie de données démographiques et relatives à l'établissement :

- Date de naissance — mais limitée au mois et à l'année uniquement (format MM/AAAA), sans le jour, ce qui réduit le caractère identifiant de cette donnée ;
- Sexe du patient ;
- Catégorie de l'établissement ayant prescrit ou initié le traitement (par exemple : hôpital universitaire/CHU, centre privé type ESPIC, Centre de Lutte contre le Cancer/CLCC…).

Ces informations servent uniquement à caractériser le profil des patients inclus dans l'étude (à des fins de description de l'échantillon et d'analyse de la répartition), et non à identifier directement les personnes. Le document précise d'ailleurs que l'ensemble des 22 variables collectées est strictement limité à ce qui est nécessaire à l'analyse comparative, à l'exclusion de toute collecte exhaustive ou indifférenciée — conformément au principe de minimisation (article 5-1-c du RGPD).

Source de données utilisées

Autres sources

Autre(s) source(s) de donnée(s) mobilisée(s)

Dossiers Médicaux

Appariement entre les sources de données mobilisées

  Oui

Source(s) de données appariées

Les données appariées dans le cadre du projet DANTE proviennent de trois grandes familles de sources, chacune alimentant l'une des trois bases pseudonymisées qui sont ensuite fusionnées et chaînées par la CRO centrale (RCTs) au sein d'une base de comparaison unique :

1. Source « traditionnelle » (saisie manuelle)

Origine : le personnel de soin, dans le cadre du protocole d'utilisation thérapeutique et de recueil de données (PUT-RD) validé par la HAS.
Modalité : saisie manuelle des données de suivi des accès précoces.
Référentiel applicable : RS-003.
Responsable de traitement : chaque laboratoire pharmaceutique partenaire (et non la Filière IA & Cancers), puisque cette collecte correspond aux obligations réglementaires propres à chaque industriel, indépendantes de DANTE.
Résultat : données pseudonymisées dites « traditionnelles ».

2. Source « IA » (extraction automatisée — bras IA, phase 1)

Origine : le dossier patient informatisé (DPI), dont une partie est traitée par des solutions d'intelligence artificielle de traitement automatisé du langage (NLP).
Modalité : extraction et pseudonymisation automatiques, sans intervention humaine, réalisées par les établissements de santé partenaires ou des PME innovantes en IA.
Référentiel applicable : MR-004 de la CNIL.
Responsable de traitement : la Filière IA & Cancers.
Résultat : données pseudonymisées dites « IA ».

3. Source « de référence » (gold standard — bras de référence, phase 2)

Origine : le DPI source, dans son intégralité.
Modalité : saisie manuelle des mêmes variables par des attachés de recherche clinique (ARC), consultant directement le dossier, sur site ou à distance.
Régime juridique : hors champ de la MR-004 ; nécessite cette autorisation spécifique de la CNIL (instruite par le Health Data Hub, avec avis du CESREES), non encore obtenue à ce stade et objet du présent dépôt.
Opérateur : le tiers de confiance RCTs.
Résultat : données pseudonymisées dites « de référence ».

Appariement final
Ces trois flux pseudonymisés sont ensuite fusionnés et chaînés par RCTs au sein de la « base de comparaison », ce qui permet l'analyse comparative visée par l'étude — évaluation de la complétude, de l'exactitude et de la cohérence des données selon la méthode de collecte utilisée (manuelle vs IA, avec le bras de référence comme étalon).

Type d'appariement

Appariement indirect

Variables sensibles utilisées

Année et mois de naissance

Justification du recours à cette(ces) variable(s) sensible(s)

Le recueil du mois et de l'année de naissance (à l'exclusion du jour) se justifie par la nécessité de disposer de l'âge du patient, donnée cliniquement structurante en oncologie : elle conditionne la vérification du critère d'inclusion (patient âgé de 18 ans ou plus), figure parmi les variables du set faisant l'objet de la comparaison entre méthodes de recueil, et constitue un facteur d'ajustement et de description pertinent des populations d'accès précoce. La collecte limitée au mois et à l'année, plutôt qu'à la date complète de naissance, procède directement du principe de minimisation : elle permet un calcul de l'âge suffisamment précis pour les besoins de l'étude tout en réduisant le caractère directement identifiant de la donnée et donc le risque de réidentification.

Recours au numéro d'identification des professionnels de santé

  Non

Plateforme utilisée pour l'analyse des données

Autre (système fils)

Acteurs finançant et participant à l'étude

Responsable(s) de traitement

Type de responsable de traitement 1

Autre

Responsable de traitement 1

FILIERE INTELLIGENCE ARTIFICIELLE & CANCERS

Rue d'Oradour-Sur-Glane 75015 Paris 75015 Paris France

Localisation du responsable de traitement 1
  Dans l'UE
Représentant du responsable de traitement 1

Responsable(s) de mise en oeuvre non cités comme responsable de traitement

Responsable de mise en oeuvre non cité comme responsable de traitement 1

RANDOMIZED CLINICAL TRIALS (nom commercial : RCTs)

38 Rue du Plat 69002 Lyon 69002 LYON France

Calendrier du projet

Date de début : 17/01/2027 – Date de fin : 17/09/2028 Durée de l'étude : 20
Etape 1 : Dépôt du projet
21/07/2026
Etape 2 : Complétude
27/07/2026
Etape 3 : Avis CEREES/CESREES
10/09/2026
Etape 4 : Sens avis CEREES/CESREES
Favorable avec recommandation

Base légale pour accéder aux données

Encadrement réglementaire

Autorisation CNIL

Destinataire(s) des données

Destinataire des données 1

RANDOMIZED CLINICAL TRIALS (nom commercial : RCTs)

38 Rue du Plat 69002 Lyon 69002 Lyon France

Durée de conservation aux fins du projet (en années)

2

Existence d'une prise de décision automatisée

  Non

Fondement juridique

Article 6 du RGPD (Licéité du traitement)

(1)(f) intérêts légitimes du responsable de traitement

Article 9 du RGPD (Exception permettant de traiter des données de santé)

(2)(j) archives, recherche scientifique ou historique, ou statistiques

Transfert de données personnelles vers un pays hors UE

  Non

Droits des personnes

Modalités concrètes d'information des patients

L'information des patients concernant le projet DANTE s'inscrit dans le parcours même de l'accès précoce : lorsque les industriels détenteurs des molécules proposent, via les médecins prescripteurs, un accès précoce intégrant le volet DANTE, les patients reçoivent dès cette étape une notice d'information mentionnant l'étude.

La note d'information dédiée à DANTE (jointe à cette demande), qui détaille précisément les finalités du traitement, les données utilisées, la durée de conservation et l'ensemble des droits RGPD, leur est également transmise.

Compte tenu du nombre limité de patients concernés (147 patients au total), lors des visites de suivi, les praticiens sont en mesure de mentionner et présenter directement cette note aux patients.

Sur cette base d'information, les patients disposent des droits suivants, exerçables à tout moment, sans justification et sans impact sur leur prise en charge médicale, auprès du DPO (dpo@filiere-ia.fr ou par courrier) :

- Droit d'accès (art. 15) : consulter les données pseudonymisées les concernant et en obtenir copie ;
- Droit de rectification (art. 16) : demander la correction d'une information inexacte, incomplète ou obsolète ;
- Droit à l'effacement (art. 17) : demander la suppression de tout ou partie de leurs données ;
- Droit à la limitation (art. 18) : demander la suspension temporaire de l'usage de leurs données, notamment le temps d'une vérification ;
- Droit à la portabilité (art. 20) : non applicable, le traitement reposant sur l'intérêt légitime (art. 6.1.f) et non sur le consentement ou l'exécution d'un contrat.

Le droit d'opposition (art. 21), présenté comme la contrepartie déterminante de l'absence de recueil du consentement, peut être exercé à tout moment sans condition — y compris pour la phase 2 (bras de référence) — via un formulaire de refus joint à la note d'information, à retourner de préférence sous 30 jours (délai indicatif, non impératif).

Aucun profilage ni décision individuelle automatisée (art. 22) n'est mis en œuvre.

Délégué à la protection des données

FILIERE INTELLIGENCE ARTIFICIELLE & CANCERS

Rue d'Oradour-Sur-Glane 75015 Paris 75015 Paris France