Catégorie : Données de Recherche

  • Plan de gestion des données (PGD/DMP) pour la thèse et le master : guide OPIDoR 2026

    Plan de gestion des données (PGD/DMP) pour la thèse et le master : guide OPIDoR 2026

    Plan de gestion des données (PGD/DMP) pour la thèse et le master : guide OPIDoR 2026

    Votre directeur de thèse vous demande un plan de gestion des données, l’ANR l’exige avant le premier versement, ou votre établissement vous y oblige en vertu d’un décret paru fin 2021 : dans tous ces cas, vous vous retrouvez face à un document dont personne ne vous a expliqué ni la structure, ni les enjeux réels. Le plan de gestion des données mémoire thèse 2026 n’est pas une formalité administrative de plus — c’est l’outil qui protège vos données, sécurise votre travail contre la perte accidentelle et démontre votre rigueur scientifique à tout jury ou évaluateur. Ce guide pratique vous donne tout ce qu’il faut savoir : cadre légal exact, outil OPIDoR, les sept rubriques standard et la procédure pas à pas pour rédiger votre premier PGD.

    Que vous soyez doctorant en début de thèse, masterant en M2 avec des données d’entretiens ou un jeu de données quantitatif, ou encore chercheur junior soumettant un projet ANR ou Horizon Europe, ce guide vous accompagne de la première rubrique à la validation finale. Les exigences ont évolué en 2026 : les établissements publics de recherche sont désormais soumis à une obligation légale explicite, et les financeurs européens ont renforcé leurs critères d’évaluation des DMP.

    En bref : Un plan de gestion des données (PGD ou DMP) est un document structuré en 7 rubriques qui décrit comment vous collectez, documentez, stockez, protégez et partagez vos données de recherche tout au long de votre projet. En France, le Décret n° 2021-1572 du 3 décembre 2021 le rend obligatoire dans les établissements publics de recherche. L’outil gratuit recommandé est DMP OPIDoR, opéré par l’INIST-CNRS.

    Le Décret n° 2021-1572 du 3 décembre 2021, publié au Journal officiel, définit les exigences d’intégrité scientifique applicables aux établissements publics contribuant au service public de la recherche ainsi qu’aux fondations reconnues d’utilité publique dont la recherche publique constitue l’activité principale. Son article 6 — confirmé par plusieurs universités françaises dans leur documentation interne — impose aux chercheurs de ces établissements de rédiger un plan de gestion des données dans le cadre de leurs projets de recherche.

    L’intégrité scientifique y est définie comme l’ensemble des règles et valeurs qui doivent régir les activités de recherche pour en garantir le caractère honnête et scientifiquement rigoureux. Le plan de gestion des données s’inscrit directement dans cette logique : il documente les choix méthodologiques relatifs aux données, rend la recherche reproductible, et prévient les risques de perte, de manipulation ou de mauvaise utilisation des données primaires.

    Pour les doctorants, ce décret s’applique dès le premier jour d’inscription. Pour les masterants en M2 réalisant un mémoire de recherche avec collecte de données empiriques, la rédaction d’un PGD — même simplifié — constitue une bonne pratique fortement encouragée par les écoles doctorales et les bibliothèques universitaires, et parfois exigée par les directeurs de mémoire.

    Point de vigilance : Le décret cible les établissements publics de recherche. Si vous êtes inscrit dans une grande école privée ou un organisme non soumis au service public de la recherche, vérifiez le règlement intérieur de votre établissement. En pratique, la quasi-totalité des écoles doctorales françaises ont intégré cette exigence dans leurs chartes.

    Qu’est-ce qu’un PGD/DMP ? Définition et enjeux

    Un plan de gestion des données (PGD en français, DMP pour Data Management Plan en anglais) est un document évolutif qui décrit, à chaque étape du cycle de vie de la recherche, comment les données sont collectées, traitées, documentées, stockées, protégées et, le cas échéant, partagées ou archivées à long terme. Il ne s’agit pas d’un document figé : le PGD s’actualise au fil du projet, notamment lors de changements méthodologiques ou de nouvelles contraintes éthiques identifiées en cours de terrain.

    Trois enjeux majeurs justifient la rédaction d’un PGD pour tout mémoire ou thèse comportant de la collecte de données :

    • Protection contre la perte : identifier dès le départ les stratégies de sauvegarde (règle 3-2-1 : 3 copies, sur 2 supports différents, dont 1 hors site) protège des années de travail.
    • Conformité RGPD et éthique : toute collecte de données personnelles (entretiens, questionnaires avec données identifiantes) doit être encadrée par une base légale explicite et un protocole d’anonymisation documenté — voir à ce sujet le guide complet sur le protocole RGPD pour entretiens de mémoire 2026.
    • Valorisation et partage : un PGD bien rédigé facilite le dépôt dans un entrepôt de données certifié et la citation de vos données par d’autres chercheurs, renforçant l’impact de vos travaux.

    Le PGD s’inscrit dans le mouvement international pour la science ouverte et les données FAIR (Findable, Accessible, Interoperable, Reusable). Ces quatre principes — trouvabilité, accessibilité, interopérabilité, réutilisabilité — constituent le socle de toute politique de gestion des données moderne, qu’il s’agisse d’une thèse de doctorat ou d’un grand projet de recherche financé par l’Union européenne.


    📊 Cycle de vie des données de recherche — Ressource interactive INIST-CNRS
    Source : DoRANum / INIST-CNRS — Licence CC BY-NC-SA

    OPIDoR : l’outil gratuit de l’INIST-CNRS

    DMP OPIDoR (Outil en ligne pour un Plan de gestion de données Ouvert et Réutilisable) est la plateforme de référence en France pour rédiger son plan de gestion des données. Opérée par l’INIST-CNRS (Institut de l’information scientifique et technique du Centre national de la recherche scientifique), elle est accessible gratuitement à l’adresse dmp.opidor.fr.

    OPIDoR propose plusieurs ressources adaptées aux étudiants comme aux chercheurs confirmés :

    • Modèles de plans publics : des gabarits préconfigurés selon le financeur (ANR, Horizon Europe) ou la discipline permettent de ne pas partir d’une page blanche.
    • Groupes de guidage : des ensembles de recommandations organisées par communauté disciplinaire, rédigées par des experts de domaine.
    • Plans publics en exemple : des PGD réels (anonymisés ou publics) illustrent ce qu’un plan finalisé doit contenir.
    • Glossaire et ressources pédagogiques : définitions des types de données de recherche, FAQ technique, accès API pour les établissements.

    Pour créer votre compte OPIDoR, rendez-vous sur dmp.opidor.fr et utilisez de préférence votre identifiant institutionnel (via la fédération d’identité éducation/recherche). Une fois connecté, sélectionnez le modèle correspondant à votre financeur ou, à défaut, le modèle générique. L’outil vous guidera rubrique par rubrique avec des questions directrices et des exemples de réponses.

    Pour compléter votre apprentissage de l’outil, la plateforme DoRANum (Données de la Recherche : Apprentissage NUMérique) propose un module interactif spécifiquement dédié à la prise en main d’OPIDoR, accessible sans inscription. De nombreuses bibliothèques universitaires françaises, comme celle d’Aix-Marseille Université, proposent également des tutoriels en quatre étapes rédigés par leur cellule Science ouverte — consultez notamment les ressources en ligne de l’AMU.

    Les 7 rubriques standard d’un DMP expliquées

    Quel que soit le modèle utilisé (ANR, Horizon Europe, institutionnel), un plan de gestion des données s’articule autour de sept rubriques fondamentales. Le tableau ci-dessous synthétise leur contenu et les questions directrices associées.

    Les 7 rubriques standard d’un plan de gestion des données
    # Rubrique Questions directrices
    1 Collecte et description des données Quels types de données ? Quels formats ? Quel volume estimé ? Des données existantes sont-elles réutilisées ?
    2 Documentation et métadonnées Quelles informations permettront d’interpréter les données dans 10 ans ? Quels standards de métadonnées (Dublin Core, DataCite) ?
    3 Stockage et sauvegarde Où les données sont-elles stockées ? Quelle stratégie de sauvegarde (règle 3-2-1) ? Qui a accès ? Quelle sécurité (chiffrement, ISO 27001) ?
    4 Éthique et conformité légale Y a-t-il des données personnelles (RGPD) ? Un comité d’éthique est-il requis ? Quelles conditions de confidentialité ? Quels consentements obtenus ?
    5 Conservation à long terme Quelles données méritent d’être conservées après le projet ? Pour combien de temps ? Dans quel entrepôt ? Quels formats pérennes (PDF/A, CSV, TIFF) ?
    6 Partage et diffusion Les données seront-elles ouvertes ou soumises à embargo ? Dans quel entrepôt (Zenodo, Recherche Data Gouv, Nakala) ? Quelle licence (Creative Commons) ?
    7 Responsabilités et ressources Qui est responsable de chaque tâche ? Quels coûts humains et techniques sont associés (stockage, curation) ?

    Rubrique 1 — Collecte et description des données

    Décrivez précisément la nature de vos données : données textuelles (transcriptions d’entretiens, notes de terrain), numériques (tableurs de mesures, bases de données statistiques), visuelles (photographies, vidéos) ou mixtes. Précisez les formats de fichier — privilégiez les formats ouverts (CSV, TXT, ODT) aux formats propriétaires (XLSX, DOCX) pour garantir la pérennité. Si vous réutilisez des données existantes (bases publiques, corpus en ligne), indiquez leur source et les conditions de réutilisation.

    Rubrique 4 — Éthique et conformité RGPD

    Cette rubrique est souvent celle qui demande le plus d’attention pour les masterants et doctorants en sciences humaines et sociales. Toute collecte de données personnelles (entretiens enregistrés, questionnaires comportant des données identifiantes directes ou indirectes) doit reposer sur une base légale explicite au sens du RGPD (article 6), généralement le consentement éclairé de la personne enquêtée. Documentez dans votre PGD : le formulaire de consentement utilisé, la procédure d’anonymisation ou de pseudonymisation, la durée de conservation des données brutes et les mesures de sécurité adoptées. Pour une méthodologie complète de mise en conformité, consultez notre guide détaillé sur le protocole RGPD pour entretiens de mémoire 2026.

    Rubrique 6 — Partage et diffusion

    Le partage des données est au cœur de la politique de science ouverte. En France, les principaux entrepôts recommandés sont Recherche Data Gouv (portail national généraliste), Nakala (données en SHS, opéré par la TGIR Huma-Num), et Zenodo (plateforme européenne du CERN, acceptant toutes les disciplines). Pour les thèses, le dépôt dans l’entrepôt de votre établissement est souvent possible en parallèle du dépôt institutionnel sur HAL/DUMAS. Pensez à appliquer une licence Creative Commons (CC BY 4.0 recommandée pour les données ouvertes) et à indiquer si un embargo temporaire est justifié (valorisation commerciale, données sensibles).

    Rédiger son PGD étape par étape

    Voici la procédure recommandée pour créer votre premier plan de gestion des données via OPIDoR, de la connexion à la validation finale.

    1. Créez votre compte OPIDoR : Rendez-vous sur dmp.opidor.fr et connectez-vous via votre identifiant institutionnel ou créez un compte avec votre adresse email universitaire. La connexion via la fédération d’identité éducation/recherche (eduGAIN) est recommandée si votre établissement la supporte.
    2. Sélectionnez ou créez un plan : Cliquez sur « Créer un plan ». Donnez-lui un titre explicite (ex. : PGD — Mémoire M2 Sociologie — Données d’entretiens sur les pratiques numériques — 2025-2026). Choisissez votre établissement dans la liste pour obtenir des recommandations contextualisées.
    3. Choisissez le bon modèle : OPIDoR propose des modèles spécifiques ANR, Horizon Europe, et des modèles institutionnels. Si votre recherche n’est pas financée par un appel à projets, sélectionnez le modèle générique Science Europe ou le modèle de votre établissement. Pour une thèse ANR, le modèle ANR 2023 est le plus récent disponible.
    4. Répondez aux 7 rubriques : Ne cherchez pas l’exhaustivité dès la première version. Répondez honnêtement en indiquant ce que vous savez, ce qui est incertain et ce qui reste à décider. L’outil accepte les réponses partielles ; le PGD sera complété au fil du projet. Chaque rubrique comporte des questions directrices et des exemples de réponses adaptées à votre discipline.
    5. Faites relire par votre bibliothèque universitaire : La plupart des BU françaises disposent d’un service dédié aux données de recherche (souvent rattaché à la cellule Science ouverte). Soumettez votre PGD pour relecture avant de le finaliser — c’est gratuit et les bibliothécaires-documentalistes connaissent les attentes des financeurs locaux.
    6. Exportez et déposez : OPIDoR permet d’exporter le PGD en PDF ou en JSON (pour interopérabilité avec d’autres outils). Si votre financeur exige un dépôt dans son espace dédié (portail ANR, espace projet Horizon Europe), exportez en PDF et déposez via l’interface du financeur. Conservez une copie dans votre dossier de projet.
    7. Mettez à jour à chaque jalon : Le PGD doit évoluer avec votre projet. Planifiez une révision à mi-parcours (ex. : après la collecte de données) et une révision finale (avant la soutenance ou la clôture du projet). Indiquez la date de dernière mise à jour sur la page de couverture du document.

    Exigences ANR et Horizon Europe en 2026

    Les deux principaux financeurs de la recherche pour les chercheurs et doctorants en France ont des politiques de gestion des données distinctes mais convergentes.

    ANR (Agence Nationale de la Recherche)

    L’ANR exige un plan de gestion des données pour tous les projets qu’elle finance depuis 2019. Le PGD doit être soumis dans les six premiers mois suivant le démarrage officiel du projet et mis à jour à chaque jalon. L’ANR s’appuie sur le modèle Science Europe, disponible directement dans OPIDoR sous la dénomination « modèle ANR ». Les données doivent respecter les principes FAIR et, dans la mesure du possible, être déposées dans un entrepôt certifié — l’ANR recommande prioritairement Recherche Data Gouv.

    Horizon Europe (Commission européenne)

    Le programme-cadre européen pour la recherche et l’innovation Horizon Europe va plus loin : le PGD est obligatoire pour tous les projets financés, le premier livrable devant être soumis dans les six premiers mois. La Commission européenne exige que les données soient « aussi ouvertes que possible, aussi fermées que nécessaire » (as open as possible, as closed as necessary). Le modèle Horizon Europe est disponible dans OPIDoR et intègre des sections spécifiques sur les logiciels et codes sources. Un embargo peut être accordé pour des données commercialement sensibles ou soumises à des contraintes éthiques légitimes, mais doit être explicitement justifié dans le PGD.

    Conseil pratique : Si vous êtes doctorant dans un laboratoire porteur d’un contrat ANR ou Horizon Europe, votre PGD de thèse peut être aligné avec le PGD du projet. Demandez à votre directeur de thèse ou au responsable scientifique du projet si un PGD de contrat existe — vous pourrez vous en inspirer pour votre propre document.

    Erreurs fréquentes à éviter

    L’analyse des plans soumis par des doctorants et masterants français révèle un ensemble d’erreurs récurrentes que l’on peut facilement éviter avec une bonne information préalable.

    • Rédiger le PGD une seule fois et ne jamais le mettre à jour : Le plan est conçu comme un document évolutif. Un PGD non actualisé depuis la phase de conception ne correspond plus à la réalité du terrain.
    • Omettre la rubrique éthique/RGPD : Beaucoup d’étudiants considèrent que leurs données ne sont « pas vraiment personnelles » car anonymisées a posteriori. Rappel : dès que vous collectez des données sur des individus identifiables — même temporairement — le RGPD s’applique. Documentez chaque étape de l’anonymisation.
    • Choisir des formats de fichiers propriétaires pour l’archivage : Stocker vos données définitives uniquement en .xlsx ou .docx expose à une inaccessibilité future. Convertissez en formats pérennes (CSV, TXT, PDF/A) pour l’archivage long terme. Consultez également notre guide sur la publication de mémoire sur HAL/DUMAS pour comprendre les exigences de format à l’étape du dépôt.
    • Ne pas indiquer de responsable clairement identifié : La rubrique 7 est souvent expédiée. Pour une thèse individuelle, le doctorant est certes le principal responsable, mais précisez le rôle du directeur de thèse, du laboratoire et de la bibliothèque dans la chaîne de conservation.
    • Négliger l’évaluation des coûts : Stocker des téraoctets de données vidéo sur un serveur institutionnel a un coût. Anticiper ces ressources dans le PGD, même approximativement, montre la maturité de votre approche aux évaluateurs.
    • Confondre entrepôt de données et archive institutionnelle : HAL et DUMAS sont des archives pour les publications et mémoires ; elles ne sont pas conçues pour héberger des jeux de données bruts. Utilisez un entrepôt dédié (Zenodo, Recherche Data Gouv, Nakala) pour vos données primaires.

    FAQ — Plan de gestion des données mémoire thèse 2026

    Le plan de gestion des données est-il obligatoire pour un mémoire de master ?

    Pour un mémoire de master, le PGD n’est pas encore légalement obligatoire au sens du Décret 2021-1572 (qui cible les chercheurs des établissements publics). Cependant, de nombreux directeurs de mémoire l’exigent dès que le mémoire comporte une collecte de données empiriques (entretiens, questionnaires, observation). À minima, sa rédaction est vivement recommandée : elle structure la démarche, protège le travail contre la perte de données et constitue un atout lors de la soutenance.

    OPIDoR est-il le seul outil pour rédiger un DMP en France ?

    Non. D’autres outils existent, comme DMPonline (développé par le DCC britannique) ou RDMO (Research Data Management Organiser). Cependant, OPIDoR est l’outil de référence recommandé par la grande majorité des universités françaises, les bibliothèques universitaires et l’ANR, car il est opéré par l’INIST-CNRS, disponible en français et intègre des modèles adaptés au contexte de la recherche française et européenne.

    Quelle est la différence entre un PGD et un registre des traitements RGPD ?

    Le PGD couvre l’intégralité du cycle de vie des données de recherche (collecte, documentation, stockage, partage, archivage) et a une finalité scientifique et institutionnelle. Le registre des traitements RGPD est un document juridique spécifique, tenu par le délégué à la protection des données (DPO) de l’établissement, qui recense les traitements de données personnelles. Les deux documents sont complémentaires : la rubrique 4 de votre PGD (éthique et conformité légale) doit être cohérente avec ce que le DPO a enregistré pour votre projet.

    Que faire si mes données sont confidentielles et ne peuvent pas être partagées ?

    La politique de science ouverte est « aussi ouverte que possible, aussi fermée que nécessaire ». Si vos données sont confidentielles (données cliniques identifiables, données issues d’entreprises sous accord de confidentialité, données sensibles relevant de l’article 9 du RGPD), vous pouvez opter pour un accès restreint ou un embargo dans votre PGD. L’essentiel est d’expliquer clairement la raison de cette restriction, sa durée et la procédure d’accès pour les chercheurs légitimes. OPIDoR prévoit ces options dans ses modèles.

    Combien de pages doit faire un PGD pour une thèse ?

    Il n’existe pas de norme de longueur fixe. Un PGD de thèse pour un projet individuel en SHS avec des entretiens semi-directifs tient généralement en 5 à 10 pages. Un projet en sciences expérimentales avec de grands volumes de données (imagerie, séquençage) peut nécessiter 15 à 20 pages. Pour un mémoire de master, un PGD simplifié de 2 à 4 pages suffit dans la plupart des cas. L’ANR et Horizon Europe n’imposent pas de limite de pages mais évaluent la qualité et la complétude des réponses.

    Quels entrepôts de données sont recommandés pour les chercheurs en France ?

    Recherche Data Gouv est le portail national généraliste soutenu par le Ministère de l’enseignement supérieur et de la recherche — il est recommandé en premier lieu par l’ANR. Nakala (TGIR Huma-Num) est spécialisé dans les données en sciences humaines et sociales. Zenodo (CERN) est une solution européenne pluridisciplinaire, gratuite, attribuant des DOI. Pour les disciplines spécifiques, le registre re3data.org répertorie plus de 2 000 entrepôts certifiés et permet de filtrer par discipline, pays et type de données.

    Le plan de gestion des données doit-il figurer en annexe de la thèse ou du mémoire ?

    Non, le PGD n’est pas un appendice de la thèse ou du mémoire : c’est un document de gestion de projet qui reste dans l’espace de travail du chercheur et de son établissement. Il n’est pas soumis au jury de soutenance. En revanche, vous pouvez vous appuyer sur son contenu pour rédiger la section méthodologique de votre chapitre sur le terrain (description des données, procédures de collecte, mesures éthiques), ce qui renforce la rigueur de votre texte académique.

    Rédigez votre mémoire avec l’appui de l’IA

    Structurer un plan de gestion des données, rédiger un chapitre méthodologique conforme aux exigences RGPD et science ouverte, organiser la bibliographie selon les normes APA ou Chicago — autant de tâches que Tesify peut vous aider à aborder avec rigueur et efficacité. Découvrez comment l’outil accompagne chercheurs et masterants dans la rédaction académique.

    Essayer Tesify gratuitement →

  • Où Trouver des Jeux de Données Ouvertes (Open Data) pour son Mémoire : 25 Sources par Discipline 2026

    Où Trouver des Jeux de Données Ouvertes (Open Data) pour son Mémoire : 25 Sources par Discipline 2026

    Où Trouver des Jeux de Données Ouvertes (Open Data) pour son Mémoire : 25 Sources par Discipline 2026

    Trouver des données à analyser — et non simplement des articles à lire — est l’un des blocages les plus fréquents lors de la rédaction d’un mémoire de master. La confusion est compréhensible : bases bibliographiques et entrepôts de jeux de données sont des outils distincts. Un jeu de données ouvert (open data) est un fichier brut — tableau CSV, fichier SPSS, géodonnées, séries temporelles — que vous importez dans votre logiciel d’analyse pour produire vos propres résultats. Accéder aux bons jeux de données open data pour son mémoire peut transformer une étude de cas fragile en une démonstration empirique solide et citable.

    Cette liste recense 25 sources classées par discipline ou domaine d’usage. Pour chaque entrée : ce qu’elle contient, le type de données proposé, la condition d’accès (libre, inscription gratuite ou restreint sur dossier) et un conseil de citation au format APA 7. La plupart sont gratuites et accessibles depuis un compte étudiant ordinaire ; quelques-unes demandent un dossier justificatif, notamment en santé.

    En résumé : Pour un mémoire de master, les portails les plus accessibles sont data.gouv.fr (données publiques françaises, libre), Zenodo (multidisciplinaire, libre) et Eurostat (données UE, libre). Pour les sciences sociales françaises, Quetelet-Progedo est la référence. En santé, le Health Data Hub reste soumis à dossier. Chaque jeu de données doit être cité avec son DOI ou URL stable au format APA 7.

    Pourquoi utiliser des données ouvertes dans son mémoire ?

    L’analyse secondaire de données existantes présente plusieurs avantages concrets par rapport à la collecte primaire. D’abord, les échantillons sont souvent bien plus larges que ce qu’un étudiant peut obtenir seul via un questionnaire diffusé sur les réseaux. Ensuite, les données officielles (INSEE, Eurostat, OMS) bénéficient d’une méthodologie documentée et reconnue par les jurys. Enfin, citer un jeu de données avec un DOI permanent renforce la reproductibilité de votre analyse, ce qui est attendu dans tout mémoire à visée quantitative.

    Avant de commencer, pensez à rédiger un plan de gestion des données (PGD) même sommaire : notez l’origine de chaque fichier, sa licence, la date de téléchargement et le traitement que vous lui avez appliqué. C’est une bonne pratique qui facilitera la rédaction de votre section méthodologique.

    1. Portails généralistes

    Ces cinq plateformes couvrent plusieurs disciplines et constituent le premier point d’entrée pour la majorité des recherches.

    Cartographie des principaux portails de données ouvertes accessibles pour un mémoire de master, organisés par catégorie
    Principales catégories de portails open data accessibles aux étudiants en master : du généraliste à la donnée disciplinaire

    1. data.gouv.fr

    La plateforme nationale des données publiques françaises, gérée par la direction interministérielle du numérique (DINUM). Elle recense plus de 71 000 jeux de données provenant de l’État, des collectivités territoriales et d’organismes publics : résultats électoraux, statistiques de transport, données foncières, comptes des collectivités, etc.

    • Type de données : Fichiers CSV, GeoJSON, XLS, API REST
    • Accès : Libre (sans inscription pour le téléchargement)
    • Citation APA 7 : Producteur, A. (année). Titre du jeu de données [Jeu de données]. data.gouv.fr. https://www.data.gouv.fr/datasets/[identifiant]

    2. Recherche Data Gouv

    L’entrepôt national dédié aux données de la recherche académique française. Hébergé par le MESRI et labellisé CoreTrustSeal, il regroupe des données produites par des équipes de recherche universitaires. Chaque dépôt est versionné et se voit attribuer un DOI permanent. Contrairement à data.gouv.fr, le contenu est ici orienté vers les jeux de données produits dans le cadre de projets de recherche publiés.

    • Type de données : Données de sondage, données expérimentales, corpus textuels, données géospatiales
    • Accès : Libre pour les dépôts publics ; inscription gratuite pour déposer
    • Citation APA 7 : Auteur(s). (année). Titre (version X.X) [Jeu de données]. Recherche Data Gouv. https://doi.org/xxxxx

    3. Zenodo (CERN)

    Entrepôt généraliste créé par le CERN et financé par la Commission européenne. Zenodo accueille des données de toutes disciplines, avec attribution automatique d’un DOI. C’est l’une des références mondiales pour le dépôt de données associées à des publications en accès ouvert.

    • Type de données : Multidisciplinaire (données, logiciels, preprints, présentations)
    • Accès : Libre pour les dépôts publics
    • Citation APA 7 : Auteur(s). (année). Titre [Jeu de données]. Zenodo. https://doi.org/10.5281/zenodo.[ID]

    4. Kaggle Datasets

    Plateforme communautaire orientée data science et machine learning. Kaggle héberge des milliers de jeux de données nettoyés et annotés, souvent accompagnés de notebooks d’analyse en Python ou R. Très utile pour les mémoires en gestion, marketing, ou informatique qui mobilisent des approches prédictives.

    • Type de données : CSV structurés, images, textes, données de compétitions
    • Accès : Inscription gratuite obligatoire
    • Citation APA 7 : Auteur. (année). Titre [Jeu de données]. Kaggle. https://www.kaggle.com/datasets/[identifiant]

    5. Google Dataset Search

    Un moteur de recherche dédié aux jeux de données indexés sur le web (datasetsearch.research.google.com). Google Dataset Search n’héberge pas les données mais permet de trouver des fichiers référencés sur des milliers de dépôts institutionnels. Utile pour des requêtes thématiques larges quand on ne sait pas encore où chercher.

    • Type de données : Tous types (lien vers la source d’origine)
    • Accès : Libre (moteur de recherche uniquement)
    • Citation APA 7 : Citer la source originale trouvée via le moteur, pas Google Dataset Search lui-même

    2. Données officielles françaises

    Ces cinq sources émanent directement d’institutions publiques françaises. Leur rigueur méthodologique est documentée, ce qui facilite la justification de votre cadre empirique devant le jury.

    6. INSEE — Données brutes et fichiers détail

    L’Institut national de la statistique et des études économiques publie bien plus que des tableaux en ligne : des fichiers détail anonymisés (recensements, enquêtes Emploi, SRCV, DADS, etc.) sont téléchargeables. La section « Fichiers de données » de chaque enquête donne accès aux micro-données pour les analyses statistiques avancées.

    • Type de données : Démographie, emploi, revenus, prix, logement (micro-données et agrégats)
    • Accès : Libre pour les agrégats ; les fichiers détail les plus sensibles passent par le CASD (voir ci-dessous)
    • Citation APA 7 : INSEE. (année). Titre de l’enquête ou du fichier [Jeu de données]. https://www.insee.fr/fr/statistiques/[identifiant]

    7. Banque de France — Webstat

    Le portail Webstat de la Banque de France donne accès à ses séries chronologiques : taux d’intérêt, agrégats monétaires, balance des paiements, statistiques bancaires. Les données sont exportables en CSV ou Excel, avec historique parfois centenaire pour certaines séries.

    • Type de données : Séries temporelles économiques et monétaires
    • Accès : Libre
    • Citation APA 7 : Banque de France. (année). Nom de la série [Jeu de données]. Webstat. https://webstat.banque-france.fr/

    8. DREES — Direction de la recherche, des études, de l’évaluation et des statistiques

    La DREES (rattachée aux ministères sanitaires et sociaux) publie des données sur la santé, le social et la dépendance : dépenses de santé, revenus des professionnels de santé, données hospitalières, minima sociaux, personnes âgées. Ses données sont accessibles via son site et via data.gouv.fr.

    • Type de données : Santé, protection sociale, handicap, personnes âgées
    • Accès : Libre
    • Citation APA 7 : DREES. (année). Titre [Jeu de données]. Ministère de la Santé. https://drees.solidarites-sante.gouv.fr/

    9. SIES — Système d’Information sur l’Enseignement Supérieur

    Le SIES (Ministère de l’Enseignement Supérieur et de la Recherche) publie les statistiques sur les étudiants, les formations, l’insertion professionnelle des diplômés et les personnels de l’ESR. Indispensable pour tout mémoire portant sur l’enseignement supérieur français.

    • Type de données : Effectifs étudiants, résultats, insertion professionnelle, ressources des universités
    • Accès : Libre
    • Citation APA 7 : MESRI-SIES. (année). Titre de la publication statistique [Jeu de données]. https://www.enseignementsup-recherche.gouv.fr/

    10. Nakala (Huma-Num / CNRS)

    Entrepôt de données en sciences humaines et sociales (SHS) géré par l’infrastructure nationale Huma-Num. Nakala assigne un DOI à chaque ressource déposée et prend en charge des formats variés : images de manuscrits, corpus audio, enquêtes ethnographiques, bases prosopographiques. C’est la plateforme de référence pour les données patrimoniales et culturelles numériques.

    • Type de données : Corpus textuels, images, archives orales, données de terrain SHS
    • Accès : Libre pour les dépôts publics ; inscription gratuite pour déposer ou accéder à certains corpus
    • Citation APA 7 : Auteur(s). (année). Titre [Jeu de données]. Nakala/Huma-Num. https://doi.org/xxxxx

    3. Sources européennes et internationales

    11. Eurostat

    L’office statistique de l’Union européenne produit des données harmonisées couvrant les 27 États membres : emploi, PIB, commerce, environnement, santé, éducation, agriculture. Toutes les données sont téléchargeables via le navigateur de données ou l’API. La comparabilité entre pays est un atout majeur pour les mémoires à dimension comparée.

    • Type de données : Indicateurs socio-économiques et sectoriels harmonisés à l’échelle de l’UE
    • Accès : Libre
    • Citation APA 7 : Eurostat. (année). Nom de l’indicateur [Jeu de données]. Commission européenne. https://ec.europa.eu/eurostat/databrowser/

    12. data.europa.eu

    Le portail officiel de données ouvertes de l’Union européenne agrège les publications d’Eurostat, du Parlement, de la Commission, des agences européennes et des États membres. Depuis juillet 2026, les données INSPIRE (géospatiales) y sont également indexées. Il offre un niveau de couverture thématique plus large qu’Eurostat seul.

    • Type de données : Géospatiales, politiques, environnementales, statistiques institutionnelles
    • Accès : Libre
    • Citation APA 7 : Nom de l’institution productrice. (année). Titre [Jeu de données]. data.europa.eu. https://data.europa.eu/data/datasets/[identifiant]

    13. Banque mondiale — World Bank Open Data

    La Banque mondiale propose un accès gratuit et ouvert à des milliers d’indicateurs de développement mondial : PIB par habitant, pauvreté, accès à l’eau, mortalité infantile, scolarisation. La DataBank permet des sélections personnalisées et des exports en CSV ou Excel. La Microdata Library donne accès aux enquêtes auprès des ménages de pays en développement.

    • Type de données : Indicateurs macroéconomiques, sociaux, environnementaux (190+ pays)
    • Accès : Libre (Microdata Library : inscription gratuite)
    • Citation APA 7 : Banque mondiale. (année). Nom de l’indicateur [Jeu de données]. https://donnees.banquemondiale.org/

    14. OCDE Data Explorer

    Depuis 2024, l’OCDE a adopté un modèle d’accès ouvert pour la quasi-totalité de ses données statistiques. Le Data Explorer (data-explorer.oecd.org) centralise les séries sur l’éducation (Education at a Glance), la santé, la productivité, les inégalités et les finances publiques des pays membres. Particulièrement pertinent pour les mémoires en économie, sciences de l’éducation ou politiques publiques.

    • Type de données : Éducation, santé, économie, emploi, gouvernance (38 pays OCDE)
    • Accès : Libre depuis 2024
    • Citation APA 7 : OCDE. (année). Nom de la série [Jeu de données]. OCDE Data Explorer. https://data-explorer.oecd.org/

    15. OMS — Global Health Observatory

    L’Observatoire mondial de la santé de l’Organisation mondiale de la santé propose des données épidémiologiques, de mortalité, de couverture vaccinale et de systèmes de santé pour plus de 190 pays. Les fichiers sont exportables en CSV et des API permettent l’intégration directe dans R ou Python.

    • Type de données : Épidémiologie, mortalité, santé maternelle, couverture sanitaire universelle
    • Accès : Libre
    • Citation APA 7 : OMS. (année). Titre de l’indicateur [Jeu de données]. Organisation mondiale de la santé. https://www.who.int/data/gho/

    4. Sciences sociales et humanités

    Ces plateformes sont spécialisées dans les enquêtes quantitatives sur les comportements, attitudes et conditions de vie des populations. Elles requièrent généralement une inscription gratuite avec justificatif académique.

    16. Quetelet-Progedo Diffusion

    Service national de diffusion des données en sciences sociales, rattaché à l’infrastructure PROGEDO et hébergé sur Recherche Data Gouv. Quetelet-Progedo met à disposition les grandes enquêtes françaises (enquête Emploi, ESPS, PISA, European Social Survey, Eurobaromètre, baromètres politiques CEVIPOF). C’est la porte d’entrée principale pour tout mémoire en sociologie, science politique ou économie du travail.

    • Type de données : Fichiers SPSS, Stata, CSV issus d’enquêtes en population
    • Accès : Inscription gratuite avec adresse institutionnelle ; certaines enquêtes nécessitent un engagement de confidentialité
    • Citation APA 7 : Producteur de l’enquête. (année). Nom de l’enquête (vague N) [Jeu de données]. Quetelet-Progedo Diffusion. https://doi.org/xxxxx

    17. CDSP — Centre de données socio-politiques (Sciences Po)

    Le CDSP archive et diffuse des données sur la vie politique et électorale française : sondages post-électoraux, enquêtes sur les attitudes politiques, données de résultats électoraux géolocalisés. Il est particulièrement utile pour les mémoires en science politique, sociologie électorale ou communication politique.

    • Type de données : Enquêtes électorales, sondages d’opinion, données de vote agrégées
    • Accès : Inscription gratuite
    • Citation APA 7 : Auteur(s). (année). Titre de l’enquête [Jeu de données]. CDSP/Sciences Po. https://cdsp.sciences-po.fr/

    18. UK Data Service

    Principal entrepôt de données en sciences sociales du Royaume-Uni, financé par le UK Research and Innovation (UKRI). Il héberge des enquêtes longitudinales de référence mondiale (British Household Panel Study, Understanding Society) et le dépôt de l’European Social Survey. Incontournable pour les approches comparatives franco-britanniques ou les analyses de panel.

    • Type de données : Enquêtes longitudinales, données de panel, données qualitatives transcrites
    • Accès : Inscription gratuite avec adresse institutionnelle
    • Citation APA 7 : Auteur(s). (année). Titre [Jeu de données]. UK Data Service. https://doi.org/xxxxx

    19. GESIS — Leibniz Institute for Social Sciences

    L’archive de données sociales allemande GESIS propose des enquêtes comparatives européennes et internationales : ALLBUS, ISSP (International Social Survey Programme), Eurobarometer. L’ISSP couvre des thématiques annuelles comparables entre 40 pays (genre, religion, inégalités, travail), ce qui en fait une ressource précieuse pour les analyses comparatives cross-nationales.

    • Type de données : Données d’enquêtes comparatives internationales (40+ pays)
    • Accès : Inscription gratuite
    • Citation APA 7 : ISSP Research Group. (année). ISSP [thème] [année] [Jeu de données]. GESIS. https://doi.org/xxxxx

    5. Santé et sciences médicales

    20. Health Data Hub

    La Plateforme des données de santé (HDH) est le guichet unique pour accéder aux données de santé à grande échelle en France : Système national des données de santé (SNDS), données hospitalières PMSI, cohortes nationales. En 2026, le HDH finalise la migration de son hébergement vers une infrastructure souveraine certifiée SecNumCloud, ce qui devrait élargir les accès approuvés d’ici la fin de l’année.

    • Type de données : Données médico-administratives, diagnostics, séjours hospitaliers, consommation de soins
    • Accès : Restreint — dossier de demande obligatoire, examen par un comité (réservé aux équipes de recherche constituées, pas aux mémoires de master seuls)
    • Citation APA 7 : Health Data Hub. (année). Nom de la base [Jeu de données]. https://www.health-data-hub.fr/

    21. PhysioNet

    Hébergé par le MIT et financé par le NIH américain, PhysioNet donne accès à des données cliniques et physiologiques : signaux ECG, données de réanimation (MIMIC-IV), données de sommeil, séries de fréquence cardiaque. Indispensable pour les mémoires en bioingénierie, informatique médicale ou sciences infirmières qui mobilisent des analyses de signal.

    • Type de données : Signaux physiologiques, données de réanimation, données de sommeil
    • Accès : Inscription gratuite + formation CITI obligatoire pour certaines bases (MIMIC)
    • Citation APA 7 : Auteur(s). (année). Titre de la base (version X) [Jeu de données]. PhysioNet. https://doi.org/10.13026/xxxxx

    6. Environnement et géographie

    22. Copernicus Climate Data Store (CDS)

    Le service Copernicus de l’Union européenne propose des données climatiques réanalysées et prévisionnelles : ERA5 (réanalyse atmosphérique depuis 1940), températures de surface, précipitations, indices d’extrêmes climatiques. Les données sont disponibles via une API Python (cdsapi) ou en téléchargement direct. Ressource clé pour les mémoires en géographie, sciences de l’environnement, ou agronomie.

    • Type de données : Données climatiques grillées, réanalyses atmosphériques, projections
    • Accès : Inscription gratuite
    • Citation APA 7 : Hersbach, H., et al. (2020). ERA5 hourly data on single levels from 1940 to present [Jeu de données]. Copernicus Climate Data Store. https://doi.org/10.24381/cds.adbb2d47

    23. FAOSTAT (FAO)

    La base de données statistiques de l’Organisation des Nations Unies pour l’alimentation et l’agriculture couvre la production agricole, le commerce agroalimentaire, la sécurité alimentaire et les émissions liées à l’agriculture dans plus de 245 pays. Les données sont exportables en CSV et actualisées annuellement.

    • Type de données : Production agricole, commerce alimentaire, sécurité alimentaire, émissions GES secteur agricole
    • Accès : Libre
    • Citation APA 7 : FAO. (année). Nom de l’indicateur [Jeu de données]. FAOSTAT. https://www.fao.org/faostat/

    7. Économie et finance

    24. FMI — IMF Data

    Le Fonds monétaire international met à disposition ses bases de données statistiques : Perspectives de l’économie mondiale (WEO), Balance of Payments Statistics, International Financial Statistics. Les données peuvent être exportées via l’API ou en fichiers CSV depuis le portail IMF Data (imf.org/en/Data). Utile pour les mémoires en macroéconomie, économie internationale ou finance publique.

    • Type de données : Indicateurs macroéconomiques, balances des paiements, dette publique, réserves de change
    • Accès : Libre
    • Citation APA 7 : FMI. (année). Nom de la base/série [Jeu de données]. https://www.imf.org/en/Data

    25. FRED — Federal Reserve Bank of St. Louis

    FRED (Federal Reserve Economic Data) est l’une des bases de données macroéconomiques les plus utilisées dans le monde académique : plus de 800 000 séries temporelles issues de dizaines de sources (BEA, BLS, OECD, World Bank). Son API permet des extractions directes dans R (package fredr) ou Python. Bien que d’origine américaine, FRED héberge de nombreuses séries mondiales et européennes.

    • Type de données : Séries macroéconomiques et financières (PIB, inflation, chômage, taux, etc.)
    • Accès : Libre (API gratuite avec inscription)
    • Citation APA 7 : Federal Reserve Bank of St. Louis. (année). Nom de la série [code FRED] [Jeu de données]. FRED. https://fred.stlouisfed.org/series/[CODE]

    Comment citer un jeu de données dans son mémoire (APA 7)

    Citer un jeu de données suit une logique identique à celle d’un article ou d’un rapport, mais quelques éléments spécifiques sont attendus. En APA 7, la structure de base est la suivante :

    Auteur(s). (année). Titre du jeu de données (version le cas échéant) [Jeu de données]. Éditeur ou entrepôt. https://doi.org/xxxxx

    Schéma illustrant la structure d'une citation de jeu de données au format APA 7 avec les champs obligatoires et l'identifiant DOI
    Structure d’une référence de jeu de données en APA 7 : auteur, année, titre entre crochets, entrepôt et DOI permanent

    La mention [Jeu de données] entre crochets est obligatoire : elle signale au lecteur que la source est une donnée brute et non une publication narrative. Si un DOI existe, il est toujours préférable à une URL classique car il est permanent. Si vous avez téléchargé plusieurs vagues d’une même enquête, citez chaque vague séparément et précisez la date de téléchargement dans une note de bas de page.

    Pour les données que vous citez sans en proposer une analyse propre — pour calibrer vos hypothèses ou décrire votre contexte — il suffit de les mentionner dans le texte et de les lister en bibliographie. Pour les données qui constituent votre corpus d’analyse principal, décrivez dans la section méthode : la source, la vague ou l’édition, la taille de l’échantillon initial, les variables retenues et les traitements appliqués.

    Attention aux biais propres à l’analyse secondaire : le jeu de données a été conçu pour répondre à une question qui n’est peut-être pas la vôtre. Identifiez explicitement les limites que cela impose à vos conclusions. Pour la sélection d’un sous-échantillon depuis un grand fichier, reportez-vous aux méthodes d’échantillonnage probabiliste ou raisonné selon votre objectif.

    Enfin, si votre mémoire mobilise plusieurs jeux de données, pensez à consigner dans un plan de gestion des données la licence de chaque source, la date de téléchargement et le traitement appliqué. Cette traçabilité est exigée par un nombre croissant d’établissements et facilite la conservation de vos données après la soutenance conformément au RGPD.

    FAQ — Jeux de données ouvertes pour un mémoire

    Quelle différence entre une base bibliographique et un entrepôt de jeux de données ?

    Une base bibliographique (Google Scholar, Scopus, PubMed) référence des publications — articles, thèses, ouvrages. Un entrepôt de données (Zenodo, data.gouv.fr, Quetelet-Progedo) héberge des fichiers bruts : tableaux CSV, fichiers SPSS, images, corpus audio. Pour un mémoire quantitatif, c’est le second type dont vous avez besoin pour conduire votre propre analyse statistique.

    Un étudiant en master peut-il accéder aux données du Health Data Hub ?

    En pratique, l’accès aux données du SNDS via le Health Data Hub est réservé aux équipes de recherche constituées avec un responsable scientifique, une convention avec un organisme reconnu et un avis favorable d’un comité éthique. Un étudiant seul en master ne peut pas déposer de dossier à titre individuel. Pour un mémoire en santé, préférez les données DREES, les données hospitalières agrégées disponibles sur data.gouv.fr, ou les enquêtes épidémiologiques publiques (Baromètre santé Santé publique France).

    Comment trouver un jeu de données quand on ne connaît pas l’entrepôt adapté ?

    Commencez par Google Dataset Search (datasetsearch.research.google.com) avec des mots-clés décrivant votre variable principale. Consultez ensuite les articles empiriques de référence de votre champ : ils citent généralement leurs sources de données en annexe ou en note de bas de page. Quetelet-Progedo et le UK Data Service publient par ailleurs des catalogues thématiques qui permettent de parcourir les enquêtes disponibles par domaine.

    Peut-on utiliser des données Kaggle dans un mémoire académique ?

    Oui, à condition de vérifier la licence de chaque jeu de données (CC0, CC BY, etc.) et de tracer son origine réelle : un jeu Kaggle a souvent été extrait d’une source officielle (UCI, Banque mondiale, Eurostat). Citez toujours la source primaire lorsqu’elle est identifiable, et mentionnez Kaggle comme intermédiaire de distribution. Précisez dans votre méthode les éventuels traitements déjà appliqués au fichier par son auteur.

    Est-il obligatoire d’avoir un DOI pour citer un jeu de données ?

    Non, un DOI n’est pas obligatoire mais fortement recommandé car il garantit la pérennité du lien. Si la source ne dispose pas de DOI, indiquez l’URL complète et précisez la date de consultation entre parenthèses. Pour les entrepôts institutionnels comme INSEE ou Eurostat, l’URL de la page de téléchargement spécifique à l’édition consultée est suffisante.

    Analyser vos données avec l’aide de l’IA

    Vous avez trouvé votre jeu de données, mais la rédaction de la section résultats et discussion reste un défi ? Tesify vous aide à structurer l’interprétation de vos analyses, à rédiger les parties empiriques de votre mémoire dans un registre académique rigoureux et à formuler vos limites méthodologiques de façon professionnelle.

    Commencer avec Tesify gratuitement →