Étiquette : données de recherche

  • Où Trouver des Jeux de Données Ouvertes (Open Data) pour son Mémoire : 25 Sources par Discipline 2026

    Où Trouver des Jeux de Données Ouvertes (Open Data) pour son Mémoire : 25 Sources par Discipline 2026

    Où Trouver des Jeux de Données Ouvertes (Open Data) pour son Mémoire : 25 Sources par Discipline 2026

    Trouver des données à analyser — et non simplement des articles à lire — est l’un des blocages les plus fréquents lors de la rédaction d’un mémoire de master. La confusion est compréhensible : bases bibliographiques et entrepôts de jeux de données sont des outils distincts. Un jeu de données ouvert (open data) est un fichier brut — tableau CSV, fichier SPSS, géodonnées, séries temporelles — que vous importez dans votre logiciel d’analyse pour produire vos propres résultats. Accéder aux bons jeux de données open data pour son mémoire peut transformer une étude de cas fragile en une démonstration empirique solide et citable.

    Cette liste recense 25 sources classées par discipline ou domaine d’usage. Pour chaque entrée : ce qu’elle contient, le type de données proposé, la condition d’accès (libre, inscription gratuite ou restreint sur dossier) et un conseil de citation au format APA 7. La plupart sont gratuites et accessibles depuis un compte étudiant ordinaire ; quelques-unes demandent un dossier justificatif, notamment en santé.

    En résumé : Pour un mémoire de master, les portails les plus accessibles sont data.gouv.fr (données publiques françaises, libre), Zenodo (multidisciplinaire, libre) et Eurostat (données UE, libre). Pour les sciences sociales françaises, Quetelet-Progedo est la référence. En santé, le Health Data Hub reste soumis à dossier. Chaque jeu de données doit être cité avec son DOI ou URL stable au format APA 7.

    Pourquoi utiliser des données ouvertes dans son mémoire ?

    L’analyse secondaire de données existantes présente plusieurs avantages concrets par rapport à la collecte primaire. D’abord, les échantillons sont souvent bien plus larges que ce qu’un étudiant peut obtenir seul via un questionnaire diffusé sur les réseaux. Ensuite, les données officielles (INSEE, Eurostat, OMS) bénéficient d’une méthodologie documentée et reconnue par les jurys. Enfin, citer un jeu de données avec un DOI permanent renforce la reproductibilité de votre analyse, ce qui est attendu dans tout mémoire à visée quantitative.

    Avant de commencer, pensez à rédiger un plan de gestion des données (PGD) même sommaire : notez l’origine de chaque fichier, sa licence, la date de téléchargement et le traitement que vous lui avez appliqué. C’est une bonne pratique qui facilitera la rédaction de votre section méthodologique.

    1. Portails généralistes

    Ces cinq plateformes couvrent plusieurs disciplines et constituent le premier point d’entrée pour la majorité des recherches.

    Cartographie des principaux portails de données ouvertes accessibles pour un mémoire de master, organisés par catégorie
    Principales catégories de portails open data accessibles aux étudiants en master : du généraliste à la donnée disciplinaire

    1. data.gouv.fr

    La plateforme nationale des données publiques françaises, gérée par la direction interministérielle du numérique (DINUM). Elle recense plus de 71 000 jeux de données provenant de l’État, des collectivités territoriales et d’organismes publics : résultats électoraux, statistiques de transport, données foncières, comptes des collectivités, etc.

    • Type de données : Fichiers CSV, GeoJSON, XLS, API REST
    • Accès : Libre (sans inscription pour le téléchargement)
    • Citation APA 7 : Producteur, A. (année). Titre du jeu de données [Jeu de données]. data.gouv.fr. https://www.data.gouv.fr/datasets/[identifiant]

    2. Recherche Data Gouv

    L’entrepôt national dédié aux données de la recherche académique française. Hébergé par le MESRI et labellisé CoreTrustSeal, il regroupe des données produites par des équipes de recherche universitaires. Chaque dépôt est versionné et se voit attribuer un DOI permanent. Contrairement à data.gouv.fr, le contenu est ici orienté vers les jeux de données produits dans le cadre de projets de recherche publiés.

    • Type de données : Données de sondage, données expérimentales, corpus textuels, données géospatiales
    • Accès : Libre pour les dépôts publics ; inscription gratuite pour déposer
    • Citation APA 7 : Auteur(s). (année). Titre (version X.X) [Jeu de données]. Recherche Data Gouv. https://doi.org/xxxxx

    3. Zenodo (CERN)

    Entrepôt généraliste créé par le CERN et financé par la Commission européenne. Zenodo accueille des données de toutes disciplines, avec attribution automatique d’un DOI. C’est l’une des références mondiales pour le dépôt de données associées à des publications en accès ouvert.

    • Type de données : Multidisciplinaire (données, logiciels, preprints, présentations)
    • Accès : Libre pour les dépôts publics
    • Citation APA 7 : Auteur(s). (année). Titre [Jeu de données]. Zenodo. https://doi.org/10.5281/zenodo.[ID]

    4. Kaggle Datasets

    Plateforme communautaire orientée data science et machine learning. Kaggle héberge des milliers de jeux de données nettoyés et annotés, souvent accompagnés de notebooks d’analyse en Python ou R. Très utile pour les mémoires en gestion, marketing, ou informatique qui mobilisent des approches prédictives.

    • Type de données : CSV structurés, images, textes, données de compétitions
    • Accès : Inscription gratuite obligatoire
    • Citation APA 7 : Auteur. (année). Titre [Jeu de données]. Kaggle. https://www.kaggle.com/datasets/[identifiant]

    5. Google Dataset Search

    Un moteur de recherche dédié aux jeux de données indexés sur le web (datasetsearch.research.google.com). Google Dataset Search n’héberge pas les données mais permet de trouver des fichiers référencés sur des milliers de dépôts institutionnels. Utile pour des requêtes thématiques larges quand on ne sait pas encore où chercher.

    • Type de données : Tous types (lien vers la source d’origine)
    • Accès : Libre (moteur de recherche uniquement)
    • Citation APA 7 : Citer la source originale trouvée via le moteur, pas Google Dataset Search lui-même

    2. Données officielles françaises

    Ces cinq sources émanent directement d’institutions publiques françaises. Leur rigueur méthodologique est documentée, ce qui facilite la justification de votre cadre empirique devant le jury.

    6. INSEE — Données brutes et fichiers détail

    L’Institut national de la statistique et des études économiques publie bien plus que des tableaux en ligne : des fichiers détail anonymisés (recensements, enquêtes Emploi, SRCV, DADS, etc.) sont téléchargeables. La section « Fichiers de données » de chaque enquête donne accès aux micro-données pour les analyses statistiques avancées.

    • Type de données : Démographie, emploi, revenus, prix, logement (micro-données et agrégats)
    • Accès : Libre pour les agrégats ; les fichiers détail les plus sensibles passent par le CASD (voir ci-dessous)
    • Citation APA 7 : INSEE. (année). Titre de l’enquête ou du fichier [Jeu de données]. https://www.insee.fr/fr/statistiques/[identifiant]

    7. Banque de France — Webstat

    Le portail Webstat de la Banque de France donne accès à ses séries chronologiques : taux d’intérêt, agrégats monétaires, balance des paiements, statistiques bancaires. Les données sont exportables en CSV ou Excel, avec historique parfois centenaire pour certaines séries.

    • Type de données : Séries temporelles économiques et monétaires
    • Accès : Libre
    • Citation APA 7 : Banque de France. (année). Nom de la série [Jeu de données]. Webstat. https://webstat.banque-france.fr/

    8. DREES — Direction de la recherche, des études, de l’évaluation et des statistiques

    La DREES (rattachée aux ministères sanitaires et sociaux) publie des données sur la santé, le social et la dépendance : dépenses de santé, revenus des professionnels de santé, données hospitalières, minima sociaux, personnes âgées. Ses données sont accessibles via son site et via data.gouv.fr.

    • Type de données : Santé, protection sociale, handicap, personnes âgées
    • Accès : Libre
    • Citation APA 7 : DREES. (année). Titre [Jeu de données]. Ministère de la Santé. https://drees.solidarites-sante.gouv.fr/

    9. SIES — Système d’Information sur l’Enseignement Supérieur

    Le SIES (Ministère de l’Enseignement Supérieur et de la Recherche) publie les statistiques sur les étudiants, les formations, l’insertion professionnelle des diplômés et les personnels de l’ESR. Indispensable pour tout mémoire portant sur l’enseignement supérieur français.

    • Type de données : Effectifs étudiants, résultats, insertion professionnelle, ressources des universités
    • Accès : Libre
    • Citation APA 7 : MESRI-SIES. (année). Titre de la publication statistique [Jeu de données]. https://www.enseignementsup-recherche.gouv.fr/

    10. Nakala (Huma-Num / CNRS)

    Entrepôt de données en sciences humaines et sociales (SHS) géré par l’infrastructure nationale Huma-Num. Nakala assigne un DOI à chaque ressource déposée et prend en charge des formats variés : images de manuscrits, corpus audio, enquêtes ethnographiques, bases prosopographiques. C’est la plateforme de référence pour les données patrimoniales et culturelles numériques.

    • Type de données : Corpus textuels, images, archives orales, données de terrain SHS
    • Accès : Libre pour les dépôts publics ; inscription gratuite pour déposer ou accéder à certains corpus
    • Citation APA 7 : Auteur(s). (année). Titre [Jeu de données]. Nakala/Huma-Num. https://doi.org/xxxxx

    3. Sources européennes et internationales

    11. Eurostat

    L’office statistique de l’Union européenne produit des données harmonisées couvrant les 27 États membres : emploi, PIB, commerce, environnement, santé, éducation, agriculture. Toutes les données sont téléchargeables via le navigateur de données ou l’API. La comparabilité entre pays est un atout majeur pour les mémoires à dimension comparée.

    • Type de données : Indicateurs socio-économiques et sectoriels harmonisés à l’échelle de l’UE
    • Accès : Libre
    • Citation APA 7 : Eurostat. (année). Nom de l’indicateur [Jeu de données]. Commission européenne. https://ec.europa.eu/eurostat/databrowser/

    12. data.europa.eu

    Le portail officiel de données ouvertes de l’Union européenne agrège les publications d’Eurostat, du Parlement, de la Commission, des agences européennes et des États membres. Depuis juillet 2026, les données INSPIRE (géospatiales) y sont également indexées. Il offre un niveau de couverture thématique plus large qu’Eurostat seul.

    • Type de données : Géospatiales, politiques, environnementales, statistiques institutionnelles
    • Accès : Libre
    • Citation APA 7 : Nom de l’institution productrice. (année). Titre [Jeu de données]. data.europa.eu. https://data.europa.eu/data/datasets/[identifiant]

    13. Banque mondiale — World Bank Open Data

    La Banque mondiale propose un accès gratuit et ouvert à des milliers d’indicateurs de développement mondial : PIB par habitant, pauvreté, accès à l’eau, mortalité infantile, scolarisation. La DataBank permet des sélections personnalisées et des exports en CSV ou Excel. La Microdata Library donne accès aux enquêtes auprès des ménages de pays en développement.

    • Type de données : Indicateurs macroéconomiques, sociaux, environnementaux (190+ pays)
    • Accès : Libre (Microdata Library : inscription gratuite)
    • Citation APA 7 : Banque mondiale. (année). Nom de l’indicateur [Jeu de données]. https://donnees.banquemondiale.org/

    14. OCDE Data Explorer

    Depuis 2024, l’OCDE a adopté un modèle d’accès ouvert pour la quasi-totalité de ses données statistiques. Le Data Explorer (data-explorer.oecd.org) centralise les séries sur l’éducation (Education at a Glance), la santé, la productivité, les inégalités et les finances publiques des pays membres. Particulièrement pertinent pour les mémoires en économie, sciences de l’éducation ou politiques publiques.

    • Type de données : Éducation, santé, économie, emploi, gouvernance (38 pays OCDE)
    • Accès : Libre depuis 2024
    • Citation APA 7 : OCDE. (année). Nom de la série [Jeu de données]. OCDE Data Explorer. https://data-explorer.oecd.org/

    15. OMS — Global Health Observatory

    L’Observatoire mondial de la santé de l’Organisation mondiale de la santé propose des données épidémiologiques, de mortalité, de couverture vaccinale et de systèmes de santé pour plus de 190 pays. Les fichiers sont exportables en CSV et des API permettent l’intégration directe dans R ou Python.

    • Type de données : Épidémiologie, mortalité, santé maternelle, couverture sanitaire universelle
    • Accès : Libre
    • Citation APA 7 : OMS. (année). Titre de l’indicateur [Jeu de données]. Organisation mondiale de la santé. https://www.who.int/data/gho/

    4. Sciences sociales et humanités

    Ces plateformes sont spécialisées dans les enquêtes quantitatives sur les comportements, attitudes et conditions de vie des populations. Elles requièrent généralement une inscription gratuite avec justificatif académique.

    16. Quetelet-Progedo Diffusion

    Service national de diffusion des données en sciences sociales, rattaché à l’infrastructure PROGEDO et hébergé sur Recherche Data Gouv. Quetelet-Progedo met à disposition les grandes enquêtes françaises (enquête Emploi, ESPS, PISA, European Social Survey, Eurobaromètre, baromètres politiques CEVIPOF). C’est la porte d’entrée principale pour tout mémoire en sociologie, science politique ou économie du travail.

    • Type de données : Fichiers SPSS, Stata, CSV issus d’enquêtes en population
    • Accès : Inscription gratuite avec adresse institutionnelle ; certaines enquêtes nécessitent un engagement de confidentialité
    • Citation APA 7 : Producteur de l’enquête. (année). Nom de l’enquête (vague N) [Jeu de données]. Quetelet-Progedo Diffusion. https://doi.org/xxxxx

    17. CDSP — Centre de données socio-politiques (Sciences Po)

    Le CDSP archive et diffuse des données sur la vie politique et électorale française : sondages post-électoraux, enquêtes sur les attitudes politiques, données de résultats électoraux géolocalisés. Il est particulièrement utile pour les mémoires en science politique, sociologie électorale ou communication politique.

    • Type de données : Enquêtes électorales, sondages d’opinion, données de vote agrégées
    • Accès : Inscription gratuite
    • Citation APA 7 : Auteur(s). (année). Titre de l’enquête [Jeu de données]. CDSP/Sciences Po. https://cdsp.sciences-po.fr/

    18. UK Data Service

    Principal entrepôt de données en sciences sociales du Royaume-Uni, financé par le UK Research and Innovation (UKRI). Il héberge des enquêtes longitudinales de référence mondiale (British Household Panel Study, Understanding Society) et le dépôt de l’European Social Survey. Incontournable pour les approches comparatives franco-britanniques ou les analyses de panel.

    • Type de données : Enquêtes longitudinales, données de panel, données qualitatives transcrites
    • Accès : Inscription gratuite avec adresse institutionnelle
    • Citation APA 7 : Auteur(s). (année). Titre [Jeu de données]. UK Data Service. https://doi.org/xxxxx

    19. GESIS — Leibniz Institute for Social Sciences

    L’archive de données sociales allemande GESIS propose des enquêtes comparatives européennes et internationales : ALLBUS, ISSP (International Social Survey Programme), Eurobarometer. L’ISSP couvre des thématiques annuelles comparables entre 40 pays (genre, religion, inégalités, travail), ce qui en fait une ressource précieuse pour les analyses comparatives cross-nationales.

    • Type de données : Données d’enquêtes comparatives internationales (40+ pays)
    • Accès : Inscription gratuite
    • Citation APA 7 : ISSP Research Group. (année). ISSP [thème] [année] [Jeu de données]. GESIS. https://doi.org/xxxxx

    5. Santé et sciences médicales

    20. Health Data Hub

    La Plateforme des données de santé (HDH) est le guichet unique pour accéder aux données de santé à grande échelle en France : Système national des données de santé (SNDS), données hospitalières PMSI, cohortes nationales. En 2026, le HDH finalise la migration de son hébergement vers une infrastructure souveraine certifiée SecNumCloud, ce qui devrait élargir les accès approuvés d’ici la fin de l’année.

    • Type de données : Données médico-administratives, diagnostics, séjours hospitaliers, consommation de soins
    • Accès : Restreint — dossier de demande obligatoire, examen par un comité (réservé aux équipes de recherche constituées, pas aux mémoires de master seuls)
    • Citation APA 7 : Health Data Hub. (année). Nom de la base [Jeu de données]. https://www.health-data-hub.fr/

    21. PhysioNet

    Hébergé par le MIT et financé par le NIH américain, PhysioNet donne accès à des données cliniques et physiologiques : signaux ECG, données de réanimation (MIMIC-IV), données de sommeil, séries de fréquence cardiaque. Indispensable pour les mémoires en bioingénierie, informatique médicale ou sciences infirmières qui mobilisent des analyses de signal.

    • Type de données : Signaux physiologiques, données de réanimation, données de sommeil
    • Accès : Inscription gratuite + formation CITI obligatoire pour certaines bases (MIMIC)
    • Citation APA 7 : Auteur(s). (année). Titre de la base (version X) [Jeu de données]. PhysioNet. https://doi.org/10.13026/xxxxx

    6. Environnement et géographie

    22. Copernicus Climate Data Store (CDS)

    Le service Copernicus de l’Union européenne propose des données climatiques réanalysées et prévisionnelles : ERA5 (réanalyse atmosphérique depuis 1940), températures de surface, précipitations, indices d’extrêmes climatiques. Les données sont disponibles via une API Python (cdsapi) ou en téléchargement direct. Ressource clé pour les mémoires en géographie, sciences de l’environnement, ou agronomie.

    • Type de données : Données climatiques grillées, réanalyses atmosphériques, projections
    • Accès : Inscription gratuite
    • Citation APA 7 : Hersbach, H., et al. (2020). ERA5 hourly data on single levels from 1940 to present [Jeu de données]. Copernicus Climate Data Store. https://doi.org/10.24381/cds.adbb2d47

    23. FAOSTAT (FAO)

    La base de données statistiques de l’Organisation des Nations Unies pour l’alimentation et l’agriculture couvre la production agricole, le commerce agroalimentaire, la sécurité alimentaire et les émissions liées à l’agriculture dans plus de 245 pays. Les données sont exportables en CSV et actualisées annuellement.

    • Type de données : Production agricole, commerce alimentaire, sécurité alimentaire, émissions GES secteur agricole
    • Accès : Libre
    • Citation APA 7 : FAO. (année). Nom de l’indicateur [Jeu de données]. FAOSTAT. https://www.fao.org/faostat/

    7. Économie et finance

    24. FMI — IMF Data

    Le Fonds monétaire international met à disposition ses bases de données statistiques : Perspectives de l’économie mondiale (WEO), Balance of Payments Statistics, International Financial Statistics. Les données peuvent être exportées via l’API ou en fichiers CSV depuis le portail IMF Data (imf.org/en/Data). Utile pour les mémoires en macroéconomie, économie internationale ou finance publique.

    • Type de données : Indicateurs macroéconomiques, balances des paiements, dette publique, réserves de change
    • Accès : Libre
    • Citation APA 7 : FMI. (année). Nom de la base/série [Jeu de données]. https://www.imf.org/en/Data

    25. FRED — Federal Reserve Bank of St. Louis

    FRED (Federal Reserve Economic Data) est l’une des bases de données macroéconomiques les plus utilisées dans le monde académique : plus de 800 000 séries temporelles issues de dizaines de sources (BEA, BLS, OECD, World Bank). Son API permet des extractions directes dans R (package fredr) ou Python. Bien que d’origine américaine, FRED héberge de nombreuses séries mondiales et européennes.

    • Type de données : Séries macroéconomiques et financières (PIB, inflation, chômage, taux, etc.)
    • Accès : Libre (API gratuite avec inscription)
    • Citation APA 7 : Federal Reserve Bank of St. Louis. (année). Nom de la série [code FRED] [Jeu de données]. FRED. https://fred.stlouisfed.org/series/[CODE]

    Comment citer un jeu de données dans son mémoire (APA 7)

    Citer un jeu de données suit une logique identique à celle d’un article ou d’un rapport, mais quelques éléments spécifiques sont attendus. En APA 7, la structure de base est la suivante :

    Auteur(s). (année). Titre du jeu de données (version le cas échéant) [Jeu de données]. Éditeur ou entrepôt. https://doi.org/xxxxx

    Schéma illustrant la structure d'une citation de jeu de données au format APA 7 avec les champs obligatoires et l'identifiant DOI
    Structure d’une référence de jeu de données en APA 7 : auteur, année, titre entre crochets, entrepôt et DOI permanent

    La mention [Jeu de données] entre crochets est obligatoire : elle signale au lecteur que la source est une donnée brute et non une publication narrative. Si un DOI existe, il est toujours préférable à une URL classique car il est permanent. Si vous avez téléchargé plusieurs vagues d’une même enquête, citez chaque vague séparément et précisez la date de téléchargement dans une note de bas de page.

    Pour les données que vous citez sans en proposer une analyse propre — pour calibrer vos hypothèses ou décrire votre contexte — il suffit de les mentionner dans le texte et de les lister en bibliographie. Pour les données qui constituent votre corpus d’analyse principal, décrivez dans la section méthode : la source, la vague ou l’édition, la taille de l’échantillon initial, les variables retenues et les traitements appliqués.

    Attention aux biais propres à l’analyse secondaire : le jeu de données a été conçu pour répondre à une question qui n’est peut-être pas la vôtre. Identifiez explicitement les limites que cela impose à vos conclusions. Pour la sélection d’un sous-échantillon depuis un grand fichier, reportez-vous aux méthodes d’échantillonnage probabiliste ou raisonné selon votre objectif.

    Enfin, si votre mémoire mobilise plusieurs jeux de données, pensez à consigner dans un plan de gestion des données la licence de chaque source, la date de téléchargement et le traitement appliqué. Cette traçabilité est exigée par un nombre croissant d’établissements et facilite la conservation de vos données après la soutenance conformément au RGPD.

    FAQ — Jeux de données ouvertes pour un mémoire

    Quelle différence entre une base bibliographique et un entrepôt de jeux de données ?

    Une base bibliographique (Google Scholar, Scopus, PubMed) référence des publications — articles, thèses, ouvrages. Un entrepôt de données (Zenodo, data.gouv.fr, Quetelet-Progedo) héberge des fichiers bruts : tableaux CSV, fichiers SPSS, images, corpus audio. Pour un mémoire quantitatif, c’est le second type dont vous avez besoin pour conduire votre propre analyse statistique.

    Un étudiant en master peut-il accéder aux données du Health Data Hub ?

    En pratique, l’accès aux données du SNDS via le Health Data Hub est réservé aux équipes de recherche constituées avec un responsable scientifique, une convention avec un organisme reconnu et un avis favorable d’un comité éthique. Un étudiant seul en master ne peut pas déposer de dossier à titre individuel. Pour un mémoire en santé, préférez les données DREES, les données hospitalières agrégées disponibles sur data.gouv.fr, ou les enquêtes épidémiologiques publiques (Baromètre santé Santé publique France).

    Comment trouver un jeu de données quand on ne connaît pas l’entrepôt adapté ?

    Commencez par Google Dataset Search (datasetsearch.research.google.com) avec des mots-clés décrivant votre variable principale. Consultez ensuite les articles empiriques de référence de votre champ : ils citent généralement leurs sources de données en annexe ou en note de bas de page. Quetelet-Progedo et le UK Data Service publient par ailleurs des catalogues thématiques qui permettent de parcourir les enquêtes disponibles par domaine.

    Peut-on utiliser des données Kaggle dans un mémoire académique ?

    Oui, à condition de vérifier la licence de chaque jeu de données (CC0, CC BY, etc.) et de tracer son origine réelle : un jeu Kaggle a souvent été extrait d’une source officielle (UCI, Banque mondiale, Eurostat). Citez toujours la source primaire lorsqu’elle est identifiable, et mentionnez Kaggle comme intermédiaire de distribution. Précisez dans votre méthode les éventuels traitements déjà appliqués au fichier par son auteur.

    Est-il obligatoire d’avoir un DOI pour citer un jeu de données ?

    Non, un DOI n’est pas obligatoire mais fortement recommandé car il garantit la pérennité du lien. Si la source ne dispose pas de DOI, indiquez l’URL complète et précisez la date de consultation entre parenthèses. Pour les entrepôts institutionnels comme INSEE ou Eurostat, l’URL de la page de téléchargement spécifique à l’édition consultée est suffisante.

    Analyser vos données avec l’aide de l’IA

    Vous avez trouvé votre jeu de données, mais la rédaction de la section résultats et discussion reste un défi ? Tesify vous aide à structurer l’interprétation de vos analyses, à rédiger les parties empiriques de votre mémoire dans un registre académique rigoureux et à formuler vos limites méthodologiques de façon professionnelle.

    Commencer avec Tesify gratuitement →

  • Modèle de plan de gestion des données (PGD) ANR 2026

    Modèle de plan de gestion des données (PGD) ANR 2026

    Modèle de plan de gestion des données (PGD) ANR 2026

    Depuis le plan d’action 2019 de l’Agence nationale de la recherche (ANR), tout projet financé par l’agence doit être accompagné d’un plan de gestion des données (PGD) — ou data management plan (DMP) en anglais. Ce document vivant décrit comment les données produites dans le cadre d’un projet seront collectées, documentées, stockées, partagées et préservées tout au long du cycle de recherche. Pourtant, beaucoup de doctorants et de maîtres de conférences découvrent la contrainte au dernier moment, faute d’un modèle clair à portée de main. Cet article propose un modèle structuré, section par section, conforme aux exigences actuelles de l’ANR pour 2026.

    Que vous rédigiez une thèse à l’Université Paris Cité, à Aix-Marseille Université ou à Sciences Po, et que votre laboratoire soit rattaché à l’ANR ou à Horizon Europe, le PGD répond désormais à des standards formels. La plateforme nationale DMP OPIDoR, hébergée par Inist-CNRS, met à disposition un modèle structuré en français directement aligné sur les attentes de l’ANR — et il est gratuit.

    En bref : Le PGD ANR 2026 comporte six sections obligatoires, se rédige sur DMP OPIDoR en sélectionnant le financeur ANR, et doit être soumis en trois versions (T0+6 mois, mi-parcours, clôture). L’ANR applique le principe « aussi ouvert que possible, aussi fermé que nécessaire ».

    1. Pourquoi le PGD est devenu incontournable en 2026

    La science ouverte n’est plus un simple idéal militant : elle est désormais inscrite dans le paysage institutionnel français. Le Plan national pour la science ouverte (PNSO), piloté par le Ministère de l’Enseignement supérieur et de la Recherche (MESR), fait de la gestion des données un axe stratégique. Parallèlement, Horizon Europe — le programme-cadre européen — exige lui aussi un DMP pour la quasi-totalité des projets qu’il finance.

    Concrètement, pour tout projet ANR dont le démarrage scientifique intervient à partir du plan d’action 2019, la production d’un PGD conditionne le versement final des financements. L’agence a précisé ses attentes via sa FAQ officielle sur le PGD : le document n’est pas une formalité administrative, mais un véritable outil de pilotage des données qui évolue avec le projet.

    Webinaire EcoDoR : prise en main de DMP OPIDoR pour créer son plan de gestion des données, section par section.

    Au-delà de l’obligation formelle, rédiger un PGD présente des avantages concrets :

    • Anticiper les questions de stockage et de sauvegarde avant qu’elles ne deviennent des urgences ;
    • Clarifier dès le départ les droits d’accès aux données entre partenaires du consortium ;
    • Faciliter la réutilisation des données par d’autres équipes après la clôture du projet ;
    • Démontrer aux évaluateurs et aux jurys de thèse que la démarche de recherche respecte les principes FAIR (Trouvable, Accessible, Interopérable, Réutilisable).

    Pour les doctorants qui s’interrogent sur la structure globale de leur projet de recherche, l’article justifier le choix de sa méthodologie dans un mémoire 2026 apporte des repères complémentaires sur l’articulation entre terrain, données et cadre théorique.

    2. DMP OPIDoR : l’outil officiel recommandé par l’ANR

    DMP OPIDoR (Data Management Plan for the Optimization of Sharing and Interoperability of Research Data) est la plateforme nationale de référence pour rédiger des PGD en France. Hébergée et maintenue par Inist-CNRS, elle est construite sur le code open source DMPRoadmap et mise à disposition gratuitement de l’ensemble de la communauté ESR.

    Principales fonctionnalités de DMP OPIDoR
    Fonctionnalité Détail
    Modèles prédéfinis ANR, CNRS, Science Europe, Horizon Europe, modèles institutionnels
    Collaboration Co-propriétaire, éditeur, lecture seule — travail en équipe possible
    Machine-actionable Export JSON/maDMP pour interopérabilité avec data.gouv et autres systèmes
    Formats d’export PDF, DOCX, HTML, JSON — pour dépôt dans les systèmes de l’ANR
    Recommandations guidées Exemples et conseils affichés pour chaque champ du questionnaire
    Nouveauté 2025–2026 Partage automatisé du contenu PGD structuré vers l’ANR directement depuis la plateforme

    Pour accéder au modèle ANR, connectez-vous sur dmp.opidor.fr, créez un nouveau plan et sélectionnez « Agence nationale de la recherche (ANR) » comme financeur. Le modèle structuré officiel, disponible en français et en anglais, se charge automatiquement.

    Depuis juin 2025, une nouvelle fonctionnalité de partage automatisé permet à un porteur de projet de transmettre le contenu du PGD structuré directement à l’ANR depuis l’interface — sans export manuel ni envoi par courriel, selon l’annonce officielle de l’ANR.

    3. Les six sections du modèle ANR : contenu et exemples

    Le modèle ANR structuré comprend six sections. Voici, pour chacune, les questions clés, les éléments attendus et un exemple de formulation.

    Section 1 — Informations générales

    Ce qu’on y met : titre du projet, acronyme, numéro ANR, durée, porteur principal, établissement hébergeur, partenaires.

    Exemple de formulation : « Projet ANR-25-XXXX-0001 « NeuroCog », durée 48 mois, porteur : Université de Bordeaux, partenaires : INSERM U1234, CEA Paris-Saclay. »

    Section 2 — Description des données

    Ce qu’on y met : types de données produites ou réutilisées (textuelles, numériques, images, enregistrements), volume estimé, formats de fichiers, méthodes de collecte.

    Exemple : « Données primaires : entretiens semi-directifs (n=40, format WAV, ~2 Go) et questionnaires en ligne (CSV, ~5 000 lignes). Données secondaires : bases de données INSEE réutilisées sous licence Open Data. »

    Si vous conduisez des entretiens impliquant des personnes physiques, la section données doit renvoyer à votre protocole d’anonymisation. L’article protocole RGPD pour les entretiens de mémoire 2026 fournit un modèle d’anonymisation directement applicable.

    Section 3 — Documentation et qualité

    Ce qu’on y met : métadonnées utilisées (Dublin Core, DataCite, schémas disciplinaires), standards de nommage des fichiers, dictionnaire des variables, procédures de contrôle qualité.

    Exemple : « Métadonnées conformes au schéma DataCite 4.5. Convention de nommage : AAAA-MM-JJ_NomParticipant_Type.ext. Contrôle qualité : double saisie et vérification par le data manager en fin de collecte. »

    Section 4 — Stockage et sauvegarde en cours de recherche

    Ce qu’on y met : infrastructure de stockage (serveurs institutionnels, cloud sécurisé), fréquence des sauvegardes, politique de sauvegarde 3-2-1, responsable des sauvegardes.

    Exemple : « Données stockées sur le serveur NAS du laboratoire (redondance RAID-6) et répliquées quotidiennement sur le cloud institutionnel OVH hébergé en France. Accès restreint aux membres du projet par authentification double facteur. »

    Section 5 — Exigences légales et éthiques

    Ce qu’on y met : données à caractère personnel (RGPD), accord du comité d’éthique le cas échéant, droits de propriété intellectuelle, licences d’utilisation des données sources, confidentialité industrielle.

    Exemple : « Les entretiens impliquent des données personnelles traitées conformément au RGPD. Registre de traitement déposé auprès du DPO de l’établissement. Consentement éclairé signé par chaque participant. Les données anonymisées seront diffusées sous licence CC BY 4.0. »

    Pour aller plus loin sur les enjeux d’intégrité, consultez l’article charte d’intégrité scientifique en thèse 2026 qui détaille ce que dit la loi et les sanctions encourues.

    Section 6 — Partage et conservation à long terme

    Ce qu’on y met : entrepôt de dépôt choisi (Zenodo, Nakala, Recherche Data Gouv, entrepôt disciplinaire), identifiant pérenne (DOI, ARK), embargo éventuel, modalités d’accès après clôture du projet.

    Exemple : « Les données anonymisées seront déposées dans l’entrepôt national Recherche Data Gouv avec un DOI DataCite. Embargo de 24 mois pour les données liées à des brevets en cours. Accès libre en fin d’embargo sous licence CC BY 4.0. »

    Pour retrouver facilement les entrepôts institutionnels et disciplinaires disponibles en France, l’article annuaire des portails de mémoires HAL, DUMAS, theses.fr et Cairn 2026 recense les principales plateformes de dépôt.

    4. Calendrier de soumission et versions successives

    L’ANR attend trois versions successives du PGD tout au long du projet :

    Calendrier des versions PGD selon l’ANR
    Version Échéance Contenu attendu
    Version initiale T0 + 6 mois Description prévisionnelle des données, infrastructure choisie, cadre légal identifié
    Mise à jour mi-parcours Projets > 30 mois uniquement Actualisation des volumes, des formats, des changements de partenaires ou d’entrepôt
    Version finale Date de clôture scientifique Bilan des données effectivement produites, DOI des dépôts réalisés, accès déclaré

    Le versionnement est géré nativement dans DMP OPIDoR : chaque modification peut être annotée, et l’historique est conservé. La version finale conditionne le versement des derniers financements ANR — ne la négligez donc pas.

    5. Dix conseils pratiques pour rédiger un PGD solide

    1. Commencez dès la signature de la convention ANR.

      N’attendez pas T0+5 mois pour ouvrir votre plan sur DMP OPIDoR. Rédiger tôt permet d’identifier les lacunes dans la gestion des données avant qu’elles ne coûtent du temps ou de l’argent.

    2. Choisissez le modèle ANR structuré, pas le modèle libre.

      Sur DMP OPIDoR, deux modèles ANR coexistent : un modèle texte libre (héritage du PDF de 2019) et un modèle structuré machine-actionable. L’ANR recommande depuis 2023 le modèle structuré, qui facilite le partage automatisé avec l’agence.

    3. Nommez un responsable des données dans l’équipe.

      Le PGD doit identifier clairement qui est en charge de la sauvegarde, de la documentation et du dépôt final. Dans les gros consortiums, c’est souvent un ingénieur de recherche ou un data manager dédié.

    4. Soyez précis sur les formats.

      Préférez les formats ouverts et pérennes : CSV plutôt que .xlsx, TIFF ou PNG plutôt que formats propriétaires, PDF/A pour les documents textuels. Les formats propriétaires sont acceptés mais doivent être justifiés.

    5. Distinguez données brutes et données traitées.

      La section 2 doit différencier les données primaires (collectées directement) des données secondaires (réutilisées d’une source tierce) et des données dérivées (produites par traitement des données primaires).

    6. Anticipez les contraintes RGPD dès la section 5.

      Si votre projet implique des données personnelles (entretiens, questionnaires, données de santé), consultez votre DPO (délégué à la protection des données) institutionnel avant de rédiger cette section. Un PGD incomplet sur les aspects éthiques peut bloquer le projet.

    7. Choisissez un entrepôt adapté à votre discipline.

      Recherche Data Gouv est l’entrepôt généraliste national. Pour des disciplines spécifiques, des entrepôts certifiés existent : NAKALA pour les sciences humaines et sociales, SEANOE pour les sciences marines, GenBank pour les données génomiques.

    8. Attribuez un identifiant pérenne.

      Lors du dépôt des données, assurez-vous qu’un DOI ou un ARK est attribué automatiquement par l’entrepôt. Cet identifiant sera à reporter dans la version finale de votre PGD et dans les publications issues du projet.

    9. Justifiez les données non ouvertes.

      L’ANR n’impose pas l’ouverture totale. Pour les données sensibles ou couvertes par un brevet, indiquez la durée d’embargo et les conditions d’accès restreint. Une justification claire vaut mieux qu’une case laissée vide.

    10. Exploitez les ressources de formation de DoRANum.

      La plateforme DoRANum propose des tutoriels vidéo, des guides disciplinaires et des webinaires sur la rédaction de PGD structurés — gratuitement, en français. Un investissement de deux heures évite beaucoup d’allers-retours avec le correspondant science ouverte de l’ANR.

    Si votre mémoire de master inclut une collecte de données avec questionnaire, les principes abordés dans l’article sur construire une échelle de Likert valide pour son mémoire 2026 s’appliquent directement à la section 2 (description et qualité des données).

    FAQ

    Le PGD ANR est-il obligatoire pour tous les projets ?

    Oui, pour tous les projets financés par l’ANR à partir du plan d’action 2019. Une première version est attendue dans les six mois suivant le démarrage scientifique, avec une mise à jour à mi-parcours pour les projets de plus de 30 mois, et une version finale à la clôture. L’absence de PGD peut conditionner le versement final des financements.

    Quel outil utiliser pour rédiger un PGD ANR ?

    L’ANR recommande DMP OPIDoR, la plateforme nationale hébergée par Inist-CNRS. En sélectionnant le financeur ANR à la création, vous accédez directement au modèle structuré officiel en français ou en anglais.

    Combien de versions du PGD faut-il soumettre à l’ANR ?

    En règle générale, trois versions : une initiale à T0+6 mois, une mise à jour à mi-parcours (projets de plus de 30 mois), et une version finale à la clôture du projet. Le versionnement est géré automatiquement dans DMP OPIDoR.

    Les données doivent-elles obligatoirement être ouvertes dans un PGD ANR ?

    Non. L’ANR applique le principe « aussi ouvert que possible, aussi fermé que nécessaire ». Vous pouvez justifier la restriction d’accès (données personnelles, confidentialité industrielle, brevets en cours) et indiquer un embargo ou un accès restreint dans la section partage et conservation.

    Un doctorant non financé par l’ANR doit-il rédiger un PGD ?

    L’obligation réglementaire s’applique aux projets ANR et Horizon Europe. Cependant, de nombreuses universités (Paris Cité, Sorbonne, Aix-Marseille) recommandent ou imposent un PGD dans leur règlement de doctorat pour encourager les bonnes pratiques de science ouverte.

    Quelle est la différence entre un PGD et un DMP ?

    PGD (plan de gestion des données) est le terme français ; DMP (data management plan) est son équivalent anglais. En France, les deux termes désignent le même document. La plateforme nationale s’appelle DMP OPIDoR, mais son interface est disponible en français.

    Tesify vous accompagne dans la gestion de vos données de recherche

    Structurer un mémoire ou une thèse conforme aux standards de science ouverte demande rigueur et méthode. Tesify aide les étudiants et chercheurs français à rédiger, reformuler et vérifier leurs écrits académiques — de l’introduction à la bibliographie. Essayez Tesify gratuitement et gagnez du temps sur la rédaction pour vous concentrer sur vos données.