Où Trouver des Jeux de Données Ouvertes (Open Data) pour son Mémoire : 25 Sources par Discipline 2026
Trouver des données à analyser — et non simplement des articles à lire — est l’un des blocages les plus fréquents lors de la rédaction d’un mémoire de master. La confusion est compréhensible : bases bibliographiques et entrepôts de jeux de données sont des outils distincts. Un jeu de données ouvert (open data) est un fichier brut — tableau CSV, fichier SPSS, géodonnées, séries temporelles — que vous importez dans votre logiciel d’analyse pour produire vos propres résultats. Accéder aux bons jeux de données open data pour son mémoire peut transformer une étude de cas fragile en une démonstration empirique solide et citable.
Cette liste recense 25 sources classées par discipline ou domaine d’usage. Pour chaque entrée : ce qu’elle contient, le type de données proposé, la condition d’accès (libre, inscription gratuite ou restreint sur dossier) et un conseil de citation au format APA 7. La plupart sont gratuites et accessibles depuis un compte étudiant ordinaire ; quelques-unes demandent un dossier justificatif, notamment en santé.
Pourquoi utiliser des données ouvertes dans son mémoire ?
L’analyse secondaire de données existantes présente plusieurs avantages concrets par rapport à la collecte primaire. D’abord, les échantillons sont souvent bien plus larges que ce qu’un étudiant peut obtenir seul via un questionnaire diffusé sur les réseaux. Ensuite, les données officielles (INSEE, Eurostat, OMS) bénéficient d’une méthodologie documentée et reconnue par les jurys. Enfin, citer un jeu de données avec un DOI permanent renforce la reproductibilité de votre analyse, ce qui est attendu dans tout mémoire à visée quantitative.
Avant de commencer, pensez à rédiger un plan de gestion des données (PGD) même sommaire : notez l’origine de chaque fichier, sa licence, la date de téléchargement et le traitement que vous lui avez appliqué. C’est une bonne pratique qui facilitera la rédaction de votre section méthodologique.
1. Portails généralistes
Ces cinq plateformes couvrent plusieurs disciplines et constituent le premier point d’entrée pour la majorité des recherches.

1. data.gouv.fr
La plateforme nationale des données publiques françaises, gérée par la direction interministérielle du numérique (DINUM). Elle recense plus de 71 000 jeux de données provenant de l’État, des collectivités territoriales et d’organismes publics : résultats électoraux, statistiques de transport, données foncières, comptes des collectivités, etc.
- Type de données : Fichiers CSV, GeoJSON, XLS, API REST
- Accès : Libre (sans inscription pour le téléchargement)
- Citation APA 7 : Producteur, A. (année). Titre du jeu de données [Jeu de données]. data.gouv.fr. https://www.data.gouv.fr/datasets/[identifiant]
2. Recherche Data Gouv
L’entrepôt national dédié aux données de la recherche académique française. Hébergé par le MESRI et labellisé CoreTrustSeal, il regroupe des données produites par des équipes de recherche universitaires. Chaque dépôt est versionné et se voit attribuer un DOI permanent. Contrairement à data.gouv.fr, le contenu est ici orienté vers les jeux de données produits dans le cadre de projets de recherche publiés.
- Type de données : Données de sondage, données expérimentales, corpus textuels, données géospatiales
- Accès : Libre pour les dépôts publics ; inscription gratuite pour déposer
- Citation APA 7 : Auteur(s). (année). Titre (version X.X) [Jeu de données]. Recherche Data Gouv. https://doi.org/xxxxx
3. Zenodo (CERN)
Entrepôt généraliste créé par le CERN et financé par la Commission européenne. Zenodo accueille des données de toutes disciplines, avec attribution automatique d’un DOI. C’est l’une des références mondiales pour le dépôt de données associées à des publications en accès ouvert.
- Type de données : Multidisciplinaire (données, logiciels, preprints, présentations)
- Accès : Libre pour les dépôts publics
- Citation APA 7 : Auteur(s). (année). Titre [Jeu de données]. Zenodo. https://doi.org/10.5281/zenodo.[ID]
4. Kaggle Datasets
Plateforme communautaire orientée data science et machine learning. Kaggle héberge des milliers de jeux de données nettoyés et annotés, souvent accompagnés de notebooks d’analyse en Python ou R. Très utile pour les mémoires en gestion, marketing, ou informatique qui mobilisent des approches prédictives.
- Type de données : CSV structurés, images, textes, données de compétitions
- Accès : Inscription gratuite obligatoire
- Citation APA 7 : Auteur. (année). Titre [Jeu de données]. Kaggle. https://www.kaggle.com/datasets/[identifiant]
5. Google Dataset Search
Un moteur de recherche dédié aux jeux de données indexés sur le web (datasetsearch.research.google.com). Google Dataset Search n’héberge pas les données mais permet de trouver des fichiers référencés sur des milliers de dépôts institutionnels. Utile pour des requêtes thématiques larges quand on ne sait pas encore où chercher.
- Type de données : Tous types (lien vers la source d’origine)
- Accès : Libre (moteur de recherche uniquement)
- Citation APA 7 : Citer la source originale trouvée via le moteur, pas Google Dataset Search lui-même
2. Données officielles françaises
Ces cinq sources émanent directement d’institutions publiques françaises. Leur rigueur méthodologique est documentée, ce qui facilite la justification de votre cadre empirique devant le jury.
6. INSEE — Données brutes et fichiers détail
L’Institut national de la statistique et des études économiques publie bien plus que des tableaux en ligne : des fichiers détail anonymisés (recensements, enquêtes Emploi, SRCV, DADS, etc.) sont téléchargeables. La section « Fichiers de données » de chaque enquête donne accès aux micro-données pour les analyses statistiques avancées.
- Type de données : Démographie, emploi, revenus, prix, logement (micro-données et agrégats)
- Accès : Libre pour les agrégats ; les fichiers détail les plus sensibles passent par le CASD (voir ci-dessous)
- Citation APA 7 : INSEE. (année). Titre de l’enquête ou du fichier [Jeu de données]. https://www.insee.fr/fr/statistiques/[identifiant]
7. Banque de France — Webstat
Le portail Webstat de la Banque de France donne accès à ses séries chronologiques : taux d’intérêt, agrégats monétaires, balance des paiements, statistiques bancaires. Les données sont exportables en CSV ou Excel, avec historique parfois centenaire pour certaines séries.
- Type de données : Séries temporelles économiques et monétaires
- Accès : Libre
- Citation APA 7 : Banque de France. (année). Nom de la série [Jeu de données]. Webstat. https://webstat.banque-france.fr/
8. DREES — Direction de la recherche, des études, de l’évaluation et des statistiques
La DREES (rattachée aux ministères sanitaires et sociaux) publie des données sur la santé, le social et la dépendance : dépenses de santé, revenus des professionnels de santé, données hospitalières, minima sociaux, personnes âgées. Ses données sont accessibles via son site et via data.gouv.fr.
- Type de données : Santé, protection sociale, handicap, personnes âgées
- Accès : Libre
- Citation APA 7 : DREES. (année). Titre [Jeu de données]. Ministère de la Santé. https://drees.solidarites-sante.gouv.fr/
9. SIES — Système d’Information sur l’Enseignement Supérieur
Le SIES (Ministère de l’Enseignement Supérieur et de la Recherche) publie les statistiques sur les étudiants, les formations, l’insertion professionnelle des diplômés et les personnels de l’ESR. Indispensable pour tout mémoire portant sur l’enseignement supérieur français.
- Type de données : Effectifs étudiants, résultats, insertion professionnelle, ressources des universités
- Accès : Libre
- Citation APA 7 : MESRI-SIES. (année). Titre de la publication statistique [Jeu de données]. https://www.enseignementsup-recherche.gouv.fr/
10. Nakala (Huma-Num / CNRS)
Entrepôt de données en sciences humaines et sociales (SHS) géré par l’infrastructure nationale Huma-Num. Nakala assigne un DOI à chaque ressource déposée et prend en charge des formats variés : images de manuscrits, corpus audio, enquêtes ethnographiques, bases prosopographiques. C’est la plateforme de référence pour les données patrimoniales et culturelles numériques.
- Type de données : Corpus textuels, images, archives orales, données de terrain SHS
- Accès : Libre pour les dépôts publics ; inscription gratuite pour déposer ou accéder à certains corpus
- Citation APA 7 : Auteur(s). (année). Titre [Jeu de données]. Nakala/Huma-Num. https://doi.org/xxxxx
3. Sources européennes et internationales
11. Eurostat
L’office statistique de l’Union européenne produit des données harmonisées couvrant les 27 États membres : emploi, PIB, commerce, environnement, santé, éducation, agriculture. Toutes les données sont téléchargeables via le navigateur de données ou l’API. La comparabilité entre pays est un atout majeur pour les mémoires à dimension comparée.
- Type de données : Indicateurs socio-économiques et sectoriels harmonisés à l’échelle de l’UE
- Accès : Libre
- Citation APA 7 : Eurostat. (année). Nom de l’indicateur [Jeu de données]. Commission européenne. https://ec.europa.eu/eurostat/databrowser/
12. data.europa.eu
Le portail officiel de données ouvertes de l’Union européenne agrège les publications d’Eurostat, du Parlement, de la Commission, des agences européennes et des États membres. Depuis juillet 2026, les données INSPIRE (géospatiales) y sont également indexées. Il offre un niveau de couverture thématique plus large qu’Eurostat seul.
- Type de données : Géospatiales, politiques, environnementales, statistiques institutionnelles
- Accès : Libre
- Citation APA 7 : Nom de l’institution productrice. (année). Titre [Jeu de données]. data.europa.eu. https://data.europa.eu/data/datasets/[identifiant]
13. Banque mondiale — World Bank Open Data
La Banque mondiale propose un accès gratuit et ouvert à des milliers d’indicateurs de développement mondial : PIB par habitant, pauvreté, accès à l’eau, mortalité infantile, scolarisation. La DataBank permet des sélections personnalisées et des exports en CSV ou Excel. La Microdata Library donne accès aux enquêtes auprès des ménages de pays en développement.
- Type de données : Indicateurs macroéconomiques, sociaux, environnementaux (190+ pays)
- Accès : Libre (Microdata Library : inscription gratuite)
- Citation APA 7 : Banque mondiale. (année). Nom de l’indicateur [Jeu de données]. https://donnees.banquemondiale.org/
14. OCDE Data Explorer
Depuis 2024, l’OCDE a adopté un modèle d’accès ouvert pour la quasi-totalité de ses données statistiques. Le Data Explorer (data-explorer.oecd.org) centralise les séries sur l’éducation (Education at a Glance), la santé, la productivité, les inégalités et les finances publiques des pays membres. Particulièrement pertinent pour les mémoires en économie, sciences de l’éducation ou politiques publiques.
- Type de données : Éducation, santé, économie, emploi, gouvernance (38 pays OCDE)
- Accès : Libre depuis 2024
- Citation APA 7 : OCDE. (année). Nom de la série [Jeu de données]. OCDE Data Explorer. https://data-explorer.oecd.org/
15. OMS — Global Health Observatory
L’Observatoire mondial de la santé de l’Organisation mondiale de la santé propose des données épidémiologiques, de mortalité, de couverture vaccinale et de systèmes de santé pour plus de 190 pays. Les fichiers sont exportables en CSV et des API permettent l’intégration directe dans R ou Python.
- Type de données : Épidémiologie, mortalité, santé maternelle, couverture sanitaire universelle
- Accès : Libre
- Citation APA 7 : OMS. (année). Titre de l’indicateur [Jeu de données]. Organisation mondiale de la santé. https://www.who.int/data/gho/
4. Sciences sociales et humanités
Ces plateformes sont spécialisées dans les enquêtes quantitatives sur les comportements, attitudes et conditions de vie des populations. Elles requièrent généralement une inscription gratuite avec justificatif académique.
16. Quetelet-Progedo Diffusion
Service national de diffusion des données en sciences sociales, rattaché à l’infrastructure PROGEDO et hébergé sur Recherche Data Gouv. Quetelet-Progedo met à disposition les grandes enquêtes françaises (enquête Emploi, ESPS, PISA, European Social Survey, Eurobaromètre, baromètres politiques CEVIPOF). C’est la porte d’entrée principale pour tout mémoire en sociologie, science politique ou économie du travail.
- Type de données : Fichiers SPSS, Stata, CSV issus d’enquêtes en population
- Accès : Inscription gratuite avec adresse institutionnelle ; certaines enquêtes nécessitent un engagement de confidentialité
- Citation APA 7 : Producteur de l’enquête. (année). Nom de l’enquête (vague N) [Jeu de données]. Quetelet-Progedo Diffusion. https://doi.org/xxxxx
17. CDSP — Centre de données socio-politiques (Sciences Po)
Le CDSP archive et diffuse des données sur la vie politique et électorale française : sondages post-électoraux, enquêtes sur les attitudes politiques, données de résultats électoraux géolocalisés. Il est particulièrement utile pour les mémoires en science politique, sociologie électorale ou communication politique.
- Type de données : Enquêtes électorales, sondages d’opinion, données de vote agrégées
- Accès : Inscription gratuite
- Citation APA 7 : Auteur(s). (année). Titre de l’enquête [Jeu de données]. CDSP/Sciences Po. https://cdsp.sciences-po.fr/
18. UK Data Service
Principal entrepôt de données en sciences sociales du Royaume-Uni, financé par le UK Research and Innovation (UKRI). Il héberge des enquêtes longitudinales de référence mondiale (British Household Panel Study, Understanding Society) et le dépôt de l’European Social Survey. Incontournable pour les approches comparatives franco-britanniques ou les analyses de panel.
- Type de données : Enquêtes longitudinales, données de panel, données qualitatives transcrites
- Accès : Inscription gratuite avec adresse institutionnelle
- Citation APA 7 : Auteur(s). (année). Titre [Jeu de données]. UK Data Service. https://doi.org/xxxxx
19. GESIS — Leibniz Institute for Social Sciences
L’archive de données sociales allemande GESIS propose des enquêtes comparatives européennes et internationales : ALLBUS, ISSP (International Social Survey Programme), Eurobarometer. L’ISSP couvre des thématiques annuelles comparables entre 40 pays (genre, religion, inégalités, travail), ce qui en fait une ressource précieuse pour les analyses comparatives cross-nationales.
- Type de données : Données d’enquêtes comparatives internationales (40+ pays)
- Accès : Inscription gratuite
- Citation APA 7 : ISSP Research Group. (année). ISSP [thème] [année] [Jeu de données]. GESIS. https://doi.org/xxxxx
5. Santé et sciences médicales
20. Health Data Hub
La Plateforme des données de santé (HDH) est le guichet unique pour accéder aux données de santé à grande échelle en France : Système national des données de santé (SNDS), données hospitalières PMSI, cohortes nationales. En 2026, le HDH finalise la migration de son hébergement vers une infrastructure souveraine certifiée SecNumCloud, ce qui devrait élargir les accès approuvés d’ici la fin de l’année.
- Type de données : Données médico-administratives, diagnostics, séjours hospitaliers, consommation de soins
- Accès : Restreint — dossier de demande obligatoire, examen par un comité (réservé aux équipes de recherche constituées, pas aux mémoires de master seuls)
- Citation APA 7 : Health Data Hub. (année). Nom de la base [Jeu de données]. https://www.health-data-hub.fr/
21. PhysioNet
Hébergé par le MIT et financé par le NIH américain, PhysioNet donne accès à des données cliniques et physiologiques : signaux ECG, données de réanimation (MIMIC-IV), données de sommeil, séries de fréquence cardiaque. Indispensable pour les mémoires en bioingénierie, informatique médicale ou sciences infirmières qui mobilisent des analyses de signal.
- Type de données : Signaux physiologiques, données de réanimation, données de sommeil
- Accès : Inscription gratuite + formation CITI obligatoire pour certaines bases (MIMIC)
- Citation APA 7 : Auteur(s). (année). Titre de la base (version X) [Jeu de données]. PhysioNet. https://doi.org/10.13026/xxxxx
6. Environnement et géographie
22. Copernicus Climate Data Store (CDS)
Le service Copernicus de l’Union européenne propose des données climatiques réanalysées et prévisionnelles : ERA5 (réanalyse atmosphérique depuis 1940), températures de surface, précipitations, indices d’extrêmes climatiques. Les données sont disponibles via une API Python (cdsapi) ou en téléchargement direct. Ressource clé pour les mémoires en géographie, sciences de l’environnement, ou agronomie.
- Type de données : Données climatiques grillées, réanalyses atmosphériques, projections
- Accès : Inscription gratuite
- Citation APA 7 : Hersbach, H., et al. (2020). ERA5 hourly data on single levels from 1940 to present [Jeu de données]. Copernicus Climate Data Store. https://doi.org/10.24381/cds.adbb2d47
23. FAOSTAT (FAO)
La base de données statistiques de l’Organisation des Nations Unies pour l’alimentation et l’agriculture couvre la production agricole, le commerce agroalimentaire, la sécurité alimentaire et les émissions liées à l’agriculture dans plus de 245 pays. Les données sont exportables en CSV et actualisées annuellement.
- Type de données : Production agricole, commerce alimentaire, sécurité alimentaire, émissions GES secteur agricole
- Accès : Libre
- Citation APA 7 : FAO. (année). Nom de l’indicateur [Jeu de données]. FAOSTAT. https://www.fao.org/faostat/
7. Économie et finance
24. FMI — IMF Data
Le Fonds monétaire international met à disposition ses bases de données statistiques : Perspectives de l’économie mondiale (WEO), Balance of Payments Statistics, International Financial Statistics. Les données peuvent être exportées via l’API ou en fichiers CSV depuis le portail IMF Data (imf.org/en/Data). Utile pour les mémoires en macroéconomie, économie internationale ou finance publique.
- Type de données : Indicateurs macroéconomiques, balances des paiements, dette publique, réserves de change
- Accès : Libre
- Citation APA 7 : FMI. (année). Nom de la base/série [Jeu de données]. https://www.imf.org/en/Data
25. FRED — Federal Reserve Bank of St. Louis
FRED (Federal Reserve Economic Data) est l’une des bases de données macroéconomiques les plus utilisées dans le monde académique : plus de 800 000 séries temporelles issues de dizaines de sources (BEA, BLS, OECD, World Bank). Son API permet des extractions directes dans R (package fredr) ou Python. Bien que d’origine américaine, FRED héberge de nombreuses séries mondiales et européennes.
- Type de données : Séries macroéconomiques et financières (PIB, inflation, chômage, taux, etc.)
- Accès : Libre (API gratuite avec inscription)
- Citation APA 7 : Federal Reserve Bank of St. Louis. (année). Nom de la série [code FRED] [Jeu de données]. FRED. https://fred.stlouisfed.org/series/[CODE]
Comment citer un jeu de données dans son mémoire (APA 7)
Citer un jeu de données suit une logique identique à celle d’un article ou d’un rapport, mais quelques éléments spécifiques sont attendus. En APA 7, la structure de base est la suivante :
Auteur(s). (année). Titre du jeu de données (version le cas échéant) [Jeu de données]. Éditeur ou entrepôt. https://doi.org/xxxxx

La mention [Jeu de données] entre crochets est obligatoire : elle signale au lecteur que la source est une donnée brute et non une publication narrative. Si un DOI existe, il est toujours préférable à une URL classique car il est permanent. Si vous avez téléchargé plusieurs vagues d’une même enquête, citez chaque vague séparément et précisez la date de téléchargement dans une note de bas de page.
Pour les données que vous citez sans en proposer une analyse propre — pour calibrer vos hypothèses ou décrire votre contexte — il suffit de les mentionner dans le texte et de les lister en bibliographie. Pour les données qui constituent votre corpus d’analyse principal, décrivez dans la section méthode : la source, la vague ou l’édition, la taille de l’échantillon initial, les variables retenues et les traitements appliqués.
Attention aux biais propres à l’analyse secondaire : le jeu de données a été conçu pour répondre à une question qui n’est peut-être pas la vôtre. Identifiez explicitement les limites que cela impose à vos conclusions. Pour la sélection d’un sous-échantillon depuis un grand fichier, reportez-vous aux méthodes d’échantillonnage probabiliste ou raisonné selon votre objectif.
Enfin, si votre mémoire mobilise plusieurs jeux de données, pensez à consigner dans un plan de gestion des données la licence de chaque source, la date de téléchargement et le traitement appliqué. Cette traçabilité est exigée par un nombre croissant d’établissements et facilite la conservation de vos données après la soutenance conformément au RGPD.
FAQ — Jeux de données ouvertes pour un mémoire
Quelle différence entre une base bibliographique et un entrepôt de jeux de données ?
Une base bibliographique (Google Scholar, Scopus, PubMed) référence des publications — articles, thèses, ouvrages. Un entrepôt de données (Zenodo, data.gouv.fr, Quetelet-Progedo) héberge des fichiers bruts : tableaux CSV, fichiers SPSS, images, corpus audio. Pour un mémoire quantitatif, c’est le second type dont vous avez besoin pour conduire votre propre analyse statistique.
Un étudiant en master peut-il accéder aux données du Health Data Hub ?
En pratique, l’accès aux données du SNDS via le Health Data Hub est réservé aux équipes de recherche constituées avec un responsable scientifique, une convention avec un organisme reconnu et un avis favorable d’un comité éthique. Un étudiant seul en master ne peut pas déposer de dossier à titre individuel. Pour un mémoire en santé, préférez les données DREES, les données hospitalières agrégées disponibles sur data.gouv.fr, ou les enquêtes épidémiologiques publiques (Baromètre santé Santé publique France).
Comment trouver un jeu de données quand on ne connaît pas l’entrepôt adapté ?
Commencez par Google Dataset Search (datasetsearch.research.google.com) avec des mots-clés décrivant votre variable principale. Consultez ensuite les articles empiriques de référence de votre champ : ils citent généralement leurs sources de données en annexe ou en note de bas de page. Quetelet-Progedo et le UK Data Service publient par ailleurs des catalogues thématiques qui permettent de parcourir les enquêtes disponibles par domaine.
Peut-on utiliser des données Kaggle dans un mémoire académique ?
Oui, à condition de vérifier la licence de chaque jeu de données (CC0, CC BY, etc.) et de tracer son origine réelle : un jeu Kaggle a souvent été extrait d’une source officielle (UCI, Banque mondiale, Eurostat). Citez toujours la source primaire lorsqu’elle est identifiable, et mentionnez Kaggle comme intermédiaire de distribution. Précisez dans votre méthode les éventuels traitements déjà appliqués au fichier par son auteur.
Est-il obligatoire d’avoir un DOI pour citer un jeu de données ?
Non, un DOI n’est pas obligatoire mais fortement recommandé car il garantit la pérennité du lien. Si la source ne dispose pas de DOI, indiquez l’URL complète et précisez la date de consultation entre parenthèses. Pour les entrepôts institutionnels comme INSEE ou Eurostat, l’URL de la page de téléchargement spécifique à l’édition consultée est suffisante.
Analyser vos données avec l’aide de l’IA
Vous avez trouvé votre jeu de données, mais la rédaction de la section résultats et discussion reste un défi ? Tesify vous aide à structurer l’interprétation de vos analyses, à rédiger les parties empiriques de votre mémoire dans un registre académique rigoureux et à formuler vos limites méthodologiques de façon professionnelle.

Leave a Reply