Une plateforme de données pour l'IA
Cette offre est en cours de construction. La DINUM est toujours intéressée par vos besoins ?
La plateforme de données pour l'IA est une brique du socle interministériel d'IA générative opéré par la DINUM. Elle permet aux administrations d'adapter leur projet IA avec des données publiques pertinentes.
Elle s'articule autour de trois composantes :
RAG as a service, pour interroger des corpus documentaires via Albert API
data.gouv.fr comme socle de données de référence
MediaTech, une bibliothèque de jeux de données publics pré-traités et prêts à l'emploi
RAG as a service — Interroger des corpus documentaires via Albert API
Qu'est-ce que le RAG ?
Le RAG (Retrieval Augmented Generation) est une technique qui permet à un modèle de langage de répondre à des questions en s'appuyant sur un corpus documentaire spécifique, plutôt que sur ses seules connaissances générales. C'est la méthode la plus répandue pour créer des assistants IA spécialisés sur un domaine métier.
Pour aller plus loin : Un guide RAG est disponible pour accompagner les équipes dans la compréhension du RAG et dans la mise en place de leur premier cas d'usage.
L'offre RAG d'Albert API
Albert API propose un RAG as a service qui permet aux administrations de :
Créer un espace documentaire (collection) dans lequel déposer des documents
Interroger ces documents en langage naturel via l'API
S'appuyer sur des collections publiques pré-constituées (issues de MediaTech) comme Légifrance ou service-public.fr
L'intérêt : Les équipes techniques n'ont pas à gérer l'infrastructure de vectorisation, de stockage et de recherche sémantique. Albert API le fait pour elles.
Trois niveaux de service
Niveau
Usage
Données
Mutualisé
Collections publiques partagées entre ministères
Données non sensibles (Légifrance, service-public.fr, etc.)
Dédié
Espace documentaire propre à une administration
Données sensibles (notes internes, circulaires, etc.)
On-premise
Instance auto-hébergée par l'administration
Données confidentielles
Comment démarrer
Demander un accès à Albert API via le formulaire dédié
Choisir son mode : utiliser les collections publiques existantes ou créer sa propre collection
Intégrer l'API dans son application métier — Albert API est compatible avec les standards OpenAI
data.gouv.fr — Le socle de données de référence
Le rôle de data.gouv.fr dans le socle IA
data.gouv.fr est la plateforme nationale d'open data. Elle référence plus de 50 000 jeux de données produits par les administrations françaises.
Dans le cadre du socle IA interministériel, data.gouv.fr joue un rôle central : celui de point d'accès unifié aux données publiques françaises pour les systèmes d'IA. Plutôt que de multiplier les sources et les formats, data.gouv.fr fournit un catalogue de référence dans lequel les applications IA peuvent puiser.
Concrètement, data.gouv.fr offre :
Une API de référence pour rechercher des jeux de données, accéder aux métadonnées et interroger les ressources
Un catalogue structuré avec des métadonnées normalisées (organisation productrice, format, fréquence de mise à jour, licence)
Un accès à des données tabulaires interrogeables directement via l'API
Le serveur MCP data.gouv.fr
Depuis début 2026, data.gouv.fr expose un serveur MCP (Model Context Protocol) expérimental. Le MCP est un protocole ouvert qui permet aux systèmes d'IA d'interagir avec des sources de données externes de manière structurée.
Ce que permet le MCP data.gouv :
Outil
Description
search_datasets
Rechercher des jeux de données par mots-clés, organisation ou format
get_dataset_info
Récupérer les métadonnées complètes d'un jeu de données
list_dataset_resources
Lister les ressources disponibles d'un dataset
get_resource_info
Accéder aux détails d'une ressource
query_resource_data
Interroger directement les données tabulaires
get_metrics
Consulter les statistiques d'usage
search_dataservices
Rechercher des API référencées sur data.gouv.fr
Comment l'utiliser :
Le serveur MCP data.gouv est disponible en open source. Il peut être connecté à tout assistant IA compatible MCP (Claude, ChatGPT, etc.) pour permettre à un agent conversationnel de rechercher et d'exploiter les données publiques françaises en contexte.
Il est en cours d'intégration dans l'Assistant IA de la DINUM pour permettre aux agents publics d'accéder aux données publiques directement depuis leur interface de travail.
Statut : Expérimental — le serveur MCP est en phase de test et d'évaluation. Un dispositif de monitoring et d'évaluation de la qualité des réponses est en cours de mise en place.
L'écosystème MCP dans l'État
Le MCP data.gouv n'est pas un projet isolé. Plusieurs serveurs MCP liés aux données publiques françaises émergent ou sont en réflexion. Citons notamment celui de l'Éducation nationale qui permet d'accès aux données issus du portail open-data du Ministère.
MediaTech — Collections publiques prêtes pour l'IA
Qu'est-ce que MediaTech ?
MediaTech est une bibliothèque de jeux de données publics pré-traités, découpés et structurés pour être directement utilisables dans des applications d'IA générative (RAG, recherche sémantique, etc.).
Le problème que MediaTech résout : avant de pouvoir utiliser un corpus public dans une application IA, il faut le collecter, le nettoyer, le découper en segments pertinents (chunking) et le vectoriser. Ce travail prend des semaines. MediaTech le fait une fois pour toutes et met le résultat à disposition.
Collections disponibles
Les collections MediaTech sont publiées sur Hugging Face et data.gouv. Elles seront bientôt intégrées dans Albert API en tant que Collections publiques. Voici les collections disponibles :
Collection
Source
Description
legi
Légifrance
Codes et lois en vigueur
travail-emploi
Ministère du Travail
Documentation travail et emploi
dole
DOLE
Documentation administrative
local-administrations-directory
Annuaire
Annuaire des administrations locales
state-administrations-directory
Annuaire
Annuaire des administrations d'État
cnil
CNIL
Documentation CNIL
constit
Conseil constitutionnel
Décisions et textes constitutionnels
Ce que contiennent les collections
Chaque collection fournit :
Les documents sources nettoyés
Un découpage en segments (chunks)
Des métadonnées structurées (source, date, type de document)
Les embeddings ne sont volontairement pas imposés : les retours utilisateurs montrent que chaque équipe préfère utiliser son propre modèle d'embeddings selon son cas d'usage.
Comment utiliser MediaTech
Via Hugging Face ou data.gouv — Téléchargement direct des datasets pour intégration dans votre propre vector store
Via Albert API — Les collections MediaTech sont progressivement intégrées comme collections de référence dans le RAG as a service d'Albert API (voir section suivante)
Pour aller plus loin
Documentation technique Albert API : https://doc.incubateur.net/alliance/albert-api
Collections MediaTech sur Hugging Face : huggingface.co/etalab-ia
Code source du MCP data.gouv : https://github.com/datagouv/datagouv-mcp
Mis à jour
Ce contenu vous a-t-il été utile ?