For the complete documentation index, see llms.txt. This page is also available as Markdown.

Une plateforme de données pour l'IA

Cette offre est en cours de construction. La DINUM est toujours intéressée par vos besoins ?

La plateforme de données pour l'IA est une brique du socle interministériel d'IA générative opéré par la DINUM. Elle permet aux administrations d'adapter leur projet IA avec des données publiques pertinentes.

Elle s'articule autour de trois composantes :

  1. RAG as a service, pour interroger des corpus documentaires via Albert API

  2. data.gouv.fr comme socle de données de référence

  3. MediaTech, une bibliothèque de jeux de données publics pré-traités et prêts à l'emploi


RAG as a service — Interroger des corpus documentaires via Albert API

Qu'est-ce que le RAG ?

Le RAG (Retrieval Augmented Generation) est une technique qui permet à un modèle de langage de répondre à des questions en s'appuyant sur un corpus documentaire spécifique, plutôt que sur ses seules connaissances générales. C'est la méthode la plus répandue pour créer des assistants IA spécialisés sur un domaine métier.

Pour aller plus loin : Un guide RAG est disponible pour accompagner les équipes dans la compréhension du RAG et dans la mise en place de leur premier cas d'usage.

L'offre RAG d'Albert API

Albert API propose un RAG as a service qui permet aux administrations de :

  • Créer un espace documentaire (collection) dans lequel déposer des documents

  • Interroger ces documents en langage naturel via l'API

  • S'appuyer sur des collections publiques pré-constituées (issues de MediaTech) comme Légifrance ou service-public.fr

L'intérêt : Les équipes techniques n'ont pas à gérer l'infrastructure de vectorisation, de stockage et de recherche sémantique. Albert API le fait pour elles.

Trois niveaux de service

Niveau

Usage

Données

Mutualisé

Collections publiques partagées entre ministères

Données non sensibles (Légifrance, service-public.fr, etc.)

Dédié

Espace documentaire propre à une administration

Données sensibles (notes internes, circulaires, etc.)

On-premise

Instance auto-hébergée par l'administration

Données confidentielles

Comment démarrer

  1. Demander un accès à Albert API via le formulaire dédié

  2. Choisir son mode : utiliser les collections publiques existantes ou créer sa propre collection

  3. Intégrer l'API dans son application métier — Albert API est compatible avec les standards OpenAI


data.gouv.fr — Le socle de données de référence

Le rôle de data.gouv.fr dans le socle IA

data.gouv.fr est la plateforme nationale d'open data. Elle référence plus de 50 000 jeux de données produits par les administrations françaises.

Dans le cadre du socle IA interministériel, data.gouv.fr joue un rôle central : celui de point d'accès unifié aux données publiques françaises pour les systèmes d'IA. Plutôt que de multiplier les sources et les formats, data.gouv.fr fournit un catalogue de référence dans lequel les applications IA peuvent puiser.

Concrètement, data.gouv.fr offre :

  • Une API de référence pour rechercher des jeux de données, accéder aux métadonnées et interroger les ressources

  • Un catalogue structuré avec des métadonnées normalisées (organisation productrice, format, fréquence de mise à jour, licence)

  • Un accès à des données tabulaires interrogeables directement via l'API

Le serveur MCP data.gouv.fr

Depuis début 2026, data.gouv.fr expose un serveur MCP (Model Context Protocol) expérimental. Le MCP est un protocole ouvert qui permet aux systèmes d'IA d'interagir avec des sources de données externes de manière structurée.

Ce que permet le MCP data.gouv :

Outil

Description

search_datasets

Rechercher des jeux de données par mots-clés, organisation ou format

get_dataset_info

Récupérer les métadonnées complètes d'un jeu de données

list_dataset_resources

Lister les ressources disponibles d'un dataset

get_resource_info

Accéder aux détails d'une ressource

query_resource_data

Interroger directement les données tabulaires

get_metrics

Consulter les statistiques d'usage

search_dataservices

Rechercher des API référencées sur data.gouv.fr

Comment l'utiliser :

Le serveur MCP data.gouv est disponible en open source. Il peut être connecté à tout assistant IA compatible MCP (Claude, ChatGPT, etc.) pour permettre à un agent conversationnel de rechercher et d'exploiter les données publiques françaises en contexte.

Il est en cours d'intégration dans l'Assistant IA de la DINUM pour permettre aux agents publics d'accéder aux données publiques directement depuis leur interface de travail.

Statut : Expérimental — le serveur MCP est en phase de test et d'évaluation. Un dispositif de monitoring et d'évaluation de la qualité des réponses est en cours de mise en place.

L'écosystème MCP dans l'État

Le MCP data.gouv n'est pas un projet isolé. Plusieurs serveurs MCP liés aux données publiques françaises émergent ou sont en réflexion. Citons notamment celui de l'Éducation nationale qui permet d'accès aux données issus du portail open-data du Ministère.


MediaTech — Collections publiques prêtes pour l'IA

Qu'est-ce que MediaTech ?

MediaTech est une bibliothèque de jeux de données publics pré-traités, découpés et structurés pour être directement utilisables dans des applications d'IA générative (RAG, recherche sémantique, etc.).

Le problème que MediaTech résout : avant de pouvoir utiliser un corpus public dans une application IA, il faut le collecter, le nettoyer, le découper en segments pertinents (chunking) et le vectoriser. Ce travail prend des semaines. MediaTech le fait une fois pour toutes et met le résultat à disposition.

Collections disponibles

Les collections MediaTech sont publiées sur Hugging Face et data.gouv. Elles seront bientôt intégrées dans Albert API en tant que Collections publiques. Voici les collections disponibles :

Collection

Source

Description

legi

Légifrance

Codes et lois en vigueur

service-public

service-public.fr

Fiches pratiques pour les usagers

data-gouv-datasets-catalog

data.gouv.fr

Catalogue de jeux de données

travail-emploi

Ministère du Travail

Documentation travail et emploi

dole

DOLE

Documentation administrative

local-administrations-directory

Annuaire

Annuaire des administrations locales

state-administrations-directory

Annuaire

Annuaire des administrations d'État

cnil

CNIL

Documentation CNIL

constit

Conseil constitutionnel

Décisions et textes constitutionnels

Ce que contiennent les collections

Chaque collection fournit :

  • Les documents sources nettoyés

  • Un découpage en segments (chunks)

  • Des métadonnées structurées (source, date, type de document)

Les embeddings ne sont volontairement pas imposés : les retours utilisateurs montrent que chaque équipe préfère utiliser son propre modèle d'embeddings selon son cas d'usage.

Comment utiliser MediaTech

  1. Via Hugging Face ou data.gouv — Téléchargement direct des datasets pour intégration dans votre propre vector store

  2. Via Albert API — Les collections MediaTech sont progressivement intégrées comme collections de référence dans le RAG as a service d'Albert API (voir section suivante)


Pour aller plus loin

Mis à jour

Ce contenu vous a-t-il été utile ?