> For the complete documentation index, see [llms.txt](https://guides.ia.numerique.gouv.fr/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://guides.ia.numerique.gouv.fr/socle-interministerielle-dintelligence-artificielle-generative/une-plateforme-de-donnees-pour-lia.md).

# Une plateforme de données pour l'IA

{% hint style="info" %}
Cette offre est en cours de construction. La DINUM est toujours intéressée par vos besoins ?
{% endhint %}

La plateforme de données pour l'IA est une brique du socle interministériel d'IA générative opéré par la DINUM. Elle permet aux administrations d'adapter leur projet IA avec des données publiques pertinentes.

Elle s'articule autour de trois composantes :

1. **RAG as a service**, pour interroger des corpus documentaires via Albert API
2. [**data.gouv.fr**](http://data.gouv.fr) comme socle de données de référence
3. **MediaTech**, une bibliothèque de jeux de données publics pré-traités et prêts à l'emploi

***

### RAG as a service — Interroger des corpus documentaires via Albert API

#### Qu'est-ce que le RAG ?

Le RAG (Retrieval Augmented Generation) est une technique qui permet à un modèle de langage de répondre à des questions en s'appuyant sur un corpus documentaire spécifique, plutôt que sur ses seules connaissances générales. C'est la méthode la plus répandue pour créer des assistants IA spécialisés sur un domaine métier.

{% hint style="info" %}
**Pour aller plus loin :** Un guide RAG est disponible pour accompagner les équipes dans la compréhension du RAG et dans la mise en place de leur premier cas d'usage.
{% endhint %}

#### L'offre RAG d'Albert API

Albert API propose un **RAG as a service** qui permet aux administrations de :

* **Créer un espace documentaire** (collection) dans lequel déposer des documents
* **Interroger ces documents** en langage naturel via l'API
* **S'appuyer sur des collections publiques** pré-constituées (issues de MediaTech) comme Légifrance ou [service-public.fr](http://service-public.fr)

**L'intérêt :** Les équipes techniques n'ont pas à gérer l'infrastructure de vectorisation, de stockage et de recherche sémantique. Albert API le fait pour elles.

#### Trois niveaux de service

| Niveau         | Usage                                            | Données                                                                                 |
| -------------- | ------------------------------------------------ | --------------------------------------------------------------------------------------- |
| **Mutualisé**  | Collections publiques partagées entre ministères | Données non sensibles (Légifrance, [service-public.fr](http://service-public.fr), etc.) |
| **Dédié**      | Espace documentaire propre à une administration  | Données sensibles (notes internes, circulaires, etc.)                                   |
| **On-premise** | Instance auto-hébergée par l'administration      | Données confidentielles                                                                 |

#### Comment démarrer

1. **Demander un accès** à Albert API via [le formulaire dédié](https://albert-api.numerique.gouv.fr/)
2. **Choisir son mode** : utiliser les collections publiques existantes ou créer sa propre collection
3. **Intégrer l'API** dans son application métier — Albert API est compatible avec les standards OpenAI

***

### [data.gouv.fr](http://data.gouv.fr) — Le socle de données de référence

#### Le rôle de [data.gouv.fr](http://data.gouv.fr) dans le socle IA

[data.gouv.fr](http://data.gouv.fr) est la plateforme nationale d'open data. Elle référence plus de 50 000 jeux de données produits par les administrations françaises.

Dans le cadre du socle IA interministériel, [data.gouv.fr](http://data.gouv.fr) joue un rôle central : celui de **point d'accès unifié aux données publiques françaises pour les systèmes d'IA**. Plutôt que de multiplier les sources et les formats, [data.gouv.fr](http://data.gouv.fr) fournit un catalogue de référence dans lequel les applications IA peuvent puiser.

**Concrètement,** [**data.gouv.fr**](http://data.gouv.fr) **offre :**

* Une **API de référence** pour rechercher des jeux de données, accéder aux métadonnées et interroger les ressources
* Un **catalogue structuré** avec des métadonnées normalisées (organisation productrice, format, fréquence de mise à jour, licence)
* Un accès à des **données tabulaires interrogeables** directement via l'API

#### Le serveur MCP [data.gouv.fr](http://data.gouv.fr)

Depuis début 2026, [data.gouv.fr](http://data.gouv.fr) expose un **serveur MCP** (Model Context Protocol) expérimental. Le MCP est un protocole ouvert qui permet aux systèmes d'IA d'interagir avec des sources de données externes de manière structurée.

**Ce que permet le MCP data.gouv :**

| Outil                    | Description                                                            |
| ------------------------ | ---------------------------------------------------------------------- |
| `search_datasets`        | Rechercher des jeux de données par mots-clés, organisation ou format   |
| `get_dataset_info`       | Récupérer les métadonnées complètes d'un jeu de données                |
| `list_dataset_resources` | Lister les ressources disponibles d'un dataset                         |
| `get_resource_info`      | Accéder aux détails d'une ressource                                    |
| `query_resource_data`    | Interroger directement les données tabulaires                          |
| `get_metrics`            | Consulter les statistiques d'usage                                     |
| `search_dataservices`    | Rechercher des API référencées sur [data.gouv.fr](http://data.gouv.fr) |

**Comment l'utiliser :**

Le serveur MCP data.gouv est disponible en open source. Il peut être connecté à tout assistant IA compatible MCP (Claude, ChatGPT, etc.) pour permettre à un agent conversationnel de rechercher et d'exploiter les données publiques françaises en contexte.

Il est en cours d'intégration dans l'**Assistant IA** de la DINUM pour permettre aux agents publics d'accéder aux données publiques directement depuis leur interface de travail.

{% hint style="info" %}
**Statut :** Expérimental — le serveur MCP est en phase de test et d'évaluation. Un dispositif de monitoring et d'évaluation de la qualité des réponses est en cours de mise en place.
{% endhint %}

#### L'écosystème MCP dans l'État

Le MCP data.gouv n'est pas un projet isolé. Plusieurs serveurs MCP liés aux données publiques françaises émergent ou sont en réflexion. Citons notamment celui de l'**Éducation nationale** qui permet d'accès aux données issus du portail open-data du Ministère.

***

### MediaTech — Collections publiques prêtes pour l'IA

#### Qu'est-ce que MediaTech ?

MediaTech est une **bibliothèque de jeux de données publics pré-traités**, découpés et structurés pour être directement utilisables dans des applications d'IA générative (RAG, recherche sémantique, etc.).

Le problème que MediaTech résout : avant de pouvoir utiliser un corpus public dans une application IA, il faut le collecter, le nettoyer, le découper en segments pertinents (chunking) et le vectoriser. Ce travail prend des semaines. MediaTech le fait une fois pour toutes et met le résultat à disposition.

#### Collections disponibles

Les collections MediaTech sont publiées sur Hugging Face et [data.gouv](https://www.data.gouv.fr/organizations/direction-interministerielle-du-numerique/datasets). Elles seront bientôt intégrées dans Albert API en tant que Collections publiques.\
Voici les collections disponibles :

| Collection                        | Source                                        | Description                          |
| --------------------------------- | --------------------------------------------- | ------------------------------------ |
| `legi`                            | Légifrance                                    | Codes et lois en vigueur             |
| `service-public`                  | [service-public.fr](http://service-public.fr) | Fiches pratiques pour les usagers    |
| `data-gouv-datasets-catalog`      | [data.gouv.fr](http://data.gouv.fr)           | Catalogue de jeux de données         |
| `travail-emploi`                  | Ministère du Travail                          | Documentation travail et emploi      |
| `dole`                            | DOLE                                          | Documentation administrative         |
| `local-administrations-directory` | Annuaire                                      | Annuaire des administrations locales |
| `state-administrations-directory` | Annuaire                                      | Annuaire des administrations d'État  |
| `cnil`                            | CNIL                                          | Documentation CNIL                   |
| `constit`                         | Conseil constitutionnel                       | Décisions et textes constitutionnels |

#### Ce que contiennent les collections

Chaque collection fournit :

* Les **documents sources** nettoyés
* Un **découpage en segments** (chunks)
* Des **métadonnées structurées** (source, date, type de document)

Les embeddings ne sont volontairement pas imposés : les retours utilisateurs montrent que chaque équipe préfère utiliser son propre modèle d'embeddings selon son cas d'usage.

#### Comment utiliser MediaTech

1. **Via Hugging Face** ou **data.gouv** — Téléchargement direct des datasets pour intégration dans votre propre vector store
2. **Via Albert API** — Les collections MediaTech sont progressivement intégrées comme collections de référence dans le RAG as a service d'Albert API (voir section suivante)

***

### Pour aller plus loin

* **Documentation technique Albert API** : <https://doc.incubateur.net/alliance/albert-api>
* **Collections MediaTech sur Hugging Face** : [huggingface.co/etalab-ia](https://huggingface.co/etalab-ia)
* **Code source du MCP data.gouv** : <https://github.com/datagouv/datagouv-mcp>


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://guides.ia.numerique.gouv.fr/socle-interministerielle-dintelligence-artificielle-generative/une-plateforme-de-donnees-pour-lia.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
