> For the complete documentation index, see [llms.txt](https://guides.ia.numerique.gouv.fr/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://guides.ia.numerique.gouv.fr/guides/guide-de-construction-dun-assistant-conversationnel-base-sur-du-rag/jeu-de-donnees-de-reference.md).

# Jeu de données de référence

## Jeu de données de référence

La création d’un <mark style="background-color:blue;">**jeu de données de référence (golden dataset)**</mark> <mark style="background-color:blue;"></mark><mark style="background-color:blue;">est un pré-requis à toute évaluation automatique fiable</mark>. Ce jeu de données regroupe un ensemble de questions représentatives des usages réels, associées à des **réponses attendues**, des **documents de référence**.

Il permet notamment de :

* comparer différentes versions du système RAG dans le temps ;
* détecter des régressions fonctionnelles ;
* mesurer l’impact des évolutions techniques (indexation, prompting, changement de modèle, etc.).

Ce jeu de données devient votre **référence de qualité** pour suivre les progrès du produit dans le temps. C’est une base de scénarios typiques utilisateurs :

* 20 à 50 questions réelles ou simulées sur une thématique
* Pour chaque question : une **bonne réponse** (rédigée par un expert ou validée à la main)
* Et la **source officielle** (document, base, page intranet…)
* La date de création du couple questions-réponses et sa mise à jour

Ce jeu de données, initié par la personne référent métier de l'équipe, doit être co-construit avec les référents métier expérimentateurs, <mark style="background-color:blue;">**maintenu dans la durée et enrichi de manière itérative**</mark>, en particulier à partir des cas problématiques identifiés lors des évaluations humaines.

💡 Il n’est pas rare que l’équipe rencontre des difficultés lors de la construction du jeu de données de référence, notamment parce qu’il est complexe de définir *la* vérité terrain unique ou *la* réponse parfaitement correcte à une question donnée. Il est important de garder à l’esprit qu’<mark style="background-color:blue;">**il peut exister plusieurs réponses acceptables**</mark>, et que l’objectif n’est pas d’identifier *la* bonne réponse, mais une réponse de référence cohérente et justifiable.

<mark style="background-color:blue;">**Les évaluations automatisées doivent ainsi être comprises comme des outils de mesure de tendance, visant à apprécier l’évolution de la qualité du système dans le temps plutôt qu’à produire des verdicts absolus**</mark>. Par ailleurs, de nombreuses métriques reposent sur des juges basés sur des modèles de langage, dont les résultats peuvent être non déterministes.

Il est donc essentiel de conserver un recul critique sur les résultats d’évaluation. La valeur du jeu de données de référence réside avant tout dans sa capacité à permettre des comparaisons relatives entre versions du système, afin d’analyser les progrès, les régressions ou les effets de certaines décisions techniques, plutôt que de fournir une mesure exacte et définitive de la qualité.

#### Construction d'un jeu de données de référence

Selon les contraintes et le stade du projet, nous identifions trois approches principales pour construire un jeu de données de référence, approches que l’on peut également combiner :

* Création du jeu de données de référence avec <mark style="background-color:blue;">**des référents métier**</mark>

Cette approche consiste à mobiliser des **experts du domaine** pour rédiger les couples de questions - réponses. C’est l’approche la plus robuste en termes de fiabilité. Les réponses servent de **vérités de référence** pour tester la factualité et la complétude des réponses de l’agent. Elle est particulièrement recommandée dans les **domaines sensibles** (santé, droit, réglementation) mais peut-être coûteuse en terme de mobilisation.

* Création du jeu de données de référence <mark style="background-color:blue;">**sur un historique de données réelles**</mark>

Cette approche consiste à utiliser des données existantes (FAQ, historique de service usager, ...) ou les premières questions posées par de vrais utilisateurs en production. Les réponses générées par l’agent sont ensuite corrigées ou validées par des validateurs métier. Cette approche est idéale pour l’accélération et la pérennisation, quand l'outil est déjà utilisé par une communauté élargie.

* Création du jeu de données de <mark style="background-color:blue;">**référence "synthétique"**</mark>

Cette approche consiste à générer des couples questions-réponses via un LLM, sur la base du corpus documentaire existant. On peut par exemple demander à un LLM de produire des questions que poserait un utilisateur et d’y répondre en s’appuyant sur les documents fournis. Cette approche est utile en début de construction, pour itérer vite et détecter rapidement les points faibles de l’agent mais elle doit être consolidée par d’autres méthodes sur le moyen / long terme. Ces données synthétiques peuvent également initier la collaboration avec des experts métier, qui corrigeront ou valideront la réponse générée par le LLM.


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://guides.ia.numerique.gouv.fr/guides/guide-de-construction-dun-assistant-conversationnel-base-sur-du-rag/jeu-de-donnees-de-reference.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
