For the complete documentation index, see llms.txt. This page is also available as Markdown.

Jeu de données de référence

Jeu de données de référence

La création d’un jeu de données de référence (golden dataset) est un pré-requis à toute évaluation automatique fiable. Ce jeu de données regroupe un ensemble de questions représentatives des usages réels, associées à des réponses attendues, des documents de référence.

Il permet notamment de :

  • comparer différentes versions du système RAG dans le temps ;

  • détecter des régressions fonctionnelles ;

  • mesurer l’impact des évolutions techniques (indexation, prompting, changement de modèle, etc.).

Ce jeu de données devient votre référence de qualité pour suivre les progrès du produit dans le temps. C’est une base de scénarios typiques utilisateurs :

  • 20 à 50 questions réelles ou simulées sur une thématique

  • Pour chaque question : une bonne réponse (rédigée par un expert ou validée à la main)

  • Et la source officielle (document, base, page intranet…)

  • La date de création du couple questions-réponses et sa mise à jour

Ce jeu de données, initié par la personne référent métier de l'équipe, doit être co-construit avec les référents métier expérimentateurs, maintenu dans la durée et enrichi de manière itérative, en particulier à partir des cas problématiques identifiés lors des évaluations humaines.

💡 Il n’est pas rare que l’équipe rencontre des difficultés lors de la construction du jeu de données de référence, notamment parce qu’il est complexe de définir la vérité terrain unique ou la réponse parfaitement correcte à une question donnée. Il est important de garder à l’esprit qu’il peut exister plusieurs réponses acceptables, et que l’objectif n’est pas d’identifier la bonne réponse, mais une réponse de référence cohérente et justifiable.

Les évaluations automatisées doivent ainsi être comprises comme des outils de mesure de tendance, visant à apprécier l’évolution de la qualité du système dans le temps plutôt qu’à produire des verdicts absolus. Par ailleurs, de nombreuses métriques reposent sur des juges basés sur des modèles de langage, dont les résultats peuvent être non déterministes.

Il est donc essentiel de conserver un recul critique sur les résultats d’évaluation. La valeur du jeu de données de référence réside avant tout dans sa capacité à permettre des comparaisons relatives entre versions du système, afin d’analyser les progrès, les régressions ou les effets de certaines décisions techniques, plutôt que de fournir une mesure exacte et définitive de la qualité.

Construction d'un jeu de données de référence

Selon les contraintes et le stade du projet, nous identifions trois approches principales pour construire un jeu de données de référence, approches que l’on peut également combiner :

  • Création du jeu de données de référence avec des référents métier

Cette approche consiste à mobiliser des experts du domaine pour rédiger les couples de questions - réponses. C’est l’approche la plus robuste en termes de fiabilité. Les réponses servent de vérités de référence pour tester la factualité et la complétude des réponses de l’agent. Elle est particulièrement recommandée dans les domaines sensibles (santé, droit, réglementation) mais peut-être coûteuse en terme de mobilisation.

  • Création du jeu de données de référence sur un historique de données réelles

Cette approche consiste à utiliser des données existantes (FAQ, historique de service usager, ...) ou les premières questions posées par de vrais utilisateurs en production. Les réponses générées par l’agent sont ensuite corrigées ou validées par des validateurs métier. Cette approche est idéale pour l’accélération et la pérennisation, quand l'outil est déjà utilisé par une communauté élargie.

  • Création du jeu de données de référence "synthétique"

Cette approche consiste à générer des couples questions-réponses via un LLM, sur la base du corpus documentaire existant. On peut par exemple demander à un LLM de produire des questions que poserait un utilisateur et d’y répondre en s’appuyant sur les documents fournis. Cette approche est utile en début de construction, pour itérer vite et détecter rapidement les points faibles de l’agent mais elle doit être consolidée par d’autres méthodes sur le moyen / long terme. Ces données synthétiques peuvent également initier la collaboration avec des experts métier, qui corrigeront ou valideront la réponse générée par le LLM.

Mis à jour

Ce contenu vous a-t-il été utile ?