> For the complete documentation index, see [llms.txt](https://guides.ia.numerique.gouv.fr/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://guides.ia.numerique.gouv.fr/socle-interministerielle-dintelligence-artificielle-generative/documentia-votre-pipeline-danalyse-documentaire.md).

# DocumentIA, votre pipeline d'analyse documentaire

<a href="https://api.sandbox.document-ia.beta.gouv.fr/redoc" class="button primary">Documentation</a>

### Contexte et présentation du projet

#### Bénéfices et cas d'usage

Une solution d'intelligence documentaire permet notamment :

| Cas d'usage                          | Bénéfices                                                                                                                                                     |
| ------------------------------------ | ------------------------------------------------------------------------------------------------------------------------------------------------------------- |
| **Retour direct à l'usager**         | Satisfaction usager, qualité des dossiers en instruction, diminution des coûts. L'usager peut corriger son dossier immédiatement, sans attendre l'instructeur |
| **Automatisation de l'instruction**  | Réduction des coûts et délais, amélioration de l'expérience utilisateur. Passage d'une analyse manuelle à une extraction automatisée des données              |
| **Lutte contre la fraude**           | Assistance des agents, détection améliorée grâce au croisement de sources de données                                                                          |
| **Constitution de bases de données** | Numérisation et analyse de documents historiques, patrimoniaux ou non structurés                                                                              |

<a href="https://beta.gouv.fr/startups/document-ia.html" class="button primary">Voir la page produit beta.gouv.fr</a>

#### Guide de mise en œuvre

Un **guide plus complet** sur la mise en œuvre de solutions d'intelligence documentaire est disponible. Il couvre notamment l'investigation métier et technique, le prototypage, l'évaluation des performances, les enjeux juridiques et les bonnes pratiques pour les administrations.

→ Consultez le Guide Intelligence Documentaire pour une approche globale.

***

### Introduction technique

Document-IA est une solution **générique, souveraine** et **sécurisée** d’**analyse automatique** de pièces justificatives, disponible par API.

L’API Document-IA déploie les fonctionnalités principales suivantes :

* **Catégorisation** du type de document
* **Extraction** des informations présentes dans le document sous un format standardisé
* **Identification** et lecture de **codes à barres** : QRcode, 2DDOC

### Concepts clés

#### Workflow

Un **workflow** est une pipeline de traitement de document qui décrit quelles sont **les étapes à réaliser et dans quel ordre**. Dans un workflow, on peut préciser des règles : quels sont les types de fichiers supportés, quel modèle OCR ou LLM utiliser etc.

Chaque étape est une brique atomique du workflow : une étape de traitement (ex: télécharger, pré-traiter, extraire le texte via OCR, extraire les informations via LLM, sauvegarder les résultats).

Liste des **workflows disponibles** en environnement de sandbox :

🔗 <https://github.com/betagouv/document-ia/blob/sandbox/document-ia-infra/src/document_ia_infra/data/workflow/data/workflows.json>

*Note : Il est également possible d'obtenir la liste des workflows via l'endpoint* `GET /api/v2/workflows/`*.*

#### Schéma

Un **schéma de document** décrit **quelles informations sont attendues** pour un type de document donné, et **comment elles doivent être nommées et structurées**. C’est la définition typée des données à extraire pour un type de pièce (CNI, passeport, avis d’imposition, etc.).

* Exemple (carte d’identité) : prénom, nom, date de naissance, numéro de document, etc.

Liste des **schémas disponibles** en environnement de sandbox :

🔗 <https://github.com/betagouv/document-ia/tree/sandbox/document-ia-schemas/src/document_ia_schemas>

***

### Environnement (Sandbox)

**URL de base :** `https://api.sandbox.document-ia.beta.gouv.fr`

### Authentification

L'API utilise une authentification par clé API (token). Vous devez inclure votre clé dans l'en-tête de vos requêtes HTTP avec le header `X-API-KEY`

{% hint style="info" icon="lightbulb" %}
Pour disposer d’une clé d’API, vous devez contacter l’équipe Document-IA
{% endhint %}

***

### Ressources

#### Documentation API

Pour plus de détails sur les paramètres et les réponses, consultez la documentation.

<a href="https://api.sandbox.document-ia.beta.gouv.fr/redoc" class="button primary">Documentation</a>

#### Collection API

Une collection [Bruno](https://www.usebruno.com/) est disponible pour tester l'API facilement

🔗 <https://github.com/betagouv/document-ia/tree/sandbox/document-ia-api/bruno-api>

***

### Exécution des workflows (endpoint v2)

{% hint style="warning" %}
**Dépréciation :** Les anciens endpoints `v1` (`/api/v1/workflows/...`) sont dépréciés. Il faut dorénavant utiliser les endpoints `v2` (`/api/v2/workflows/...`) pour lancer des analyses.
{% endhint %}

Une documentation détaillée sur l'exécution des workflows V2 est disponible [ici](https://github.com/betagouv/document-ia/blob/main/document-ia-api/docs/WORKFLOW_V2.md).

Il est possible d’appeler l’API de 2 manières :

* **asynchrone (recommandé en production)** via la route `POST /api/v2/workflows/{workflow_id}/execute`. Le endpoint répond avec un id d’exécution `execution_id`, le résultat de l’exécution peut être récupéré alors par :
  * appel API, pulling sur la route de récupération d'une exécution
  * par webhook sur l’url de votre choix (contacter l’équipe Document-IA pour la configuration du webhook)
* **synchrone** via la route `POST /api/v2/workflows/{workflow_id}/execute-sync`. Le résultat de l’exécution est dans ce cas directement disponible dans la réponse de la requête.

{% hint style="info" %}
Le fonctionnement synchrone décrit n'est possible qu'en expérimentation en sandbox. En production, seul le fonctionnement asynchrone est disponible et recommandé.
{% endhint %}

### Workflow spécifique : Extraction de codes-barres

Pour l'extraction de codes-barres 2D-DOC sans analyse par LLM, utilisez le workflow :

**`document-barcode-extraction-v2`**

Ce workflow :

* N'utilise pas de LLM
* N'utilise pas d'OCR
* Extrait directement les codes-barres des documents et vérifie les signatures 2DDOC.

{% hint style="info" icon="lightbulb" %}
L’utilisation de ce workflow dans le cadre d’appel API synchrone est recommandé (faible latence : \~500ms).
{% endhint %}


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://guides.ia.numerique.gouv.fr/socle-interministerielle-dintelligence-artificielle-generative/documentia-votre-pipeline-danalyse-documentaire.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
