For the complete documentation index, see llms.txt. This page is also available as Markdown.

OCR - Reconnaissance Optique de Caractères

L'OCR (Optical Character Recognition, reconnaissance optique de caractères) permet d'extraire le texte contenu dans une image ou un document scanné (PDF, photo, capture d'écran, etc.). C'est ce qui permet de rendre exploitables des contenus qui n'existent pas nativement sous forme de texte numérique : archives papier scannées, formulaires, factures, courriers reçus par mail sous forme d'image... Une fois le texte extrait, vous pouvez le rechercher, l'indexer, l'analyser ou l'envoyer à un LLM.

Les deux façons de faire de l'OCR avec Albert API

Albert API propose deux façons de faire de l'OCR :

  1. /v1/chat/completions avec un LLM multimodal fine-tuné pour l'OCR, comme openweight-ocr : le modèle "lit" l'image envoyée dans le message et retourne le texte extrait (éventuellement accompagné d'un raisonnement).

  2. /v1/ocr avec mistral-ocr-2512 : cet endpoint reproduit l'endpoint /v1/ocr de l'API SaaS de Mistral AI et donne accès à la pipeline complète d'OCR de Mistral AI, que nous hébergeons nous-mêmes.

Quelle méthode choisir ?

Par défaut, utilisez /v1/chat/completions avec openweight-ocr : c'est le modèle que nous mettons à disposition de tous les utilisateurs, aussi bien pour extraire du texte que pour combiner cette extraction avec du raisonnement (résumé, question-réponse, extraction de champs précis...) en une seule requête.

Si vous avez accès à mistral-ocr-2512 et que vous avez besoin de la pipeline d'OCR complète de Mistral AI (extraction fidèle et structurée du texte d'un document entier, annotations, etc.), utilisez /v1/ocr, notamment pour l'intégrer ensuite dans un pipeline de RAG.

Pour connaître les modèles compatibles avec ces endpoints, voir notre documentation dédiées aux modèles disponibles.

Méthode 1 (par défaut) : OCR avec l'endpoint /v1/chat/completions

Cette méthode s'appuie sur un LLM multimodal capable d'analyser des images (voir la section Multimodal du guide Chat Completions). Albert API propose openweight-ocr, un modèle multimodal fine-tuné spécifiquement pour l'OCR, disponible pour tous les utilisateurs par défaut.

Cette méthode est adaptée si vous voulez, en une seule requête, extraire le texte d'un document et, si besoin, en tirer une information (résumé, réponse à une question, etc.).

Exemple de requête :

OCR d'un PDF

Si votre document est un PDF, convertissez d'abord chaque page à traiter en image avant de l'envoyer à /v1/chat/completions. En Python, vous pouvez utiliser pypdfium2 :

Conseils :

  • Rendez vos PDF à 200 DPI, avec une dimension la plus longue ciblée autour de 1540px.

  • Conservez le ratio d'aspect de la page d'origine pour ne pas déformer la géométrie du texte.

Méthode 2 (accès restreint) : OCR avec l'endpoint /v1/ocr

L'endpoint POST /v1/ocr reproduit l'endpoint /v1/ocr de l'API SaaS de Mistral AI et donne accès à la pipeline complète d'OCR de Mistral AI, hébergée par nos soins (offre Mistral Entreprise on-premise). Il prend en entrée un document ou une image référencé(e) dans le corps de la requête JSON et retourne, pour chaque page, le texte extrait (au format markdown) ainsi que, selon la configuration, des annotations.

Pour le détail complet des clés et schémas, voir la page de l'endpoint OCR.

Modèle disponible

Le seul modèle disponible sur cet endpoint est mistral-ocr-2512, de type image-to-text (voir le guide Types de modèles). Vous pouvez vérifier votre accès en récupérant la liste des modèles disponibles sur votre instance avec GET /v1/models (voir le guide Modèles (liste)).

Paramètres principaux

  • model (requis) — mistral-ocr-2512.

  • document (requis) — objet décrivant la source à traiter :

    • {"type": "document_url", "document_url": "https://..."} pour un PDF/document (URL classique ou data URL data:application/pdf;base64,...) ;

    • {"type": "image_url", "image_url": "https://..."} pour une image (URL classique ou data URL data:image/...;base64,...).

  • pages — liste d'indices de pages à traiter.

  • include_image_base64 — inclut les images des pages en base64 dans la réponse (utile pour archiver ou afficher les pages traitées).

  • document_annotation_format / bbox_annotation_format — format de sortie des annotations (texte libre, JSON, JSON Schema), sur le même principe que le response_format de /v1/chat/completions.

Exemple de requête : OCR d'un PDF référencé par URL

Variante : OCR d'un PDF encodé en base64 (data URL)

Cette variante est utile lorsque le document n'est pas accessible par une URL publique (fichier local, par exemple).

Exemple de requête : OCR d'une image référencée par URL

Last updated

Was this helpful?