Modèles disponibles
Albert API offre l’accès à une large gamme de modèles fondation open source d’IA générative. Nous mettons à jour régulièrement les modèles disponibles pour vous permettre d’utiliser les modèles qui font l’état de l’art.
Chaque modèle est associé à un type de modèle. Pour en savoir plus sur les types de modèles, voir Types de modèles.
Les recommandations d'usage ci-dessous proviennent de l'expérience des utilisateurs et ne sont pas garanties. Nous vous recommandons de tester différents modèles et leurs paramètres pour trouver ceux qui s'adapteront le mieux à vos besoins.
Vos retours nous sont précieux pour améliorer les modèles et les recommandations d'usage. N'hésitez pas à nous les partager sur notre canal Tchap ou par mail (voir la page Contact).
bge-m3
bge-reranker-v2-m3
Modèle de reranking multilingue basé sur bge-m3. Il est le modèle de référence pour le reranking sur Albert API.
Nombre de paramètres
568M
Type
text-classification
Licence
MIT
Aliases
BAAI/bge-reranker-v2-m3, openweight-rerank
Fenêtre de contexte
8192
Maximum de texte par batch
64
La limite architecturale est de 8192 tokens, toutefois le modèle a été finetuné pour être utilisé avec des textes de longueur maximale de 1024 tokens. Nous recommandons de ne pas dépasser cette longueur lors de la construction des chunks pour le reranking.
Capacités
deepseek-v4-flash 
MoE spécialisé pour les tâches de code.
Ce modèle est en phase d'expérimentation du 26 juillet 2026 au 1er octobre 2026. Candidat au remplacement du modèle openweight-code à l'issue de cette période.
Ce modèle extra-européen peut présenter certaines formes de censure des réponses. Nous recommandons de l'utiliser uniquement pour les cas d'usage de génération de code et non comme un modèle conversationnel généraliste.
Cette phase d'expérimentation a notamment pour objectif d'évaluer l'impact de ces limitations afin de déterminer si elles sont compatibles avec une intégration pérenne dans Albert API. Vos retours sur ce sujet seront particulièrement précieux.
Model card Essayer dans Playground
Nombre de paramètres
284B
Nombre de paramètres actifs
13B
Licence
MIT
Type
text-generation
Aliases
deepseek-ai/DeepSeek-V4-Flash-0731
Fenêtre de contexte
393216
Température recommandée
1.0
Capacités
Comportement du function calling
Sans le streaming, modèle renvoie un tool call avec un content non vide. En streaming, les arguments sont fragmentés sur plusieurs chunks SSE, et le finish_reason: "tool_calls" arrive dans un chunk distinct qui ne contient plus de tool_calls.
lightonocr-2-1b
Modèle multimodal spécialisé pour l'OCR. Il est le modèle de référence pour l'OCR sur Albert API.
Model card Essayer dans Playground
Nombre de paramètres
1B
Licence
Apache 2.0
Type
image-text-to-text
Aliases
lighton/LightOn-OCR-2-1B, openweight-ocr
Fenêtre de contexte
16384
Nous observons certaines latences lorsque certains patterns de pixels sont présents dans l'image (un QR code par exemple). Si vous observez des latences élevées, essayez de supprimer ces patterns avant d'envoyer l'image au modèle.
Capacités
ministral-3-8b-instruct-2512
Modèle multimodal généraliste de petite taille, idéal pour des tâches simples comme de la classification ou de correction de texte.
Model card Essayer dans Playground
Nombre de paramètres
8.9B
Type
text-generation
Licence
Apache 2.0
Aliases
mistralai/Ministral-3-8B-Instruct-2512, openweight-small
Format d'entrées
text, image
Fenêtre de contexte
262144
Température recommandée
0.1
Capacités
Comportement du function calling
Sans le streaming, modèle renvoie un tool call avec un content vide. En streaming, les arguments sont fragmentés sur plusieurs chunks SSE, et le finish_reason: "tool_calls" arrive dans un chunk distinct qui ne contient plus de tool_calls.
mistral-small-3-2-24b-instruct-2506
Model card Essayer dans Playground
Nombre de paramètres
24B
Type
text-generation
Licence
Apache 2.0
Aliases
mistralai/Mistral-Small-3.2-24B-Instruct-2506, openweight-medium
Format d'entrées
text, image
Fenêtre de contexte
131072
Température recommandée
0.15
Capacités
Comportement du function calling
Sans le streaming, modèle renvoie un tool call avec un content vide. En streaming, les arguments sont fragmentés sur plusieurs chunks SSE, et le finish_reason: "tool_calls" arrive dans un chunk distinct qui ne contient plus de tool_calls.
mistral-medium-2508 
Ce modèle accessible uniquement aux ministères partenaires qui en font la demande. Pour en savoir plus, consultez la page Tarifs et limites de notre site.
Vous pouvez utiliser le modèle gpt-oss-120b comme alternative à ce modèle.
Nombre de paramètres
123B
Type
text-generation
Licence
propriétaire
Aliases
mistral-medium-2508
Format d'entrées
text, image
Fenêtre de contexte
131072
Capacités
Comportement du function calling
Sans le streaming, modèle renvoie un tool call avec un content vide. En streaming, quand le tool call est valide, le tool call arrive en un seul chunk qui porte aussi la finish_reason.
mistral-ocr-2512 
Modèle d'OCR compatible avec la pile Document AI de Mistral (/v1/ocr) permettant d’extraire du texte et des images entremêlés.
Ce modèle accessible uniquement aux ministères partenaires qui en font la demande. Pour en savoir plus, consultez la page Tarifs et limites de notre site.
Vous pouvez utiliser le modèle lightonocr-2-1b comme alternative à ce modèle.
Model card Essayer dans Playground
Nombre de paramètres
3B
Type
image-to-text
Licence
propriétaire
Aliases
mistral-ocr-2512
Fenêtre de contexte
16384
Capacités
gpt-oss-120b
MoE généraliste de grande taille pour des tâches de complexes.
Model card Essayer dans Playground
Nombre de paramètres
117B
Nombre de paramètres actifs
5.1B
Type
text-generation
Licence
Apache 2.0
Aliases
openai/gpt-oss-120b, openweight-large
Fenêtre de contexte
131072
Les tokens de raisonnement consomment le budget max_tokens : prévoyez une marge confortable même pour des réponses courtes (> 1024 tokens).
Capacités
Comportement du function calling
Sans le streaming, modèle renvoie un tool call avec un content vide. En streaming, les arguments sont fragmentés sur plusieurs chunks SSE, et le finish_reason: "tool_calls" arrive dans un chunk distinct qui ne contient plus de tool_calls.
whisper-large-v3
Model card Essayer dans Transcripts
Nombre de paramètres
1.55B
Type
automatic-speech-recognition
Licence
Apache 2.0
Aliases
openai/whisper-large-v3, openweight-audio
Fenêtre de contexte
Fichier audio jusqu'à 20 MB
Capacités
qwen3-vl-embedding-8b 
Embeddings multimodaux (texte, images, captures d’écran, vidéos).
Ce modèle est en phase d'expérimentation du 26 juillet 2026 au 1er octobre 2026. A l'issue de cette phase d'expérimentation nous évaluarons a l'aide de vos retours si le modèle est viable pour une intégration pérenne dans Albert API.
Nombre de paramètres
8B
Type
text-embeddings-inference
Licence
Apache 2.0
Aliases
Qwen/Qwen3-VL-Embedding-8B
Fenêtre de contexte
32768
Dimension maximale des vecteurs
4096*
*La dimension des vecteurs n'est pas modifiable avec ce modèle.
Ne mélangez pas les vecteurs générés par ce modèle avec un autre modèle d'embeddings : ils ne sont pas comparables.
Capacités
qwen3-coder-30b-a3b-instruct
Model card Essayer dans Playground
Nombre de paramètres
30.5B
Nombre de paramètres actifs
3.3B
Type
text-generation
Licence
Apache 2.0
Aliases
Qwen/Qwen3-Coder-30B-A3B-Instruct, openweight-code
Fenêtre de contexte
262144
MoE orienté code / agentic coding (function calling).
Capacités
Comportement du function calling
Sans le streaming, modèle renvoie un tool call avec un content non vide. En streaming, quand le tool call est valide, les arguments sont fragmentés sur plusieurs chunks SSE, et le finish_reason: "tool_calls" arrive dans un chunk distinct qui ne contient plus de tool_calls.
Last updated
Was this helpful?