Modèles Mistral AI

Les modèles Mistral AI sur Gemini Enterprise Agent Platform offrent des modèles sans serveur et entièrement gérés en tant qu'API. Pour utiliser un modèle Mistral AI sur Agent Platform, envoyez une requête directement au point de terminaison de l'API Agent Platform. Étant donné que les modèles Mistral AI utilisent une API gérée, il n'est pas nécessaire de provisionner ni de gérer l'infrastructure.

Vous pouvez diffuser vos réponses en flux continu pour réduire la perception de la latence côté utilisateur. Une réponse en flux continu utilise des événements envoyés par le serveur (SSE) pour diffuser la réponse de manière incrémentielle.

Les modèles Mistral AI vous sont facturés à l'utilisation (paiement à l'usage). Pour le paiement à l'usage, consultez les tarifs des modèles Mistral AI sur la page des tarifs de Gemini Enterprise Agent Platform.

Modèles Mistral AI disponibles

Les modèles suivants sont disponibles auprès de Mistral AI pour une utilisation dans Gemini Enterprise Agent Platform. Pour accéder à un modèle Mistral AI, accédez à sa fiche de modèle Model Garden.

Mistral Medium 3 Modèle multimodal polyvalent conçu pour le raisonnement avancé, la programmation, la compréhension de documents à contexte long, le haut débit à nœud unique et les workflows agentiques.
Mistral OCR (25.05) API de reconnaissance optique des caractères pour une compréhension riche des documents, l'extraction d'images, de tableaux, de graphiques et de la mise en forme LaTeX imbriqués pour les pipelines RAG multimodaux.
Mistral Small 3.1 (25.03) Modèle multimodal polyvalent à faible latence avec une fenêtre de contexte de 128 000 jetons, optimisé pour le chat, la programmation et le suivi d'instructions à haute efficacité.
Codestral 2 Modèle de génération de code spécialisé conçu pour la complétion fill-in-the-middle (FIM) de haute précision, la révision de code, le refactoring et les outils pour les développeurs.

Utiliser des modèles Mistral AI

Vous pouvez utiliser des commandes curl pour envoyer des requêtes au point de terminaison Gemini Enterprise Agent Platform à l'aide des noms de modèles suivants :

  • Pour Mistral Medium 3, utilisez mistral-medium-3.
  • Pour Mistral OCR (25.05), utilisez mistral-ocr-2505.
  • Pour Mistral Small 3.1 (25.03), utilisez mistral-small-2503.
  • Pour Codestral 2, utilisez codestral-2.

Pour en savoir plus sur l'utilisation du SDK Mistral AI, consultez la documentation Mistral AI Gemini Enterprise Agent Platform.

Avant de commencer

Pour utiliser des modèles Mistral AI avec Gemini Enterprise Agent Platform, procédez comme suit. L'API Agent Platform (aiplatform.googleapis.com) doit être activée pour utiliser Gemini Enterprise Agent Platform. Si vous disposez déjà d'un projet pour lequel l'API Agent Platform est activée, vous pouvez utiliser ce projet au lieu d'en créer un.

  1. Connectez-vous à votre compte Google Cloud . Si vous débutez sur Google Cloud, créez un compte pour évaluer les performances de nos produits en conditions réelles. Les nouveaux clients bénéficient également de 300 $ de crédits sans frais pour exécuter, tester et déployer des charges de travail.
  2. In the Google Cloud console, on the project selector page, select or create a Google Cloud project.

    Roles required to select or create a project

    • Select a project: Selecting a project doesn't require a specific IAM role—you can select any project that you've been granted a role on.
    • Create a project: To create a project, you need the Project Creator role (roles/resourcemanager.projectCreator), which contains the resourcemanager.projects.create permission. Learn how to grant roles.

    Go to project selector

  3. Verify that billing is enabled for your Google Cloud project.

  4. Enable the Gemini Enterprise Agent Platform API, if it is not already enabled.

    Roles required to enable APIs

    To enable APIs, you need the serviceusage.services.enable permission. If you created the project, then you likely already have this permission through the Owner role (roles/owner). Otherwise, you can get this permission through the Service Usage Admin role (roles/serviceusage.serviceUsageAdmin). Learn how to grant roles.

    Enable the API

  5. In the Google Cloud console, on the project selector page, select or create a Google Cloud project.

    Roles required to select or create a project

    • Select a project: Selecting a project doesn't require a specific IAM role—you can select any project that you've been granted a role on.
    • Create a project: To create a project, you need the Project Creator role (roles/resourcemanager.projectCreator), which contains the resourcemanager.projects.create permission. Learn how to grant roles.

    Go to project selector

  6. Verify that billing is enabled for your Google Cloud project.

  7. Enable the Gemini Enterprise Agent Platform API, if it is not already enabled.

    Roles required to enable APIs

    To enable APIs, you need the serviceusage.services.enable permission. If you created the project, then you likely already have this permission through the Owner role (roles/owner). Otherwise, you can get this permission through the Service Usage Admin role (roles/serviceusage.serviceUsageAdmin). Learn how to grant roles.

    Enable the API

  8. Accédez à l'une des fiches de modèle Model Garden suivantes, puis cliquez sur Activer :

Effectuer un appel en flux continu à un modèle Mistral AI

L'exemple suivant effectue un appel en flux continu à un modèle Mistral AI.

REST

Une fois que vous avez configuré votre environnement, vous pouvez utiliser REST pour tester un prompt textuel. L'exemple suivant envoie une requête au point de terminaison du modèle de l'éditeur.

Avant d'utiliser les données de requête, effectuez les remplacements suivants :

  • LOCATION : région compatible avec les modèles Mistral AI.
  • MODEL : nom du modèle que vous souhaitez utiliser. Dans le corps de la requête, excluez le numéro de version du modèle @.
  • ROLE : rôle associé à un message. Vous pouvez spécifier user ou assistant. Le premier message doit utiliser le rôle user. Les modèles fonctionnent avec des tours user et assistant alternés. Si le message final utilise le rôle assistant, le contenu de la réponse continue immédiatement à partir du contenu de ce message. Cela vous permet de limiter une partie de la réponse du modèle.
  • STREAM : valeur booléenne qui spécifie si la réponse est diffusée ou non. Diffusez votre réponse en flux continu pour réduire la perception de la latence que peuvent avoir les utilisateurs finaux. Définissez la valeur sur true pour diffuser la réponse et sur false pour la renvoyer en une fois.
  • CONTENT : contenu du message user ou assistant (du texte, par exemple).
  • MAX_OUTPUT_TOKENS : nombre maximal de jetons pouvant être générés dans la réponse. Un jeton correspond environ à 3,5 caractères. 100 jetons correspondent environ à 60-80 mots.

    Spécifiez une valeur inférieure pour obtenir des réponses plus courtes et une valeur supérieure pour des réponses potentiellement plus longues.

Méthode HTTP et URL :

POST https://LOCATION-aiplatform.googleapis.com/v1/projects/PROJECT_ID/locations/LOCATION/publishers/mistralai/models/MODEL:streamRawPredict

Corps JSON de la requête :

{
"model": MODEL,
  "messages": [
   {
    "role": "ROLE",
    "content": "CONTENT"
   }],
  "max_tokens": MAX_TOKENS,
  "stream": true
}

Pour envoyer votre requête, choisissez l'une des options suivantes :

curl

Enregistrez le corps de la requête dans un fichier nommé request.json, puis exécutez la commande suivante :

curl -X POST \
-H "Authorization: Bearer $(gcloud auth print-access-token)" \
-H "Content-Type: application/json; charset=utf-8" \
-d @request.json \
"https://LOCATION-aiplatform.googleapis.com/v1/projects/PROJECT_ID/locations/LOCATION/publishers/mistralai/models/MODEL:streamRawPredict"

PowerShell

Enregistrez le corps de la requête dans un fichier nommé request.json, puis exécutez la commande suivante :

$cred = gcloud auth print-access-token
$headers = @{ "Authorization" = "Bearer $cred" }

Invoke-WebRequest `
-Method POST `
-Headers $headers `
-ContentType: "application/json; charset=utf-8" `
-InFile request.json `
-Uri "https://LOCATION-aiplatform.googleapis.com/v1/projects/PROJECT_ID/locations/LOCATION/publishers/mistralai/models/MODEL:streamRawPredict" | Select-Object -Expand Content

Vous devriez recevoir une réponse JSON semblable à la suivante.

Effectuer un appel unaire à un modèle Mistral AI

L'exemple suivant effectue un appel unaire à un modèle Mistral AI.

REST

Une fois que vous avez configuré votre environnement, vous pouvez utiliser REST pour tester un prompt textuel. L'exemple suivant envoie une requête au point de terminaison du modèle de l'éditeur.

Avant d'utiliser les données de requête, effectuez les remplacements suivants :

  • LOCATION : région compatible avec les modèles Mistral AI.
  • MODEL : nom du modèle que vous souhaitez utiliser. Dans le corps de la requête, excluez le numéro de version du modèle @.
  • ROLE : rôle associé à un message. Vous pouvez spécifier user ou assistant. Le premier message doit utiliser le rôle user. Les modèles fonctionnent avec des tours user et assistant alternés. Si le message final utilise le rôle assistant, le contenu de la réponse continue immédiatement à partir du contenu de ce message. Cela vous permet de limiter une partie de la réponse du modèle.
  • STREAM : valeur booléenne qui spécifie si la réponse est diffusée ou non. Diffusez votre réponse en flux continu pour réduire la perception de la latence que peuvent avoir les utilisateurs finaux. Définissez la valeur sur true pour diffuser la réponse et sur false pour la renvoyer en une fois.
  • CONTENT : contenu du message user ou assistant (du texte, par exemple).
  • MAX_OUTPUT_TOKENS : nombre maximal de jetons pouvant être générés dans la réponse. Un jeton correspond environ à 3,5 caractères. 100 jetons correspondent environ à 60-80 mots.

    Spécifiez une valeur inférieure pour obtenir des réponses plus courtes et une valeur supérieure pour des réponses potentiellement plus longues.

Méthode HTTP et URL :

POST https://LOCATION-aiplatform.googleapis.com/v1/projects/PROJECT_ID/locations/LOCATION/publishers/mistralai/models/MODEL:rawPredict

Corps JSON de la requête :

{
"model": MODEL,
  "messages": [
   {
    "role": "ROLE",
    "content": "CONTENT"
   }],
  "max_tokens": MAX_TOKENS,
  "stream": false
}

Pour envoyer votre requête, choisissez l'une des options suivantes :

curl

Enregistrez le corps de la requête dans un fichier nommé request.json, puis exécutez la commande suivante :

curl -X POST \
-H "Authorization: Bearer $(gcloud auth print-access-token)" \
-H "Content-Type: application/json; charset=utf-8" \
-d @request.json \
"https://LOCATION-aiplatform.googleapis.com/v1/projects/PROJECT_ID/locations/LOCATION/publishers/mistralai/models/MODEL:rawPredict"

PowerShell

Enregistrez le corps de la requête dans un fichier nommé request.json, puis exécutez la commande suivante :

$cred = gcloud auth print-access-token
$headers = @{ "Authorization" = "Bearer $cred" }

Invoke-WebRequest `
-Method POST `
-Headers $headers `
-ContentType: "application/json; charset=utf-8" `
-InFile request.json `
-Uri "https://LOCATION-aiplatform.googleapis.com/v1/projects/PROJECT_ID/locations/LOCATION/publishers/mistralai/models/MODEL:rawPredict" | Select-Object -Expand Content

Vous devriez recevoir une réponse JSON semblable à la suivante.

Disponibilité et quotas des régions d'un modèle Mistral AI

Pour les modèles Mistral AI, un quota s'applique à chaque région dans laquelle le modèle est disponible. Le quota est spécifié en requêtes par minute (RPM) et en jetons par minute (TPM). Le nombre de jetons par minute inclut à la fois les jetons d'entrée et de sortie.

Modèle Région Quotas Longueur du contexte
Mistral Medium 3
us-central1
  • QPM : 90
  • TPM : 315 000
128 000
europe-west4
  • QPM : 90
  • TPM : 315 000
128 000
Mistral OCR (25.05)
us-central1
  • RPM : 30
  • Pages par requête : 30 (1 page = 1 million de jetons d'entrée et 1 million de jetons de sortie)
30 pages
europe-west4
  • RPM : 30
  • Pages par requête : 30 (1 page = 1 million de jetons d'entrée et 1 million de jetons de sortie)
30 pages
Mistral Small 3.1 (25.03)
us-central1
  • RPM : 60
  • TPM : 200 000
128 000
europe-west4
  • RPM : 60
  • TPM : 200 000
128 000
Codestral 2
us-central1
  • RPM : 1 100
  • TPM d'entrée : 1 100 000
  • TPM de sortie : 110 000
128 000 jetons
europe-west4
  • RPM : 1 100
  • TPM d'entrée : 1 100 000
  • TPM de sortie : 110 000
128 000 jetons

Si vous souhaitez augmenter vos quotas pour Agent Platform, vous pouvez en faire la demande via la console Google Cloud . Pour en savoir plus sur les quotas, consultez la présentation de Cloud Quotas.