Les modèles Mistral AI sur Gemini Enterprise Agent Platform offrent des modèles sans serveur et entièrement gérés en tant qu'API. Pour utiliser un modèle Mistral AI sur Agent Platform, envoyez une requête directement au point de terminaison de l'API Agent Platform. Étant donné que les modèles Mistral AI utilisent une API gérée, il n'est pas nécessaire de provisionner ni de gérer l'infrastructure.
Vous pouvez diffuser vos réponses en flux continu pour réduire la perception de la latence côté utilisateur. Une réponse en flux continu utilise des événements envoyés par le serveur (SSE) pour diffuser la réponse de manière incrémentielle.
Les modèles Mistral AI vous sont facturés à l'utilisation (paiement à l'usage). Pour le paiement à l'usage, consultez les tarifs des modèles Mistral AI sur la page des tarifs de Gemini Enterprise Agent Platform.
Modèles Mistral AI disponibles
Les modèles suivants sont disponibles auprès de Mistral AI pour une utilisation dans Gemini Enterprise Agent Platform. Pour accéder à un modèle Mistral AI, accédez à sa fiche de modèle Model Garden.
Utiliser des modèles Mistral AI
Vous pouvez utiliser des commandes curl pour envoyer des requêtes au point de terminaison Gemini Enterprise Agent Platform à l'aide des noms de modèles suivants :
- Pour Mistral Medium 3, utilisez
mistral-medium-3. - Pour Mistral OCR (25.05), utilisez
mistral-ocr-2505. - Pour Mistral Small 3.1 (25.03), utilisez
mistral-small-2503. - Pour Codestral 2, utilisez
codestral-2.
Pour en savoir plus sur l'utilisation du SDK Mistral AI, consultez la documentation Mistral AI Gemini Enterprise Agent Platform.
Avant de commencer
Pour utiliser des modèles Mistral AI avec Gemini Enterprise Agent Platform, procédez comme suit. L'API Agent Platform (aiplatform.googleapis.com) doit être activée pour utiliser Gemini Enterprise Agent Platform. Si vous disposez déjà d'un projet pour lequel l'API Agent Platform est activée, vous pouvez utiliser ce projet au lieu d'en créer un.
- Connectez-vous à votre compte Google Cloud . Si vous débutez sur Google Cloud, créez un compte pour évaluer les performances de nos produits en conditions réelles. Les nouveaux clients bénéficient également de 300 $ de crédits sans frais pour exécuter, tester et déployer des charges de travail.
-
In the Google Cloud console, on the project selector page, select or create a Google Cloud project.
Roles required to select or create a project
- Select a project: Selecting a project doesn't require a specific IAM role—you can select any project that you've been granted a role on.
-
Create a project: To create a project, you need the Project Creator role
(
roles/resourcemanager.projectCreator), which contains theresourcemanager.projects.createpermission. Learn how to grant roles.
-
Verify that billing is enabled for your Google Cloud project.
Enable the Gemini Enterprise Agent Platform API, if it is not already enabled.
Roles required to enable APIs
To enable APIs, you need the
serviceusage.services.enablepermission. If you created the project, then you likely already have this permission through the Owner role (roles/owner). Otherwise, you can get this permission through the Service Usage Admin role (roles/serviceusage.serviceUsageAdmin). Learn how to grant roles.-
In the Google Cloud console, on the project selector page, select or create a Google Cloud project.
Roles required to select or create a project
- Select a project: Selecting a project doesn't require a specific IAM role—you can select any project that you've been granted a role on.
-
Create a project: To create a project, you need the Project Creator role
(
roles/resourcemanager.projectCreator), which contains theresourcemanager.projects.createpermission. Learn how to grant roles.
-
Verify that billing is enabled for your Google Cloud project.
Enable the Gemini Enterprise Agent Platform API, if it is not already enabled.
Roles required to enable APIs
To enable APIs, you need the
serviceusage.services.enablepermission. If you created the project, then you likely already have this permission through the Owner role (roles/owner). Otherwise, you can get this permission through the Service Usage Admin role (roles/serviceusage.serviceUsageAdmin). Learn how to grant roles.- Accédez à l'une des fiches de modèle Model Garden suivantes, puis cliquez sur Activer :
Effectuer un appel en flux continu à un modèle Mistral AI
L'exemple suivant effectue un appel en flux continu à un modèle Mistral AI.
REST
Une fois que vous avez configuré votre environnement, vous pouvez utiliser REST pour tester un prompt textuel. L'exemple suivant envoie une requête au point de terminaison du modèle de l'éditeur.
Avant d'utiliser les données de requête, effectuez les remplacements suivants :
- LOCATION : région compatible avec les modèles Mistral AI.
- MODEL : nom du modèle que vous souhaitez utiliser. Dans le corps de la requête, excluez le numéro de version du modèle
@. - ROLE : rôle associé à un message. Vous pouvez spécifier
userouassistant. Le premier message doit utiliser le rôleuser. Les modèles fonctionnent avec des toursuseretassistantalternés. Si le message final utilise le rôleassistant, le contenu de la réponse continue immédiatement à partir du contenu de ce message. Cela vous permet de limiter une partie de la réponse du modèle. - STREAM : valeur booléenne qui spécifie si la réponse est diffusée ou non. Diffusez votre réponse en flux continu pour réduire la perception de la latence que peuvent avoir les utilisateurs finaux. Définissez la valeur sur
truepour diffuser la réponse et surfalsepour la renvoyer en une fois. - CONTENT : contenu du message
userouassistant(du texte, par exemple). - MAX_OUTPUT_TOKENS : nombre maximal de jetons pouvant être générés dans la réponse. Un jeton correspond environ à 3,5 caractères. 100 jetons correspondent environ à 60-80 mots.
Spécifiez une valeur inférieure pour obtenir des réponses plus courtes et une valeur supérieure pour des réponses potentiellement plus longues.
Méthode HTTP et URL :
POST https://LOCATION-aiplatform.googleapis.com/v1/projects/PROJECT_ID/locations/LOCATION/publishers/mistralai/models/MODEL:streamRawPredict
Corps JSON de la requête :
{
"model": MODEL,
"messages": [
{
"role": "ROLE",
"content": "CONTENT"
}],
"max_tokens": MAX_TOKENS,
"stream": true
}
Pour envoyer votre requête, choisissez l'une des options suivantes :
curl
Enregistrez le corps de la requête dans un fichier nommé request.json, puis exécutez la commande suivante :
curl -X POST \
-H "Authorization: Bearer $(gcloud auth print-access-token)" \
-H "Content-Type: application/json; charset=utf-8" \
-d @request.json \
"https://LOCATION-aiplatform.googleapis.com/v1/projects/PROJECT_ID/locations/LOCATION/publishers/mistralai/models/MODEL:streamRawPredict"
PowerShell
Enregistrez le corps de la requête dans un fichier nommé request.json, puis exécutez la commande suivante :
$cred = gcloud auth print-access-token
$headers = @{ "Authorization" = "Bearer $cred" }
Invoke-WebRequest `
-Method POST `
-Headers $headers `
-ContentType: "application/json; charset=utf-8" `
-InFile request.json `
-Uri "https://LOCATION-aiplatform.googleapis.com/v1/projects/PROJECT_ID/locations/LOCATION/publishers/mistralai/models/MODEL:streamRawPredict" | Select-Object -Expand Content
Vous devriez recevoir une réponse JSON semblable à la suivante.
Effectuer un appel unaire à un modèle Mistral AI
L'exemple suivant effectue un appel unaire à un modèle Mistral AI.
REST
Une fois que vous avez configuré votre environnement, vous pouvez utiliser REST pour tester un prompt textuel. L'exemple suivant envoie une requête au point de terminaison du modèle de l'éditeur.
Avant d'utiliser les données de requête, effectuez les remplacements suivants :
- LOCATION : région compatible avec les modèles Mistral AI.
- MODEL : nom du modèle que vous souhaitez utiliser. Dans le corps de la requête, excluez le numéro de version du modèle
@. - ROLE : rôle associé à un message. Vous pouvez spécifier
userouassistant. Le premier message doit utiliser le rôleuser. Les modèles fonctionnent avec des toursuseretassistantalternés. Si le message final utilise le rôleassistant, le contenu de la réponse continue immédiatement à partir du contenu de ce message. Cela vous permet de limiter une partie de la réponse du modèle. - STREAM : valeur booléenne qui spécifie si la réponse est diffusée ou non. Diffusez votre réponse en flux continu pour réduire la perception de la latence que peuvent avoir les utilisateurs finaux. Définissez la valeur sur
truepour diffuser la réponse et surfalsepour la renvoyer en une fois. - CONTENT : contenu du message
userouassistant(du texte, par exemple). - MAX_OUTPUT_TOKENS : nombre maximal de jetons pouvant être générés dans la réponse. Un jeton correspond environ à 3,5 caractères. 100 jetons correspondent environ à 60-80 mots.
Spécifiez une valeur inférieure pour obtenir des réponses plus courtes et une valeur supérieure pour des réponses potentiellement plus longues.
Méthode HTTP et URL :
POST https://LOCATION-aiplatform.googleapis.com/v1/projects/PROJECT_ID/locations/LOCATION/publishers/mistralai/models/MODEL:rawPredict
Corps JSON de la requête :
{
"model": MODEL,
"messages": [
{
"role": "ROLE",
"content": "CONTENT"
}],
"max_tokens": MAX_TOKENS,
"stream": false
}
Pour envoyer votre requête, choisissez l'une des options suivantes :
curl
Enregistrez le corps de la requête dans un fichier nommé request.json, puis exécutez la commande suivante :
curl -X POST \
-H "Authorization: Bearer $(gcloud auth print-access-token)" \
-H "Content-Type: application/json; charset=utf-8" \
-d @request.json \
"https://LOCATION-aiplatform.googleapis.com/v1/projects/PROJECT_ID/locations/LOCATION/publishers/mistralai/models/MODEL:rawPredict"
PowerShell
Enregistrez le corps de la requête dans un fichier nommé request.json, puis exécutez la commande suivante :
$cred = gcloud auth print-access-token
$headers = @{ "Authorization" = "Bearer $cred" }
Invoke-WebRequest `
-Method POST `
-Headers $headers `
-ContentType: "application/json; charset=utf-8" `
-InFile request.json `
-Uri "https://LOCATION-aiplatform.googleapis.com/v1/projects/PROJECT_ID/locations/LOCATION/publishers/mistralai/models/MODEL:rawPredict" | Select-Object -Expand Content
Vous devriez recevoir une réponse JSON semblable à la suivante.
Disponibilité et quotas des régions d'un modèle Mistral AI
Pour les modèles Mistral AI, un quota s'applique à chaque région dans laquelle le modèle est disponible. Le quota est spécifié en requêtes par minute (RPM) et en jetons par minute (TPM). Le nombre de jetons par minute inclut à la fois les jetons d'entrée et de sortie.
| Modèle | Région | Quotas | Longueur du contexte |
|---|---|---|---|
| Mistral Medium 3 | |||
us-central1 |
|
128 000 | |
europe-west4 |
|
128 000 | |
| Mistral OCR (25.05) | |||
us-central1 |
|
30 pages | |
europe-west4 |
|
30 pages | |
| Mistral Small 3.1 (25.03) | |||
us-central1 |
|
128 000 | |
europe-west4 |
|
128 000 | |
| Codestral 2 | |||
us-central1 |
|
128 000 jetons | |
europe-west4 |
|
128 000 jetons |
Si vous souhaitez augmenter vos quotas pour Agent Platform, vous pouvez en faire la demande via la console Google Cloud . Pour en savoir plus sur les quotas, consultez la présentation de Cloud Quotas.