Gérer les pipelines
Ce document explique comment gérer les pipelines BigQuery, y compris comment les afficher, les planifier, les déployer et les supprimer.
Ce document explique également comment afficher et gérer les métadonnées de pipeline dans Knowledge Catalog.
Les pipelines sont alimentés par Dataform. Vous pouvez organiser et gérer les pipelines stockés dans Fichiers et dossiers (dossiers utilisateur et dossiers d'équipe) ou dans les dépôts Git BigQuery Studio (dossiers Git) (aperçu).
Avant de commencer
- Créez un pipeline BigQuery.
- Pour gérer les métadonnées de pipeline dans Knowledge Catalog, assurez-vous que l'API Dataplex est activée dans votre projet Google Cloud .
Rôles requis
Pour obtenir les autorisations nécessaires pour gérer les pipelines, demandez à votre administrateur de vous accorder les rôles IAM suivants :
-
Pour afficher et exécuter des pipelines :
- Lecteur Dataform (
roles/dataform.Viewer) sur le projet - Utilisateur de job BigQuery (
roles/bigquery.jobUser) sur le projet
- Lecteur Dataform (
-
Pour exécuter des pipelines avec des identifiants utilisateur pour un compte Google :
Éditeur de données BigQuery (
roles/bigquery.dataEditor) sur le projet ou sur des ensembles de données BigQuery spécifiques -
Pour supprimer des pipelines :
Administrateur Dataform (
roles/dataform.Admin) sur le pipeline -
Pour gérer les pipelines dans les dossiers utilisateur :
- Propriétaire de code (
roles/dataform.codeOwner) sur le dossier - Éditeur de code (
roles/dataform.codeEditor) sur le dossier - Lecteur de code (
roles/dataform.codeViewer) sur le dossier
- Propriétaire de code (
-
Pour gérer les pipelines dans les dossiers d'équipe :
- Propriétaire du dossier d'équipe (
roles/dataform.teamFolderOwner) sur le dossier d'équipe - Contributeur de dossier d'équipe (
roles/dataform.teamFolderContributor) sur le dossier d'équipe - Lecteur de dossier d'équipe (
roles/dataform.teamFolderViewer) sur le dossier d'équipe
- Propriétaire du dossier d'équipe (
-
Pour gérer les pipelines dans les dépôts Git :
Utilisateur OAuth Developer Connect (
roles/developerconnect.oauthUser) sur le projet -
Pour afficher et gérer les métadonnées dans Knowledge Catalog :
Éditeur de catalogue Dataplex (
roles/dataplex.catalogEditor) sur le projet ou le groupe d'entrées@bigquery
Pour en savoir plus sur l'attribution de rôles, consultez Gérer l'accès aux projets, aux dossiers et aux organisations.
Vous pouvez également obtenir les autorisations requises avec des rôles personnalisés ou d'autres rôles prédéfinis.
Pour en savoir plus sur IAM pour Dataform, consultez Contrôler les accès avec IAM. Pour en savoir plus sur les rôles pour les dossiers, consultez Créer et gérer des dossiers. Pour en savoir plus sur les rôles pour les dépôts Git, consultez Gérer le code avec les dépôts Git BigQuery Studio.
Si vous utilisez un compte de service personnalisé pour exécuter des pipelines, vous devez lui attribuer les rôles suivants :
- Utilisateur de job BigQuery (
roles/bigquery.jobUser) sur le projet - Éditeur de données BigQuery
(
roles/bigquery.dataEditor) sur le projet ou sur des ensembles de données BigQuery spécifiques - Éditeur de catalogue Dataplex (
roles/dataplex.catalogEditor) sur le projet ou le groupe d'entrées@bigquery
Afficher les pipelines
Vous pouvez afficher et inspecter les pipelines stockés dans des dossiers ou des dossiers Git dans le volet Fichiers. Vous pouvez afficher les pipelines autonomes et ceux stockés dans des dossiers dans le volet Explorateur. Les pipelines stockés dans des dossiers Git ne s'affichent pas dans le volet Explorateur.
Afficher les pipelines dans le volet "Fichiers"
Les pipelines stockés dans des dossiers ou des dossiers Git s'affichent directement dans le volet Fichiers.
Pour afficher un pipeline stocké dans un dossier ou un dossier Git, procédez comme suit :
Dans la console Google Cloud , accédez à la page BigQuery.
Dans le volet de gauche, cliquez sur Fichiers pour ouvrir l'explorateur de fichiers.
Si le volet de gauche ne s'affiche pas, cliquez sur Développer le volet de gauche pour l'ouvrir.
Développez votre dossier Utilisateur, un dossier d'équipe ou un dossier de dépôt Git associé.
Les pipelines sont affichés avec une icône Pipeline au lieu d'une icône de dossier standard.
Cliquez sur un dossier de pipeline pour ouvrir le lecteur de pipeline.
Le Pipeline Viewer affiche le graphe orienté acyclique (DAG) compilé des tâches de votre pipeline, l'état d'exécution et les onglets de configuration.
Développez le répertoire du pipeline dans l'explorateur de fichiers pour parcourir les répertoires imbriqués (tels que
definitions/) et les fichiers de tâches individuels.
Afficher les pipelines dans le volet "Explorateur"
Pour afficher la liste des pipelines autonomes et des pipelines stockés dans des dossiers, procédez comme suit :
Dans la console Google Cloud , accédez à la page BigQuery.
Dans le volet de gauche, cliquez sur Explorateur :

Si le volet de gauche ne s'affiche pas, cliquez sur Développer le volet de gauche pour l'ouvrir.
Dans le volet Explorateur, développez votre projet et cliquez sur Pipelines.
Sélectionnez un pipeline pour l'ouvrir dans le Pipeline Viewer.
Afficher les exécutions manuelles passées
Pour afficher les exécutions manuelles précédentes d'un pipeline sélectionné, procédez comme suit :
Dans la console Google Cloud , accédez à la page BigQuery.
Dans le volet de gauche, cliquez sur Explorateur :

Dans le volet Explorateur, développez votre projet, cliquez sur Pipelines, puis sélectionnez un pipeline.
Cliquez sur Exécutions.
Facultatif : Pour actualiser la liste des exécutions précédentes, cliquez sur Actualiser.
Configurer des alertes pour les exécutions de pipeline ayant échoué
Chaque pipeline possède un ID de dépôt Dataform correspondant. Chaque exécution de pipeline BigQuery est consignée dans Cloud Logging à l'aide de l'ID de dépôt Dataform correspondant. Vous pouvez utiliser Cloud Monitoring pour observer les tendances dans les journaux Cloud Logging pour les exécutions de pipelines BigQuery et pour vous avertir lorsque les conditions que vous décrivez se produisent.
Pour recevoir des alertes en cas d'échec d'une exécution de pipeline BigQuery, vous pouvez créer une règle d'alerte basée sur les journaux pour l'ID de dépôt Dataform correspondant. Pour obtenir des instructions, consultez Configurer des alertes pour les appels de workflow ayant échoué.
Pour trouver l'ID du dépôt Dataform de votre pipeline, procédez comme suit :
Dans la console Google Cloud , accédez à la page BigQuery.
Dans le volet de gauche, cliquez sur Explorateur :

Dans le volet Explorateur, développez votre projet, cliquez sur Pipelines, puis sélectionnez un pipeline.
Cliquez sur Paramètres.
L'ID du dépôt Dataform de votre pipeline s'affiche en bas de l'onglet Paramètres.
Supprimer un pipeline
Pour supprimer définitivement un pipeline, procédez comme suit :
- Dans la console Google Cloud , accédez à la page BigQuery. Accéder à BigQuery
Pour supprimer un pipeline stocké dans un dossier ou un dossier Git :
Dans le volet de gauche, cliquez sur Fichiers.
Dans l'arborescence des fichiers, recherchez le dossier de pipeline que vous souhaitez supprimer.
Cliquez sur Afficher les actions à côté du dossier de pipeline, puis sur Supprimer.
Dans la boîte de dialogue de confirmation, cliquez sur Supprimer.
Le dossier du pipeline, ainsi que toutes les tâches et tous les fichiers qu'il contient, sont supprimés de votre espace de travail.
Pour supprimer un pipeline listé dans le volet Explorateur, procédez comme suit :
Dans le volet de gauche, cliquez sur Explorateur :

Dans le volet Explorateur, développez votre projet et cliquez sur Pipelines.
Recherchez le pipeline que vous souhaitez supprimer.
Cliquez sur Afficher les actions à côté du pipeline, puis sur Supprimer.
Cliquez sur Supprimer.
Gérer les métadonnées dans Knowledge Catalog
Knowledge Catalog vous permet de stocker et de gérer les métadonnées des pipelines. Les pipelines sont disponibles dans Knowledge Catalog par défaut, sans configuration supplémentaire.
Vous pouvez utiliser Knowledge Catalog pour gérer les pipelines dans tous les emplacements de pipeline. La gestion des pipelines dans Knowledge Catalog est soumise aux quotas et limites de Knowledge Catalog et aux tarifs de Knowledge Catalog.
Knowledge Catalog récupère automatiquement les métadonnées suivantes à partir des pipelines :
- Nom de l'élément de données
- Parent de l'élément de données
- Emplacement des composants de données
- Type d'élément de données
- Projet Google Cloud correspondant
Knowledge Catalog enregistre les pipelines en tant qu'entrées avec les valeurs d'entrée suivantes :
- Groupe d'entrées système
- Le groupe d'entrées système pour les pipelines est
@dataform. Pour afficher les détails des entrées de pipeline dans Knowledge Catalog, vous devez afficher le groupe d'entrées systèmedataform. Pour savoir comment afficher la liste de toutes les entrées d'un groupe d'entrées, consultez Afficher les détails d'un groupe d'entrées dans la documentation Knowledge Catalog. - Type d'entrée système
- Le type d'entrée système pour les pipelines est
dataform-code-asset. Pour afficher les détails des pipelines, vous devez afficher le type d'entrée systèmedataform-code-asset, filtrer les résultats avec un filtre basé sur les aspects et définir le champtypedans l'aspectdataform-code-assetsurWORKFLOW. Sélectionnez ensuite une entrée du pipeline sélectionné. Pour savoir comment afficher les détails d'un type d'entrée sélectionné, consultez Afficher les détails d'un type d'entrée dans la documentation Knowledge Catalog. Pour savoir comment afficher les détails d'une entrée sélectionnée, consultez Afficher les détails d'une entrée dans la documentation Knowledge Catalog. - Type d'aspect système
- Le type d'aspect système pour les pipelines est
dataform-code-asset. Pour fournir un contexte supplémentaire aux pipelines dans Knowledge Catalog en annotant les entrées de pipeline de données avec des aspects, affichez le type d'aspectdataform-code-asset, filtrez les résultats avec un filtre basé sur les aspects et définissez le champtypedans l'aspectdataform-code-assetsurWORKFLOW. Pour savoir comment annoter des entrées avec des aspects, consultez Gérer les aspects et enrichir les métadonnées dans la documentation Knowledge Catalog. - Type
- Le type de canevas de données est
WORKFLOW. Ce type vous permet de filtrer les pipelines dans le type d'entrée systèmedataform-code-assetet le type d'aspectdataform-code-assetà l'aide de la requêteaspect:dataplex-types.global.dataform-code-asset.type=WORKFLOWdans un filtre basé sur les aspects.
Pour savoir comment rechercher des éléments dans Knowledge Catalog, consultez Rechercher des éléments de données dans Knowledge Catalog dans la documentation Knowledge Catalog.
Enrichissement des métadonnées et intégration de la fiche d'évaluation de la qualité des données
Dataform peut publier les métadonnées suivantes dans Knowledge Catalog :
- Type d'aspect "Vue d'ensemble"
- Type d'aspect générique
- Type d'aspect de la fiche d'évaluation sur la qualité des données
Les assertions Dataform sont automatiquement intégrées au tableau de bord de la qualité des données Knowledge Catalog. Lors de l'exécution du pipeline, les résultats de toutes les assertions Dataform sont automatiquement publiés dans Knowledge Catalog. Ces résultats alimentent le tableau de bord sur la qualité des données de Knowledge Catalog avec un état de réussite ou d'échec.
Pour vérifier l'état d'une mise à jour des métadonnées, suivez les instructions de la section Afficher les exécutions manuelles précédentes.
Une fois les métadonnées synchronisées, vous pouvez rechercher et afficher l'entrée dans Knowledge Catalog. Pour en savoir plus, consultez Rechercher des ressources.
Étapes suivantes
- En savoir plus sur les pipelines BigQuery
- Découvrez comment créer des pipelines.
- Découvrez comment planifier des pipelines.
- Découvrez comment gérer le code avec les dépôts Git BigQuery Studio.
- Découvrez comment organiser les composants de code avec des dossiers.
- En savoir plus sur les déploiements Dataform