Metadaten in Knowledge Catalog

Mit Knowledge Catalog (ehemals Dataplex Universal Catalog) können Sie technische Strukturen, Geschäftskontext, Messwerte zur Datenqualität und betriebliche Beziehungen in Ihrer verteilten Datenumgebung automatisch ermitteln und indexieren. Knowledge Catalog organisiert diese Metadaten in einem flexiblen, erweiterbaren Metamodell und einem aktiven Kontextgraphen, mit dem Sie Daten-Assets verwalten und generative KI-Agents fundieren können.

Knowledge Catalog-Metamodell

Das Knowledge Catalog-Metamodell bietet eine einheitliche, strukturierte Metadatenverwaltung und bildet die strukturelle Grundlage des Active Context Graph in der Agentische Daten-Cloud von Google. Mit diesem Kontextdiagramm können Sie und Ihre Datenteams Assets erkennen und verwalten. Außerdem können generative KI-Agenten fundierten, vertrauenswürdigen Geschäftskontext abrufen.

In Knowledge Catalog werden Metadaten in einer modularen Hierarchie von Containern, Assets, Schemas und Beziehungen organisiert:

  • Container und Assets: In Eintragssammlungen werden Einträge organisiert, die einzelne Daten-Assets und ihre Schemaspalten darstellen.
  • Strukturierte Anreicherung: Mit Aspekttypen werden Schemas für Aspekte definiert, mit denen Einträgen, Spalten oder Beziehungen strukturierte Metadaten zugewiesen werden.
  • Standards und Governance: Mit Eintragstypen werden Vorlagen definiert, die erforderliche Aspekte für Einträge erzwingen.
  • Beziehungen: Mit den Linktypen für Einträge werden Beziehungen (Eintragslinks) definiert, die verknüpfte Einträge und Geschäftsbegriffe verbinden.

In der folgenden Tabelle wird der Unterschied zwischen systemverwalteten Ressourcen (automatisch von Google Cloudbereitgestellt) und benutzerdefinierten Ressourcen zusammengefasst:

Metamodellelement Vom System verwaltet (integriert) Benutzerdefiniert
Eintragsgruppen Vordefiniert pro Projekt für Google Cloud -Dienste (z. B. @bigquery, @spanner, @pubsub). Von Nutzern erstellte Gruppen zum Gruppieren und Verwalten von benutzerdefinierten Daten-Assets und Berechtigungen.
Einträge Wird automatisch aus Google Cloud -Quellen (z. B. BigQuery-Tabellen, -Ansichten, -Datasets und -Modellen) ausgefüllt. Von Nutzern erstellte Datenquellen, Dateien oder Drittanbieterdatenbanken.
Aspekttypen Vordefinierte Systemvorlagen (z. B. Schema, Overview, Contacts, DataQuality, Lineage). Von Nutzern erstellt, um domainspezifische Metadatenschemas zu definieren (z. B. PII-Klassifizierung oder SLA-Stufen).
Aspekte Wird automatisch aus Quellsystemen, Abfragelogs oder automatischen Scans generiert. Von Nutzern, Pipelines oder KI-Agenten erstellt und an Einträge, Spalten oder Eintragslinks angehängt.
Eintragstypen Vordefinierte Vorlagen, die Google Cloud Ressourcentypen darstellen. Von Nutzern definiert, um obligatorische und optionale Aspekte für benutzerdefinierte Daten-Assets anzugeben.
Eintrag-Links Integrierte Beziehungstypen wie synonym, definition, schema-join und related. Instanzen, die zwischen bestimmten Einträgen oder Spalten erstellt werden, um systemübergreifende Verbindungen zu modellieren.

In den folgenden Abschnitten werden die primären Komponenten des Knowledge Catalog-Metamodells beschrieben.

Eintragsgruppen

Eine Eintragsgruppe (EntryGroup) ist ein regionaler Container für Einträge und Eintragslinks, der als Verwaltungs- und Sicherheitsgrenze für die Verwaltung dieser Ressourcen dient.

Mit Eintragssammlungen können Sie Folgendes konfigurieren:

  • Zugriffssteuerung mit Identity and Access Management: Sie können bestimmten Teams Berechtigungen zum Ansehen oder Bearbeiten für eine Eintragsgruppe erteilen, ohne die Berechtigungen für einzelne Einträge zu ändern.
  • Standort und Projektzuordnung: Gruppieren Sie Assets nach geografischer Region und Projekteigentum.

Für Google Cloud Quellen werden in Knowledge Catalog automatisch Systemeintragsgruppen pro Projekt erstellt, z. B. @bigquery oder @spanner. Für benutzerdefinierte Datenquellen erstellen Sie benutzerdefinierte Eintragsgruppen.

Ein Finanzteam kann beispielsweise eine benutzerdefinierte Eintragsgruppe mit dem Namen production_finance_data erstellen, um die Zugriffsberechtigungen für alle finanzbezogenen benutzerdefinierten Einträge an einem zentralen Ort zu verwalten.

Eintragsgruppen mit Einträgen und Eintragslinks, die Einträge miteinander verbinden. Eintragsgruppen mit Einträgen und Eintragslinks, die Einträge miteinander verbinden.
Abbildung 1. Eintragsgruppen, Einträge und Eintragslinks (zum Vergrößern klicken).

Weitere Informationen finden Sie unter Eintragsgruppen.

Einträge und Schemapfade

Ein Eintrag (Entry) stellt ein einzelnes Daten-Asset dar. Ein Eintrag kann eine strukturierte Datenbanktabelle, ein Analysemodell, eine unstrukturierte Objekttabelle oder ein benutzerdefiniertes externes Dataset darstellen.

Zu den wichtigsten Komponenten eines Eintrags gehören:

  • Eintrags-ID: Ein eindeutiger Ressourcenname innerhalb der übergeordneten Eintragssammlung.
  • Eintragstyp: Die Vorlage, die die Struktur und die erforderlichen Aspekte des Eintrags definiert.
  • Aspekte: Strukturierte Metadatenattribute, die an den Eintrag angehängt sind.
  • Schemapfade (Spalten): Bestimmte Unterabschnitte oder Felder innerhalb des Daten-Assets, z. B. eine Spalte in einer BigQuery-Tabelle oder ein Feld in einem JSON-Schema.

Mit Spalten können Sie Metadaten an einzelne Felder in einem Asset anhängen. Sie müssen Spalten nicht manuell definieren. Sie werden ausgefüllt, wenn Sie einem Eintrag einen Aspekt vom Typ schema hinzufügen. Sie können mit Punktnotationspfaden auf verschachtelte Felder verweisen, z. B. customer.address.postal_code.

Eine BigQuery-Tabelle mit dem Namen orders_project.sales.customer_orders wird beispielsweise als Eintrag dargestellt. Wenn Sie das Feld email_address in dieser Tabelle als sensibel kennzeichnen möchten, hängen Sie ein Klassifizierungsattribut direkt an den Spaltenpfad email_address an.

Weitere Informationen finden Sie unter Einträge.

Aspekttypen

Ein Aspekttyp (AspectType) ist eine wiederverwendbare Schemavorlage, die die Felder, Datentypen und Validierungsregeln für einen Aspekt definiert. Jeder Aspekt ist eine Instanz eines Aspekttyps.

Aspekttypen können systemdefiniert (von Google Cloudbereitgestellt) oder benutzerdefiniert (von Ihrer Organisation erstellt) sein.

Wenn Sie die metadata_template für einen benutzerdefinierten Aspekttyp definieren, können Sie die folgenden unterstützten Datentypen verwenden:

Datentyp des Felds Beschreibung Anwendungsbeispiel
string Textwert (UTF-8). E‑Mail-Adresse des Inhabers, Label für die Datenklassifizierung, Name der Abteilung.
integer/number Numerische Werte (Ganzzahlen oder Gleitkommazahlen). Tage der Datenaufbewahrung, SLA-Zielprozentsatz, Prioritätsrang.
boolean Richtig oder falsch. contains_pii: true, is_certified: false.
enum Eine vordefinierte Liste zulässiger Stringwerte. Umgebung: ["DEV", "STAGING", "PROD"].
datetime/timestamp Datum und Uhrzeit im ISO 8601-Format. Datum der letzten Zertifizierung, Frist für die Compliance-Überprüfung.
record Ein verschachteltes strukturiertes Objekt mit untergeordneten Feldern. ContactInfo { name: string, email: string, phone: string }.
array Eine Liste mit wiederholten Werten eines beliebigen primitiven Typs oder Datensatztyps. Liste der sekundären Dateninhaber: ["user1@example.com", "user2@example.com"].
map Schlüssel/Wert-String-Paare für erweiterbare Attribute. Benutzerdefinierte Bereitstellungs-Tags: {"cost_center": "1042", "tier": "gold"}.

Wenn Sie beispielsweise eine wiederverwendbare Vorlage für Kontaktinformationen definieren möchten, können Sie einen Aspekttyp mit dem Namen ContactInfo mit Feldern für owner_name (string), email (string) und support_channel (string) erstellen.

Aspekttypen, die Aspekte definieren, die an Einträge angehängt sind, und Eintragstypen, für die Aspekttypen erforderlich sind. Aspekttypen, die Aspekte definieren, die an Einträge angehängt sind, und Eintragstypen, für die Aspekttypen erforderlich sind.
Abbildung 2. Aspekttypen, Aspekte und Eintragstypen (zum Vergrößern klicken).

Weitere Informationen finden Sie unter Aspekttypen.

Aspekte

Ein Aspekt (Aspect) ist eine Gruppe von zugehörigen Metadatenfeldern, die einem Aspekttyp entsprechen. Aspekte werden an einen Eintrag, einen Eintragspfad (Spalte) oder einen Eintragslink angehängt, um die Ressource zu beschreiben.

Im Gegensatz zu älteren Tagging-Systemen sind Aspekte im Knowledge Catalog direkt in ihren übergeordneten Einträgen oder Eintragslinks enthalten. So können Sie atomare Lese- und Schreibvorgänge ausführen.

Aspekte werden für mehrere Funktionen verwendet:

  • Technische Struktur: Der Aspekt Schema beschreibt Tabellenspalten, Datentypen und Beschreibungen.
  • Geschäftskontext: Benutzerdefinierte Aspekte beschreiben Inhaberschaft, Compliance und Lebenszyklusstatus.
  • Operatives Vertrauen: In den Aspekten der Datenqualität werden Ergebnisse automatisierter Regelscans und Validierungswerte erfasst.
  • Unstrukturierte Entitätsdiagramme: Der GraphProfile-Aspekt erfasst KI-extrahierte Entitäten und Beziehungsränder aus Rohdateien.

Sie können beispielsweise eine Instanz des Aspekttyps ContactInfo mit den Werten {"owner_name": "Alex", "email": "alex@example.com"} erstellen und an den Eintrag customer_orders anhängen.

Weitere Informationen finden Sie unter Aspekte.

Eintragstypen

Ein Eintragstyp (EntryType) ist eine Governance-Vorlage zum Erstellen benutzerdefinierter Einträge. Sie erzwingt die Einhaltung von Metadaten-Qualitätsstandards, indem sie die erforderlichen Aspekttypen festlegt, die einem Eintrag dieses Typs zugewiesen werden müssen.

Wenn Sie einen Eintrag eines bestimmten Eintragstyps erstellen, prüft Knowledge Catalog, ob alle Aspekttypen, die im Eintragstyp als required markiert sind, vorhanden und gültig sind.

Sie können beispielsweise einen Eintragstyp mit dem Namen CertifiedDataProduct erstellen, der die Aspekttypen OwnerInfo und DataRetentionPolicy als erforderlich angibt. Jeder neue Eintrag, der mit diesem Eintragstyp erstellt wird, muss diese Aspekte enthalten, bevor Sie ihn speichern können.

Weitere Informationen finden Sie unter Eintragstypen.

Eintragslinks und Eintragslinktypen

Mit einem Eingabelink (EntryLink) wird eine semantische Beziehung zwischen zwei Dateneinträgen oder zwischen bestimmten Spalten innerhalb von Einträgen hergestellt. Jeder Eintragslink ist eine Instanz eines Eintragslinktyps (EntryLinkType).

Einstiegslinks können gerichtet oder nicht gerichtet sein:

  • Symmetrisch (nicht gerichtet): Beziehungen, bei denen beide Seiten gleichberechtigt sind (z. B. synonym, related oder schema-join).
  • Asymmetrisch (gerichtet): Beziehungen mit einer expliziten Quelle und einem expliziten Ziel (z. B. definition, mit der ein Begriff aus dem Unternehmensglossar mit einer Tabellenspalte verknüpft wird).

Sie können Aspekte auch direkt an Eintragslinks anhängen (außer an schema-join-Links). So können Sie die Beziehung selbst beschreiben, z. B. indem Sie Vertrauenswerte für den Join von Datensätzen, Transformationsregeln oder Zuordnungsanmerkungen angeben.

Knowledge Catalog unterstützt die folgenden integrierten Linktypen für Einträge:

  • synonym: Verbindet gleichwertige Geschäftskonzepte oder alternative Begriffe.
  • related: Verbindet lose gekoppelte Assets über Systeme hinweg.
  • definition: Verknüpft Definitionen des Unternehmensglossars mit physischen Spalten oder Einträgen.
  • schema-join: Verbindet Tabellen, die über übereinstimmende Fremdschlüssel oder Schemapfade verknüpft werden können.
Eintragslink mit verknüpften Einträgen, Aspekten und deren Typen. Eintragslink mit verknüpften Einträgen, Aspekten und deren Typen.
Abbildung 3. Eintragslink mit verknüpften Einträgen, Aspekten und deren Typen (zum Vergrößern klicken).

Weitere Informationen finden Sie in der EntryLinks-REST-Referenz.

Unternehmensglossare und ‑begriffe

Mit einem Unternehmensglossar können Sie eine formale Geschäftstaxonomie erstellen, indem Sie Glossare, Kategorien und Geschäftsbegriffe definieren.

Mit Einstiegslinks vom Typ definition oder synonym können Sie Geschäftsbegriffe direkt physischen Einträgen und Spaltenpfaden zuordnen. Wenn Nutzer oder KI-Agents den Katalog in natürlicher Sprache durchsuchen, löst die Suchmaschine diese geschäftlichen Begriffe auf, um die richtigen physischen Daten-Assets zu finden.

Weitere Informationen finden Sie unter Unternehmensglossare verwalten.

Unterstützte Google Cloud Quellen

Knowledge Catalog nimmt automatisch Metadaten aus den folgendenGoogle Cloud -Quellen auf. Bei einigen Diensten wie AlloyDB for PostgreSQL und Cloud SQL müssen Sie zuerst die Knowledge Catalog-Integration aktivieren, bevor Metadaten aufgenommen werden können:

  • Analyse und Lakehouse

    • BigQuery-Datasets, -Tabellen, -Ansichten, -Modelle, -Routinen, -Verbindungen, -verknüpfte Datasets und Diagramme (Vorschau)
    • Datenpools und Einträge in BigQuery Sharing (früher Analytics Hub)
    • Dataform-Repositories und Code-Assets
    • Dataproc Metastore-Dienste, -Datenbanken und -Tabellen
    • Iceberg-REST-Katalogtabellen (einschließlich Google Cloud Lakehouse-Laufzeitkatalog, IRC, Databricks Unity IRC, AWS Glue Data Catalog IRC und Snowflake Horizon IRC)

    • Apache Hive-Tabellen

    • SAP Business Data Cloud (BDC) Delta Lake-Tabellen

    • Apache Iceberg-Tabellen, die vom Lakehouse-Laufzeitkatalog verwaltet werden

  • KI und maschinelles Lernen

    • Vertex AI-Modelle, ‑Datasets, ‑Featuregruppen, ‑Featureansichten und ‑Onlinespeicherinstanzen
  • Business Intelligence

    • Looker (Google Cloud Core)-Instanzen, Dashboards, Dashboardelemente, Looks, LookML-Projekte, Modelle, Explores und Ansichten (Vorschau)
  • Datenbanken

    • Bigtable-Instanzen, ‑Cluster und ‑Tabellen (einschließlich Details zur Spaltenfamilie)
    • Spanner-Instanzen, ‑Datenbanken, ‑Tabellen und ‑Ansichten
  • Streaming und Messaging

    • Pub/Sub-Themen
  • Unstrukturierte Daten

  • Operative Datenbanken

Wenn Sie Metadaten aus einer Drittanbieterquelle in Knowledge Catalog importieren möchten, können Sie Knowledge Catalog-Connectors oder eine Pipeline für verwaltete Verbindungen verwenden. Weitere Informationen finden Sie unter Knowledge Catalog-Connectors und Übersicht über verwaltete Verbindungen.

Projekt- und Standorteinschränkungen

Katalogressourcen in Knowledge Catalog werden in bestimmten Google Cloud -Projekten und geografischen Standorten gespeichert. Es gelten die folgenden Einschränkungen für den Umfang:

Ressource Standortregel Projektregel
Einträge Der Standort des Eintrags muss mit dem Standort des zugehörigen EntryType übereinstimmen oder das EntryType muss global sein. Kann auf globale oder projektinterne Eintragstypen verweisen.
Aspekte von Einträgen Die AspectType des Aspekts muss am selben Ort wie der Eintrag gespeichert werden oder die AspectType muss global sein. Kann auf globale oder projektinterne Aspekttypen verweisen.
Eintrag-Links Der Speicherort des Eintragslinks muss mit seinem EntryLinkType übereinstimmen oder das EntryLinkType muss global sein. Sie können Einträge verknüpfen, die sich in verschiedenen Projekten innerhalb derselben Organisation befinden.
Eintragstypen Besteht aus Aspekttypen, die am selben Ort wie der Eintragstyp gespeichert sind, oder aus Aspekttypen, die global sind. Wenn ein Eintragstyp auf benutzerdefinierte Aspekttypen verweist, müssen sich die Aspekttypen im selben Projekt und am selben Standort befinden.

Feeds für Metadatenänderungen

Mit Knowledge Catalog können Metadatenänderungsereignisse mithilfe von Metadatenänderungsfeeds in Near-Realtime gestreamt werden.

Ein Feed für Metadatenänderungen veröffentlicht Benachrichtigungen über das Erstellen, Aktualisieren oder Löschen von Einträgen in einem von Ihnen konfigurierten Pub/Sub-Thema. Abonnentenclients können diese Ereignisse nutzen, um operative Workflows zu automatisieren, z. B. um Datenqualitätsbewertungen auszulösen, wenn sich ein Schema ändert, oder um nachgelagerte Governance-Dashboards zu aktualisieren.

Weitere Informationen finden Sie unter Feeds für Metadatenänderungen.

Preise

Knowledge Catalog verwendet die SKU für die Metadatenspeicherung, um das gespeicherte Metadatenvolumen in Rechnung zu stellen. Weitere Informationen finden Sie unter Preise für den Knowledge Catalog.

Für Folgendes fallen keine Gebühren an:

  • Erstellen und Verwalten von Catalog-Metamodellressourcen (Eintragstypen, Aspekttypen, Eintragsgruppen, Einträge und Eintragslinks).
  • Search API-Aufrufe und Suchanfragen, die in der Google Cloud Console ausgeführt werden.

Nächste Schritte

Kurzanleitung

Assets ermitteln und benutzerdefinierte Aspektmetadaten an eine BigQuery-Tabelle anhängen

Aufnahme

Eintragstypen definieren und benutzerdefinierte Metadaten aus externen Datenbanken und Pipelines aufnehmen

Governance

Erstellen Sie eine Geschäftstaxonomie und ordnen Sie Begriffe direkt physischen Tabellen und Spalten zu.

Discovery

Mit Suchprädikaten können Sie Ressourcen in Google Cloud und benutzerdefinierten Quellen finden.

KI-Kontext

LLM-kompatible Metadaten und aktiven Kontext abrufen, um generative KI-Agents zu fundieren.

Migration

Tag-Vorlagen, benutzerdefinierte Einträge und Workflows zu Knowledge Catalog migrieren