Mit grenzenlosen Lakehouse-Daten in BigQuery interagieren

Borderless Lakehouse ist eine Speicher-Engine, die Google Cloud und Open-Source-Dienste vereint, um eine einheitliche Schnittstelle für erweiterte Analysen und KI zu schaffen. Es bietet die Grundlage für die Entwicklung eines offenen, verwalteten und leistungsstarken Lakehouse mit automatisierter Datenverwaltung und integrierter Governance mit Apache Iceberg.

Wenn Sie eine Tabelle in Lakehouse erstellen, kann sie automatisch über BigQuery abgefragt werden und ist auf der BigQuery-Seite der Google Cloud -Konsole sichtbar. Ihre Lakehouse-Namespaces und -Schemas werden automatisch BigQuery-Datasets zugeordnet. Außerdem können Sie Lakehouse-Kataloge, Namespaces und Tabellen direkt in BigQuery Studio erstellen und aktualisieren.

Unterschiede zwischen Lakehouse-Ressourcen und anderen BigQuery-Ressourcen

Im Folgenden sind die wichtigsten Unterschiede zwischen Lakehouse- und Standard-BigQuery-Ressourcen aufgeführt:

  • Lakehouse-Datasets werden auf der BigQuery-Seite der Google Cloud Console neben dem Wasser-Symbol angezeigt.
  • Lakehouse-Ressourcen haben zusätzliche Metadaten im jeweiligen Abschnitt Details.

Vergleich der Funktionen von Iceberg-Tabellen

In der folgenden Tabelle werden die Funktionen von Apache Iceberg-Tabellen, die vom Lakehouse-Laufzeitkatalog verwaltet werden, mit denen von Apache Iceberg-Tabellen verglichen, die von BigQuery verwaltet werden.

Funktion Von Lakehouse-Laufzeitkatalog verwaltete Apache Iceberg-Tabellen Von BigQuery verwaltete Apache Iceberg-Tabellen
Katalog Lakehouse-Laufzeitkatalog (kompatibel mit Iceberg-REST-Katalog) BigQuery
Speicher Cloud Storage Cloud Storage
Über den Iceberg-REST-Katalogendpunkt zugänglich Ja Ja, mit der BigQuery-Katalogföderation
Lese-/Schreib-Interoperabilität
BigQuery-Leseabfragen (SELECT, BQML, KI-Funktionen) Unterstützt Unterstützt
BigQuery-DML (INSERT, UPDATE, DELETE, MERGE) Unterstützt (Vorabversion) Unterstützt (GA)
OSS-Engine-Lesevorgänge Unterstützt (GA) Unterstützt (GA) (mit BigQuery-Katalogföderation)
OSS-Engine-Schreibvorgänge Unterstützt (GA) Nicht unterstützt
Streaming-Schreibvorgänge für OSS-Engines (Kafka, Spark, Dataflow mit Iceberg-E/A-Senke) Unterstützt (GA) Nicht unterstützt
Verwaltete und erweiterte Funktionen
Tabellenverwaltung (Kompaktierung, automatische Speicherbereinigung) Unterstützt (Vorabversion) Unterstützt (GA)
BigQuery-Streaming-Schreibvorgänge (Storage Write API) Nicht unterstützt Unterstützt (GA)
Pub/Sub-Streaming/-Abo, Dataflow-Streaming mit BigQuery I/O-Senke Nicht unterstützt Unterstützt (GA)
BigQuery Change Data Capture (CDC) Unterstützt (Vorabversion) Unterstützt
Transaktionen mit mehreren Anweisungen in BigQuery Nicht unterstützt Unterstützt (Vorabversion)
Verwaltete Notfallwiederherstellung Nicht unterstützt Nicht unterstützt
Google-Suchindex Nicht unterstützt Nicht unterstützt
Vektorindex (einschließlich automatischer Einbettungsgenerierung) Nicht unterstützt Nicht unterstützt
Zeitreise
Zeitreisen (mit OSS-Engines) Flexibel (über Tabelleneigenschaften konfiguriert) Nicht unterstützt
Zeitreisen (mit BigQuery) Beschränkt auf 7 Tage Beschränkt auf 7 Tage
Snapshot-Verlauf und Rollback zu einem vorherigen Snapshot Unterstützt Nicht unterstützt
Governance, Sicherheit und Freigabe
BigQuery Authorized Views Nicht unterstützt Nicht unterstützt
BigQuery-Sicherheit auf Spaltenebene Nicht unterstützt Unterstützt (GA)
BigQuery-Datenmaskierung und Richtlinien-Tags Nicht unterstützt Unterstützt (GA)
BigQuery-Sicherheit auf Zeilenebene Nicht unterstützt Nicht unterstützt
Analytics Hub-Integration Nicht unterstützt Unterstützt
Funktionen des Knowledge Catalog
Metadatenkatalogisierung, Suche und Ermittlung Unterstützt Unterstützt
Lineage Unterstützt Unterstützt
Datenqualität/Profilerstellung Unterstützt Unterstützt
Statistiken Unterstützt Unterstützt
KI-basierte Generierung von Spalten- und Tabellenbeschreibungen Unterstützt Unterstützt

Lakehouse-Tabelle in BigQuery Studio erstellen

  1. Rufen Sie die Seite BigQuery auf.

    BigQuery aufrufen

  2. Klicken Sie im Bereich Explorer auf Daten hinzufügen.

  3. Klicken Sie auf die Datenquellenkarte Google Cloud Storage.

  4. Klicken Sie unter Direkt auf externe Daten zugreifen auf die Karte GCS-Datendateien.

  5. Wählen Sie unter GCS-Bucket-Quelle oder Dateipfad Ihren Cloud Storage-Bucket aus.

  6. Wählen Sie als Dateiformat die Option Parquet.

  7. Geben Sie unter Tabellenname einen Namen für die Tabelle ein.

  8. Wählen Sie unter Projekt Ihr Projekt aus.

  9. Wählen Sie unter Katalog-ID Ihren vorhandenen Lakehouse-Katalog für den Bucket aus oder erstellen Sie einen, falls er noch nicht vorhanden ist.

  10. Wählen Sie unter Namespace ID einen vorhandenen Lakehouse-Namespace aus oder erstellen Sie einen neuen. Namespace-IDs dürfen nur Buchstaben, Ziffern und Unterstriche enthalten.

  11. (Optional) Definieren Sie unter Schema Feldnamen und Datentypen für die neue Tabelle.

  12. Klicken Sie auf Tabelle erstellen.

Ihre Lakehouse-Tabelle ist jetzt in BigQuery sichtbar und kann wie eine Standard-BigQuery-Tabelle abgefragt und geändert werden.

Anstatt eine Tabelle mit Daten zu erstellen, können Sie eine leere Lakehouse-Tabelle auf dieselbe Weise erstellen wie BigQuery-Standardtabellen. Der einzige Unterschied besteht darin, dass Sie einen Lakehouse-Namespace als Zieldatensatz auswählen.

Andere Kataloge zu Lakehouse migrieren oder föderieren

  1. Rufen Sie die Seite BigQuery auf.

    BigQuery aufrufen

  2. Klicken Sie im Bereich Explorer auf Daten hinzufügen.

  3. Klicken Sie auf die Datenquellenkarte Google Cloud Storage.

  4. Klicken Sie unter Direkt auf externe Daten zugreifen auf die Karte Externe oder Legacy-Kataloge.

  5. Wählen Sie unter Katalogquelle auswählen die Katalogquelle aus.

    • Wenn Sie Hive-Metastore ausgewählt haben, gehen Sie so vor:
      1. Wählen Sie bei Region eine Region für den neuen Lakehouse-Katalog aus.
      2. Geben Sie unter Anzeigename für die Migration einen neuen Namen für die Migration ein.
      3. Klicken Sie auf Weiter.
      4. Geben Sie für Quellsystemkonfiguration die URL, das Dienstkonto und einen Netzwerk-Anhang ein.
    • Wenn Sie eine andere Katalogquelle ausgewählt haben, gehen Sie so vor:
      1. Geben Sie unter Katalogname (in Lakehouse) einen Namen für den Katalog ein.
      2. Wählen Sie unter Speicherort der Daten eine Region für Ihren neuen Lakehouse-Katalog aus.
      3. Klicken Sie auf Weiter.
      4. Geben Sie unter Katalogkonfiguration die Details des Remote-Katalogs, die Authentifizierungsmethode und das Aktualisierungsintervall ein.
  6. Klicken Sie auf Erstellen.

Auf cloudübergreifende Daten zugreifen

Mit der cloudübergreifenden Datenzugriffsfunktion von Lakehouse können Sie Daten, die bei anderen Cloud-Anbietern gespeichert sind, direkt aus BigQuery abfragen, ohne Dateien migrieren oder komplexe ETL-Pipelines erstellen zu müssen. Informationen zur Konfiguration finden Sie unter Remotedaten abfragen.

Nächste Schritte