Questo documento riassume come creare un cluster per i tuoi workload di AI su AI Hypercomputer. Nello specifico, questo documento ti guida nella procedura e nelle scelte da fare quando avvii un cluster. In alternativa alla valutazione manuale, puoi chiedere a Gemini nella console Google Cloud di confrontare le opzioni di consumo per il tuo workload e il tuo budget. Per saperne di più, consulta Progettare l'infrastruttura AI con Compute Advisor.
Questo documento presuppone che tu conosca la terminologia di uso comune per i workload di AI e ML, come l'addestramento e l'inferenza dei modelli. Inoltre, presuppone che tu abbia identificato il workload AI specifico per il quale devi determinare il tipo di macchina e le esigenze di capacità ottimali per il deployment, ad esempio il pre-addestramento, il fine-tuning o l'inferenza del foundation model.
Avvia un cluster
L'avvio di un cluster prevede i seguenti passaggi:
- Determina il carico di lavoro e scegli un tipo di macchina
- Scegliere un'opzione di consumo e ottenere la capacità
- Scegliere un'opzione di deployment
- Scegliere un agente di orchestrazione
- Scegli il sistema operativo e l'immagine del cluster
- Crea il tuo cluster
- Provisioning dell'archiviazione per il workload
Determina il workload e scegli un tipo di macchina
Seleziona un tipo di macchina per il tuo workload di AI. AI Hypercomputer supporta la creazione di cluster sia per le GPU cluster sia per le GPU generiche.
Per aiutarti nella scelta, determina i requisiti del tuo workload e abbinali al tipo di macchina e di GPU consigliati:
- GPU in cluster: ideali per carichi di lavoro su larga scala e ad alte prestazioni, come il preaddestramento di foundation model, il perfezionamento di modelli di grandi dimensioni e l'inferenza su più host.
- GPU generiche: ideali per l'inferenza e l'erogazione mainstream, la generazione aumentata dal recupero (RAG) e l'addestramento e l'ottimizzazione di modelli di piccole e medie dimensioni a costi contenuti.
Per abbinare il tuo workload al tipo di macchina consigliato, utilizza questa tabella:
| Tipo di GPU | Workload o caso d'uso | Tipi di macchine consigliati |
|---|---|---|
| GPU cluster | Pre-addestramento di modelli di base e inferenza su più host | A4X Max (NVIDIA GB300)*, A4X (NVIDIA GB200)* |
| Addestramento, ottimizzazione e inferenza di modelli di grandi dimensioni | A4 (NVIDIA B200), A3 Ultra (NVIDIA H200 141GB) | |
| Inferenza e ottimizzazione dei modelli mainstream | A3 Mega (NVIDIA H100 da 80 GB), A3 High (NVIDIA H100 da 80 GB) | |
| GPU generica | Inferenza e serving perimetrale ad alto throughput | A3 Edge (NVIDIA H100 da 80 GB) |
| Servizio a nodo singolo ad alte prestazioni e messa a punto su piccola scala | A2 (NVIDIA A100) | |
| Inferenza entry-level con ottimizzazione dei costi | G4 (NVIDIA RTX PRO 6000), N1 (NVIDIA T4 o V100) | |
| Inferenza mainstream, RAG e addestramento di modelli di dimensioni ridotte e medie | G2 (NVIDIA L4) |
Per informazioni dettagliate su ogni serie di macchine, consulta Informazioni sugli acceleratori GPU.
Scegli un'opzione di consumo e ottieni la capacità
Seleziona un'opzione di consumo per le risorse GPU in base al tipo di macchina scelto e al fatto che utilizzi GPU per uso generico o GPU cluster.
Opzioni di consumo per le GPU generiche
| Opzione di consumo | Disponibile per | Ideale per | Come richiedere |
|---|---|---|---|
| On demand | Tutte le GPU generiche. | Workload che non richiedono capacità garantita. | Crea un'istanza di computing o un cluster e specifica il modello di provisioning standard. Per istruzioni, vedi Creare istanze VM. Suggerimento:per aumentare le probabilità di ottenere capacità GPU generale, utilizza avvio flessibile o Spot. |
| Prenotazioni standard e prenotazioni future standard | Tutte le GPU generiche. | Workload che richiedono capacità garantita immediatamente (prenotazioni standard) o per una data futura specifica (prenotazioni future standard). | Crea una prenotazione on demand o una richiesta di prenotazione futura. Per istruzioni, vedi Capacità di riserva. |
| Avvio flessibile | Tutti i tipi di macchina GPU, ad eccezione di A4X Max e A4X. | Workload che richiedono cluster densi e di breve durata che durano fino a sette giorni. Offre un'allocazione densa delle risorse e uno sconto fino al 53% sui tipi di macchine supportati; in caso contrario, si applicano le tariffe on demand standard. | Crea una richiesta utilizzando Compute Engine, Cluster Director, Cluster Toolkit o GKE. Le risorse vengono sottoposte a provisioning non appena diventano disponibili (l'ora di inizio non è immediata). Per istruzioni, vedi Ottenere la capacità. |
| Spot | Tutti i tipi di macchina GPU, ad eccezione di A4X Max e A4X. | Carichi di lavoro a tolleranza di errore, batch o di breve durata. Offre lo sconto più elevato (tra il 61% e il 90%), ma le risorse di calcolo possono essere prerilasciate in qualsiasi momento. | Crea istanze o pool di nodi immediatamente utilizzando il modello di provisioning spot. Per istruzioni, vedi Ottenere la capacità. |
Opzioni di consumo per le GPU cluster
| Opzione di consumo | Disponibile per | Ideale per | Come richiedere |
|---|---|---|---|
| Prenotazioni future per i blocchi di capacità | Tutti i tipi di macchine con GPU in cluster e A3 Edge. | Carichi di lavoro che richiedono stabilità per un periodo di tempo prolungato, ad esempio l'inferenza di foundation model o il pre-addestramento di foundation model su più host. Questo metodo di prenotazione offre un'allocazione densa delle risorse e un pool Hyperdisk facoltativo, nonché sconti per vCPU, memoria, GPU, dischi SSD locali e pool Hyperdisk se prenoti le risorse per 365 giorni o più. | Richiedi risorse tramite il team degli Account Google per una data e un'ora future e per una durata di 90 giorni o più. |
| Prenotazioni future in modalità calendario | Tutte le GPU in cluster, ad eccezione di A4X Max e A4X. | Workload che vengono eseguiti per un massimo di 90 giorni e richiedono stabilità, ad esempio modelli di pre-addestramento o perfezionamento. Offre un'allocazione densa delle risorse e uno sconto fino al 53%. | Crea una richiesta di prenotazione self-service per una data e un'ora future; Google Cloud deve approvare la richiesta. Per istruzioni, vedi Capacità di riserva. |
| Avvio flessibile | Tutti i tipi di macchina GPU, ad eccezione di A4X Max e A4X. | Workload che richiedono cluster densi e di breve durata che durano fino a sette giorni. Offre un'allocazione densa delle risorse e uno sconto fino al 53% sui tipi di macchine supportati; in caso contrario, si applicano le tariffe on demand standard. | Crea una richiesta utilizzando Compute Engine, Cluster Director, Cluster Toolkit o GKE. Le risorse vengono sottoposte a provisioning non appena diventano disponibili (l'ora di inizio non è immediata). Per istruzioni, vedi Ottenere la capacità. |
| Spot | Tutti i tipi di macchina GPU tranne A4X Max e A4X. | Carichi di lavoro a tolleranza di errore, batch o di breve durata. Offre lo sconto più elevato (tra il 61% e il 90%), ma le risorse di calcolo possono essere prerilasciate in qualsiasi momento. | Crea immediatamente istanze o pool di nodi utilizzando il modello di provisioning spot. Per istruzioni, vedi Ottenere la capacità. |
Scegliere un'opzione di deployment
A seconda del livello di controllo necessario per il deployment del cluster, scegli tra le seguenti opzioni:
- Deployment altamente gestito: i servizi gestiti automatizzano la configurazione, l'orchestrazione e la configurazione delle risorse di computing, networking e archiviazione.
- Deployment meno gestito e con maggiore controllo: crei e gestisci manualmente le VM, gli ambienti personalizzati e i livelli di orchestrazione.
Altamente gestito
Le opzioni di deployment altamente gestite automatizzano la configurazione e l'orchestrazione delle risorse di calcolo, networking e archiviazione, riducendo l'overhead operativo della gestione dei cluster. Per eseguire il deployment e configurare l'infrastruttura, utilizza Cluster Director, Cluster Toolkit o GKE.
Cluster Director: un prodottoGoogle Cloud che automatizza la configurazione complessa dei cluster, aiutandoti a configurare le risorse di calcolo, networking e archiviazione per i tuoi cluster in modo da massimizzare le prestazioni e ridurre al minimo i tempi di inattività. Cluster Director è progettato per amministratori IT e ricercatori di AI che vogliono evitare l'overhead della gestione di un cluster e concentrarsi invece sull'esecuzione dei propri carichi di lavoro.
Cluster Toolkit: uno strumento open source offerto da Google che semplifica la configurazione e il deployment dei cluster per GKE o Compute Engine. Utilizzi progetti iniziali predefiniti per eseguire il deployment di configurazioni comuni, come i tipi di macchina A4 con Slurm. Puoi modificare i progetti per personalizzare i deployment e il tuo stack software.
GKE: un servizio Kubernetes gestito e una piattaforma di orchestrazione dei container open source. GKE offre funzionalità come la scalabilità automatica e l'alta affidabilità. È anche in grado di orchestrare applicazioni containerizzate, supporta hardware specializzato ed è compatibile con l'ecosistema Google Cloud, il che lo rende ideale per il deployment e la gestione di workload di AI o ML. Puoi eseguire il deployment dei cluster GKE utilizzando GKE direttamente o utilizzando Cluster Toolkit.
Meno gestito, più controllo
Per un controllo più granulare dei cluster e del software installato, crea un cluster Compute Engine utilizzando i gruppi di istanze gestite (MIG) di Compute Engine o creando istanze collettivamente. Poi, installa manualmente il software della chiave necessario sulle istanze.
Scegli un agente di orchestrazione
Un orchestratore automatizza la gestione dei cluster. Con un orchestratore, non devi gestire ogni istanza di computing nel cluster. Un orchestratore, come Slurm o GKE, gestisce attività come la gestione delle code dei job, l'allocazione delle risorse, la scalabilità automatica (nel caso di GKE) e altre attività di gestione dei cluster quotidiane.
Slurm: Slurm è un orchestratore open source di uso comune per i workload HPC, AI o ML. Per un'esperienza Slurm gestita, puoi utilizzare Cluster Director. Per utilizzare Slurm in modo nativo, puoi utilizzare Cluster Toolkit (che offre progetti di cluster che installano automaticamente Slurm sui tuoi cluster) oppure puoi installare manualmente Slurm su un cluster Compute Engine.
GKE: GKE è un servizio gestito basato su Kubernetes, una piattaforma di orchestrazione dei container open source. GKE è ideale per il deployment e la gestione dei carichi di lavoro di AI o ML, grazie alla sua capacità di orchestrare applicazioni containerizzate, al supporto di hardware specializzato e al suo posto nell'ecosistema Google Cloud. Puoi eseguire il deployment dei cluster GKE utilizzando GKE direttamente o utilizzando Cluster Toolkit.
Porta il tuo orchestratore: per utilizzare altri orchestratori, utilizza i cluster Compute Engine. La creazione di un cluster Compute Engine è l'opzione meno gestita offerta su Google Cloud. Questa scelta significa che sei responsabile della configurazione, della manutenzione e dell'aggiornamento delle tue istanze.
Scegli l'immagine di sistema
L'immagine da utilizzare dipende dall'infrastruttura GPU che utilizzi (GPU in cluster o GPU generiche) e da come prevedi di eseguire il deployment dei cluster (GKE, Slurm o Compute Engine). Per i cluster GKE, utilizza Container-Optimized OS. Per i cluster Compute Engine e Slurm, seleziona un'immagine di sistema operativo ottimizzata per gli acceleratori, come le GPU. Inoltre, puoi selezionare un'immagine container del livello software di deep learning (DLSL) per il tuo carico di lavoro.
Per informazioni dettagliate, consulta le immagini di AI Hypercomputer.
Immagini per i cluster GKE
Per creare cluster GKE, utilizza le immagini del sistema operativo container predefinite per le modalità Standard e Autopilot. Tuttavia, in modalità Standard, puoi anche scegliere di utilizzare altre immagini disponibili, come Ubuntu.
Se utilizzi Cluster Toolkit per eseguire il deployment del cluster, puoi utilizzare solo immagini del sistema operativo container, in quanto sono le immagini integrate nei progetti del cluster. Per saperne di più su ciascuna immagine del nodo, consulta Immagini del nodo nella documentazione di GKE.
GKE offre anche immagini container Deep Learning Software Layer (DLSL) che installano pacchetti come NVIDIA CUDA e NCCL, nonché framework di ML come PyTorch, fornendo un ambiente pronto all'uso per i workload di deep learning. Queste immagini container DLSL predefinite sono testate e verificate per funzionare senza problemi sui cluster GKE.
Immagini del sistema operativo per i cluster Compute Engine
AI Hypercomputer offre immagini ottimizzate per l'esecuzione di workload di AI e ML utilizzando Compute Engine. Scegli il sistema operativo con cui hai più dimestichezza:
- Acceleratore Rocky Linux 9
- Acceleratore Rocky Linux 8
- Acceleratore Ubuntu 24.04 LTS
- Acceleratore Ubuntu 22.04 LTS
Se utilizzi Cluster Toolkit, queste immagini dell'acceleratore sono già incluse nei progetti di Cluster Toolkit, perché Cluster Toolkit crea immagini personalizzate che estendono le immagini del sistema operativo dell'acceleratore Ubuntu LTS.
Per saperne di più su ogni immagine del sistema operativo, consulta i dettagli sul sistema operativo nella documentazione di Compute Engine.
Crea il cluster
Dopo aver esaminato la procedura di creazione del cluster e preso le decisioni preliminari per il tuo carico di lavoro, crea il cluster utilizzando una di queste opzioni:
- Crea un cluster GKE:
- Crea un cluster Slurm:
- Crea istanze VM (singole, collettive o MIG)
Provisioning dello spazio di archiviazione per il tuo workload
Scegli un servizio di archiviazione da eseguire il provisioning in base ai requisiti di prestazioni, costi e architettura di archiviazione.