Workload kecerdasan buatan (AI), machine learning (ML), dan komputasi berperforma tinggi (HPC) sering kali mengharuskan Anda membuat image kustom yang mencakup paket software tambahan dan disesuaikan untuk performa yang optimal. Sekarang Anda dapat menggunakan Image Komputasi Lanjutan untuk menyiapkan lingkungan yang dioptimalkan bagi workload AI/ML atau HPC Anda.
Image Komputasi Lanjutan menyediakan stack image standar untuk infrastruktur AI/ML dan HPC. Image ini dapat menghilangkan kebutuhan untuk membuat image kustom Anda sendiri secara manual untuk workload AI/ML dan HPC.
Manfaat
Advanced Compute Images memberikan manfaat berikut:
- Instance komputasi siap untuk workload AI/ML atau HPC secara default. Tidak perlu menyesuaikan performa secara manual, mengelola mulai ulang instance, menginstal agen Slurm, atau mengikuti update Google Cloud terbaru untuk workload AI/ML atau HPC yang terkait erat.
- Performa yang konsisten dan dapat direproduksi. Standardisasi image akan memberi Anda performa level aplikasi yang konsisten dan dapat direproduksi.
Fitur Advanced Compute Images
Image Komputasi Lanjutan berisi beberapa lapisan konfigurasi untuk mendukung menjalankan workload AI/ML dan HPC.
- Konfigurasi sistem operasi: Mencakup penonaktifan update otomatis, penyetelan ulimit yang dioptimalkan untuk HPC, penyesuaian parameter sysctl kernel, dan konfigurasi setelan keamanan seperti SELinux.
- Penyesuaian jaringan: Berisi skrip yang diperlukan untuk penyesuaian jaringan, seperti mengaktifkan layanan multi-antrean.
- Google Cloud integrasi: Menginstal dan mengonfigurasi Google Cloud CLI dan Agen Operasional.
- Alat container: Menginstal dan mengonfigurasi semua software terkait container, termasuk:
- Docker
- NVIDIA Container Toolkit (versi 1.19.0-1)
- NVIDIA Enroot
- NVIDIA Pyxis
- NVIDIA: Menginstal alat berikut:
- Versi NVIDIA CUDA Toolkit 13.0,
- NVIDIA Data Center GPU Manager (DCGM) versi 4
- NVIDIA Fabric Manager
- Plugin NCCL/gIB
MPI: Menginstal library Message Passing Interface (MPI). Menginstal Open MPI pada image berbasis Ubuntu dan berbasis Rocky Linux. Untuk image berbasis Rocky Linux, Anda juga dapat menginstal dan mengonfigurasi library Intel MPI menggunakan skrip yang telah diinstal sebelumnya:
sudo google_install_intelmpi --impi_2021 --install_dir=PATH_INSTALL_MPI
Slurm: Menginstal komponen inti yang diperlukan untuk membuat node cluster Slurm, termasuk:
- Biner Slurm (versi 25.11)
- Munge untuk autentikasi
- PMIx untuk pengelolaan proses
- Library JSON Web Token (JWT) (
libjwt)
Klien sistem file: Menginstal alat sisi klien untuk mengakses berbagai sistem file, seperti Cloud Storage FUSE, utilitas NFS (
nfs-utils), dan klien Lustre.Alat developer: Menginstal utilitas dan rangkaian alat pengembangan serta proses debug umum, seperti:
Pengelolaan lingkungan: Menginstal dan mengonfigurasi alat pengelolaan lingkungan, terutama Lmod, dan menyiapkan skrip profil yang diperlukan untuk membuat perintah modul tersedia bagi pengguna.
RDMA: Menginstal driver dan paket Remote Direct Memory Access (RDMA) pada image CPU (berbasis Rocky Linux), termasuk:
rdma-coredan library pengembanganlibfabricperftestkmod-idpf-irdma- Driver RDMA Ethernet Intel untuk jenis mesin yang dioptimalkan untuk komputasi yang didukung- Utilitas
infiniband-diags,libibverbs, danlibrdmacm
Hardware dan kelompok image yang didukung
ACI mendukung dua platform hardware utama:
CPU (HPC): mendukung workload CPU dan memiliki karakteristik berikut:
- Dioptimalkan untuk beban kerja yang membutuhkan komputasi intensif
- Mendukung Rocky Linux 9
- Dilengkapi dengan driver dan utilitas RDMA untuk mendukung Cloud RDMA
- Dilengkapi dengan library MPI yang telah terintegrasi, termasuk Open MPI dan Intel MPI yang dapat dikonfigurasi
GPU (AI/ML/HPC): mendukung workload GPU dan memiliki karakteristik berikut:
- Dioptimalkan untuk akselerator NVIDIA
- Mendukung Ubuntu LTS 22.04 dan Ubuntu LTS 24.04
- Dilengkapi dengan driver CUDA dan NVIDIA yang sudah terintegrasi
- Mencakup driver dan utilitas RDMA untuk mendukung MRDMA untuk komunikasi GPU-ke-GPU
- Cocok untuk workload AI, ML, atau HPC
- Apakah image default diinstal saat Anda men-deploy blueprint cluster Slurm untuk jenis mesin A4X, A4, dan A3 Ultra di Cluster Toolkit
| Hardware | OS | Orkestrator | Fitur | Arsitektur | Seri mesin yang didukung | Kelompok gambar |
|---|---|---|---|---|---|---|
| CPU | Rocky Linux 9 | tidak ada |
|
AMD x86_64 | C2D, H3, H4D | aci-cpu-rocky-linux-9-amd64 |
| CPU | Rocky Linux 8 | tidak ada |
|
AMD x86_64 | C2D, H3, H4D | aci-cpu-rocky-linux-8-amd64 |
| CPU | Rocky Linux 9 | Slurm 25.11 |
|
AMD x86_64 | C2D, H3, H4D | aci-cpu-rocky-linux-9-slurm-2511-amd64 |
| GPU | Ubuntu LTS 24.04 | Slurm 25.11 |
|
AMD x86_64 | A3 Ultra, A4 | aci-gpu-u2404-slurm-2511-cuda-130-nvidia-580-amd64 |
| GPU | Ubuntu LTS 24.04 | Slurm 25.11 |
|
Arm64 | A4X | aci-gpu-u2404-slurm-2511-cuda-130-nvidia-580-arm64 |
| GPU | Ubuntu LTS 24.04 | Slurm 26.05 |
|
AMD x86_64 | A3 Ultra, A4 | aci-gpu-u2404-slurm-2605-cuda-132-nvidia-595-amd64 |
| GPU | Ubuntu LTS 24.04 | Slurm 26.05 |
|
Arm64 | A4X | aci-gpu-u2404-slurm-2605-cuda-132-nvidia-595-arm64 |
| GPU | Ubuntu LTS 24.04 | tidak ada |
|
AMD x86_64 | A3 Ultra, A4 | aci-gpu-u2404-cuda-130-nvidia-580-amd64 |
| GPU | Ubuntu LTS 22.04 | Slurm 25.11 |
|
AMD x86_64 | A3 Ultra, A4 | aci-gpu-u2204-slurm-2511-cuda-130-nvidia-580-amd64 |
| GPU | Ubuntu LTS 22.04 | tidak ada |
|
AMD x86_64 | A3 Ultra, A4 | aci-gpu-u2204-cuda-130-nvidia-580-amd64 |
Paket (atau RPM) yang telah terinstal sebelumnya
Advanced Compute Image dilengkapi dengan berbagai alat, library, driver, dan paket yang sudah diinstal sebelumnya. Untuk melihat daftar apa yang diinstal untuk gambar apa pun, lihat file manifes untuk gambar tersebut.
Anda dapat menemukan file manifes di /usr/share/google/manifest.txt.
Tahapan siklus proses dan dukungan kelompok image
Semua keluarga Advanced Compute Images mengikuti siklus proses standar untuk memastikan keamanan, stabilitas, dan jadwal pemeliharaan yang dapat diprediksi. Selama setiap fase siklus proses, kelompok image memiliki salah satu status dukungan berikut:
- Didukung:
- Menerima update keamanan penting dan perbaikan bug
- Didukung melalui Cloud Customer Care.
- Dapat digunakan untuk membuat instance komputasi.
- Tidak didukung:
- Tidak lagi menerima update keamanan penting atau perbaikan bug.
- Tidak ada fitur baru.
- Tidak didukung melalui Cloud Customer Care.
- Tidak dapat digunakan untuk membuat instance komputasi.
Siklus proses keluarga Advanced Compute Images terdiri dari empat fase:
| Fase siklus proses | Status dukungan | Deskripsi dan dampak |
|---|---|---|
| Aktif | Didukung | Direkomendasikan untuk deployment baru. Selama 12 bulan setelah tanggal rilis, keluarga gambar didukung sepenuhnya. Menerima update keamanan penting dan perbaikan bug. |
| Tidak digunakan lagi (tanggal EOS) | Tidak didukung | Sebaiknya migrasikan ke family image yang didukung. Selama sekitar enam bulan setelah fase Aktif berakhir, kelompok gambar tidak digunakan lagi. Tidak ada fitur atau patch baru yang dirilis. Google Cloud Peringatan konsol dan Google Cloud CLI akan muncul saat Anda membuat instance yang menggunakan keluarga image ini. |
| Tidak berlaku lagi | Tidak didukung | Setelah fase tidak digunakan lagi berakhir, kelompok image menjadi tidak berlaku. Anda tidak dapat lagi membuat instance komputasi menggunakan kelompok image ini. Instance komputasi yang ada akan terus berjalan, tetapi berisiko tidak kompatibel dengan pengontrol Slurm. |
| Penghapusan | Tidak didukung | Tiga bulan setelah kelompok image menjadi tidak berlaku, resource image Advanced Compute Images yang mendasarinya akan dihapus secara permanen. Instance komputasi yang ada akan terus berjalan, tetapi berisiko tidak kompatibel dengan pengontrol Slurm dan kerentanan. |
Untuk mengetahui informasi tentang tanggal pasti akhir dukungan untuk kelompok image, lihat Hardware dan kelompok image yang didukung.
Harga
Advanced Compute Images tersedia tanpa biaya tambahan. Karena Advanced Compute Images berjalan di Compute Engine, Anda mungkin dikenai biaya untuk resource Compute Engine seperti vCPU, GPU, TPU, disk, dan memori. Untuk mempelajari lebih lanjut, lihat Harga Compute Engine.
Langkah berikutnya
- Membuat instance dengan Advanced Compute Images
Pelajari cara men-deploy blueprint cluster Slurm siap pakai dengan Advanced Compute Images: