כדי להריץ ביעילות עומסי עבודה של בינה מלאכותית (AI) או למידת מכונה (ML), צריך לבחור גם כלי לתזמור עומסי עבודה וגם פלטפורמת פריסה. אלה הפונקציות של הרכיבים:
מנהל התזמור מתזמן ומריץ את המשימות.
אפשרות פריסה שמנהלת כלי תזמור.
אחרי שמזהים את תשתית ה-GPU (מערכת GPU באשכול או GPU כללי) שבה רוצים להשתמש כדי להריץ את עומסי העבודה, פועלים לפי ההנחיות במאמר הזה כדי לזהות את כלי התזמור והפריסה שהכי מתאימים לעומס העבודה ולרמת הניהול.
כדי לעיין בסוגי מכונות GPU שבהם אפשר להשתמש להרצת עומסי עבודה, אפשר לעיין במאמר בנושא מכונות GPU.
השוואה בין כלי תזמור ואפשרויות פריסה
AI Hypercomputer מציע כמה אפשרויות לניהול ולפריסה של מכונות וירטואליות. האפשרויות האלה כוללות אשכולות מנוהלים באופן מלא שמאפשרים לכם להתמקד בעומסי העבודה, וסביבות בניהול עצמי שמאפשרות לכם שליטה מדויקת באופן שבו אתם מתחזקים ומעדכנים את מופעי המחשוב.
בטבלה הבאה מוצגת השוואה בין כלי התזמור ואפשרויות הפריסה שבהם אפשר להשתמש כשמריצים עומסי עבודה של AI:
| מוצר | כלי תזמור | מורכבות טכנית | מומלץ ל | יתרון מרכזי |
|---|---|---|---|---|
| Cluster Director | Slurm | נמוכה | חוקרי AI, מדעני נתונים | מחזור חיים מנוהל לאשכולות Slurm |
| Google Kubernetes Engine (GKE) | Kubernetes | בינונית עד גבוהה | מהנדסי למידת מכונה, מהנדסי פלטפורמה | תזמור קונטיינרים והתאמה לעומס (scaling) |
| Cluster Toolkit | Slurm, Kubernetes | בינוני | ML DevOps, Platform engineers | תוכניות מגירה מאומתות של תשתית כקוד |
| Compute Engine | בהתאמה אישית / אף אחת מהאפשרויות | גבוהה | אדריכלי תשתית | שליטה פרטנית במערכת ההפעלה וברשת |
בחירת כלי לניהול תהליכים ואפשרות פריסה
כדי לבחור כלי לניהול תהליכים ואפשרות פריסה, אפשר להשתמש בתרשים הזרימה הבא:
בתרשים הזרימה שלמעלה מוצגות השאלות הבאות:
האם אתם רוצים תזמור של אשכולות לעומסי העבודה שלכם?
- כן: עוברים לשאלה 2.
- לא: משתמשים ב-Compute Engine.
רוצה להריץ אפליקציות רגילות בקונטיינרים?
- כן: שימוש ב-GKE.
- לא: עוברים לשאלה 3.
האם אתם רוצים ש-Google תנהל את מחזור החיים של האשכול?
- כן: שימוש ב-Cluster Director.
- לא: משתמשים ב-Cluster Toolkit.
כלי תזמור נתמכים
כלי תזמור מאפשר לנהל את האשכולות באופן אוטומטי, כך שלא צריך לנהל כל מופע חישוב בנפרד. כלי תזמור כמו Slurm או Kubernetes מטפלים בהוספה לתור של משימות, בהקצאת משאבים ובשינוי גודל אוטומטי.
Slurm: כלי תזמור בקוד פתוח שמשמש בדרך כלל לעומסי עבודה של AI, למידת מכונה (ML) ו-HPC. אפשר להשתמש ב-Slurm עם Cluster Toolkit או Cluster Director.
Kubernetes: פלטפורמה לתזמור בין קונטיינרים של קוד פתוח. אפשר לפרוס את Kubernetes באמצעות GKE ישירות או באמצעות Cluster Toolkit.
מותאם אישית או ללא: אם אתם מעדיפים כלי תזמור שונה או רוצים לנהל את מכונות החישוב שלכם בלי כלי תזמור, אתם יכולים להשתמש ב-Compute Engine. האפשרות הזו מספקת את רמת השליטה הגבוהה ביותר, אבל היא מחייבת להגדיר, לתחזק ולעדכן את מופעי המחשוב באופן ידני.
פלטפורמות פריסה נתמכות
אחרי שתזהו את כלי האורקסטרציה המומלץ ואת אפשרות הפריסה שמתאימים לתרחיש השימוש שלכם, כדאי לעיין בתיאורים שלהם שבהמשך כדי לוודא שרמות הניהול והתכונות שלהם עומדות בדרישות של עומס העבודה.
פלטפורמות מנוהלות ואוטומטיות
אם אתם רוצים להימנע מהעלויות הנלוות של ניהול אשכולות ולהתמקד בהרצת עומסי העבודה, אתם יכולים להשתמש באחת מהפלטפורמות המנוהלות הבאות:
Cluster Director: שירות שמנוהל במלואו שמאפשר אוטומציה של מחזור החיים של אשכולות Slurm. אפשר להשתמש ב-Cluster Director כדי לפשט את ההגדרה והקביעה של אשכולות Slurm. Cluster Director מבצע אוטומציה של מחזור החיים של האשכולות, כדי שתוכלו להתמקד בהרצת עומסי העבודה של AI, ML או HPC. מידע נוסף זמין במאמר סקירה כללית על Cluster Director.
GKE: סביבת Kubernetes מנוהלת שעברה אופטימיזציה לעומסי עבודה של AI ו-ML. שימוש ב-GKE כדי לתזמן עומסי עבודה מבוססי-קונטיינרים, לשלב עם חומרה מיוחדת של Compute Engine ולנצל תכונות ספציפיות ל-GKE כמו תזמון מודע לטופולוגיה (TAS). מידע נוסף זמין במאמר סקירה כללית על GKE.
פלטפורמות בניהול חלקי ופלטפורמות בניהול עצמי
אם אתם צריכים שליטה מדויקת במערכת ההפעלה, בהגדרות של ליבת המערכת או בגרסאות של מנהלי ההתקנים, אתם צריכים להשתמש בפלטפורמה בניהול חלקי או בניהול עצמי:
Cluster Toolkit: ערכת כלים בקוד פתוח שמספקת תוכניות מגירה מאומתות וניתנות להתאמה אישית לפריסת סביבות AI ו-ML שניתנות לשחזור. הוא מציע גמישות ושליטה גבוהות באמצעות עקרונות של תשתית כקוד (IaC). מידע נוסף זמין במאמר סקירה כללית של Cluster Toolkit.
Compute Engine: שירות מחשוב שניתן להתאמה אישית ומספק שליטה מקסימלית בבניית סביבות בהתאמה אישית מאפס. Compute Engine לא משמש ככלי עצמאי לארגון תהליכים, אבל הוא מספק בסיס למשתמשים שמעדיפים לבנות ולנהל סטאקים מותאמים אישית משלהם. מידע נוסף זמין במאמר סקירה כללית על Compute Engine.
המאמרים הבאים
- מידע על נפח האחסון מופיע במאמר בנושא אפשרויות צריכה.
- כדי לפרוס את האשכול, אפשר לעיין במאמר סקירה כללית על יצירת אשכול.