מעקב אחרי מופעים באמצעות Cloud Monitoring

במאמר הזה מוסבר איך להשתמש במסוף Cloud Monitoring כדי לעקוב אחרי מכונות Spanner.

מסוף Cloud Monitoring מספק כמה כלי מעקב ל-Spanner:

אם אתם מעדיפים לעקוב אחרי Spanner באופן פרוגרמטי, אתם יכולים להשתמש בספריות הלקוח של Cloud Monitoring כדי לאחזר מדדים.

שימוש בלוח הבקרה המותאם אישית של Cloud Monitoring

ב-Cloud Monitoring יש לוח בקרה מותאם אישית שמסכם מידע חשוב על מופעי Spanner, כולל:

  • אירועים: התראות מעקב שנוצרו על ידי משתמשים, שהן פתוחות, פעילות או נפתרו
  • אירועים: רשימה של יומני ביקורת של Spanner (אם הם זמינים ומופעלים)
  • מכונות: סיכום ברמה גבוהה של מכונות Spanner, כולל קיבולת מחשוב, מספר מסדי הנתונים ותקינות המכונה
  • תרשימים מצטברים של Throughput ושימוש באחסון

כדי לראות את מרכז הבקרה של Spanner:

  1. במסוף Google Cloud , בוחרים באפשרות Monitoring או לוחצים על הלחצן הבא:

    מעבר למעקב

  2. אם האפשרות Resources מוצגת בחלונית הניווט, בוחרים באפשרות Resources ואז באפשרות Cloud Spanner. אחרת, בוחרים באפשרות מרכזי בקרה ואז במרכז הבקרה שנקרא Cloud Spanner.

הצגת פרטי המופע ומסד הנתונים

כשפותחים את מרכז הבקרה המותאם אישית ל-Spanner, מוצגים נתונים מצטברים של כל המופעים. כדי לראות פרטים נוספים על מכונה ספציפית, לוחצים על שם המכונה בקטע Instances (מכונות).

במרכז הבקרה מוצג מידע כמו מטא-נתונים של המופע, מסדי נתונים במופע ותרשימים של מדדים שונים שמחולקים לפי אזור.

בדף לוח הבקרה של המכונה, אפשר גם לראות תרשימים של מסד נתונים ספציפי במכונה:

  1. בצד שמאל, מעל תרשימי המדדים של המופע, לוחצים על מדדי מסד נתונים.

  2. בתפריט הנפתח בחירת פירוט, בוחרים את מסד הנתונים שרוצים לבדוק.

    בתרשימים במסוף Cloud Monitoring מוצגים נתונים לגבי מסד הנתונים.

יצירת תרשימים מותאמים אישית למדדי Spanner

אתם יכולים להשתמש ב-Cloud Monitoring כדי ליצור תרשימים מותאמים אישית למדדים של Spanner. אתם יכולים להשתמש ב-Metrics Explorer כדי ליצור תרשימים זמניים, תרשימים אד-הוק, או שאתם יכולים ליצור תרשימים שמופיעים בלוחות בקרה בהתאמה אישית.

בפרט, Cloud Monitoring מאפשר לכם ליצור תרשים מותאם אישית שמראה אם יש קורלציה בין שני מדדים או יותר. לדוגמה, אפשר לבדוק את המתאם בין ניצול המעבד לבין זמן האחזור במופע Spanner, כדי לראות אם המופע זקוק לקיבולת מחשוב נוספת או אם חלק מהשאילתות גורמות לניצול גבוה של המעבד.

כדי להתחיל להשתמש בדוגמה הזו, פועלים לפי השלבים הבאים:

  1. במסוף Google Cloud , בוחרים באפשרות Monitoring או לוחצים על הלחצן הבא:

    מעבר למעקב

  2. אם Metrics Explorer מוצג בחלונית הניווט, בוחרים בו. אחרת, בוחרים באפשרות Resources (משאבים) ואז באפשרות Metrics Explorer (הכלי לבחירת מדדים).

  3. לוחצים על הכרטיסייה אפשרויות תצוגה ואז מסמנים את התיבה סולם לוגריתמי בציר Y. האפשרות הזו עוזרת להשוות בין כמה מדדים כשערך של מדד אחד גדול בהרבה מהערכים של המדדים האחרים.

  4. בתפריט הנפתח שמעל החלונית השמאלית, בוחרים באפשרות קו.

  5. לוחצים על הכרטיסייה Metrics. עכשיו אפשר להוסיף מדדים לתרשים.

כדי להוסיף לתרשים מדדי זמן אחזור:

  1. בתיבה Find resource type and metric, מזינים את הערך spanner.googleapis.com/api/request_latencies ולוחצים על השורה שמופיעה מתחת לתיבה.
  2. בתיבה Filter, מזינים את הערך instance_id, ואז מזינים את מזהה המופע שרוצים לבדוק ולוחצים על Apply.
  3. ברשימה הנפתחת Aggregator, לוחצים על max.
  4. אופציונלי: משנים את אחוזון זמן האחזור:

    1. לוחצים על הצגת אפשרויות מתקדמות.
    2. לוחצים על התפריט הנפתח Aligner ואז על אחוזון ההשהיה שרוצים לראות.

    ברוב המקרים, כדאי לבדוק את זמן האחזור של האחוזון ה-50 כדי להבין את זמן האחזור האופייני, או את זמן האחזור של האחוזון ה-99 כדי להבין את זמן האחזור של 1% הבקשות הכי איטיות.

כדי להוסיף לתרשים מדדים של ניצול המעבד:

  1. לוחצים על הוספת מדד.
  2. בתיבה Find resource type and metric, מזינים את הערך spanner.googleapis.com/instance/cpu/utilization ולוחצים על השורה שמופיעה מתחת לתיבה.
  3. בתיבה Filter, מזינים את הערך instance_id, ואז מזינים את מזהה המופע שרוצים לבדוק ולוחצים על Apply.
  4. ברשימה הנפתחת Aggregator, לוחצים על max.

עכשיו יש לכם תרשים שבו מוצגים מדדי השימוש במעבד והחביון של מופע Spanner. אם שני המדדים גבוהים מהצפוי בו-זמנית, אפשר לנקוט צעדים נוספים כדי לפתור את הבעיה.

מידע נוסף על יצירת תרשימים בהתאמה אישית זמין במסמכי התיעוד של Cloud Monitoring.

יצירת התראות למדדים של Spanner

כשיוצרים מופע של Spanner, בוחרים את קיבולת החישוב של המופע. ככל שעומס העבודה של המופע משתנה, Spanner לא משנה אוטומטית את קיבולת החישוב של המופע. לכן, צריך להגדיר כמה התראות כדי לוודא שהמופע יישאר במסגרת הערכים המקסימליים המומלצים לניצול המעבד והמגבלה המומלצת לאחסון.

בדוגמאות הבאות מוסבר איך להגדיר מדיניות התראות לגבי חלק מהמדדים של Spanner. רשימה מלאה של המדדים הזמינים מופיעה במאמר בנושא רשימת המדדים של Spanner.

יחידת CPU בעדיפות גבוהה

כדי ליצור מדיניות התראות שמופעלת כשניצול המעבד בעדיפות גבוהה ב-Spanner גבוה מסף מומלץ, צריך להשתמש בהגדרות הבאות.

תנאי חדש
שדה

ערך
מקור מידע ומדד בתפריט Resources בוחרים באפשרות Spanner Instance.
בתפריט Metric categories בוחרים באפשרות Instance.
בתפריט Metrics, בוחרים באפשרות CPU Utilization by priority.

(המדד.הסוג הוא spanner.googleapis.com/instance/cpu/utilization_by_priority).
מסנן instance_id = YOUR_INSTANCE_ID
priority = high
בסדרות זמן
קיבוץ לפי סדרות זמן
‫location למופעים במספר אזורים,
משאירים את השדה ריק למופעים אזוריים.
בסדרות עיתיות
צבירה של סדרות עיתיות
sum
חלון נע 10 m
פונקציה אנליטית (window function) mean
הגדרת טריגר להתראה
שדה

ערך
סוג התנאי Threshold
טריגר להתראה Any time series violates
Threshold position Above threshold
סכום הסף ‫45% למופעים במספר אזורים,
‫65% למופעים אזוריים.
חלון הבדיקה מחדש 10 minutes

ממוצע נע של 24 שעות של יחידת העיבוד המרכזית (CPU)

כדי ליצור מדיניות התראות שמופעלת כשהממוצע הנע של ניצול המעבד (CPU) ב-Spanner למשך 24 שעות גבוה מסף מומלץ, משתמשים בהגדרות הבאות.

תנאי חדש
שדה

ערך
מקור מידע ומדד בתפריט Resources בוחרים באפשרות Spanner Instance.
בתפריט Metric categories בוחרים באפשרות Instance.
בתפריט Metrics, בוחרים באפשרות Smoothed CPU utilization.

(המדד.הסוג הוא spanner.googleapis.com/instance/cpu/smoothed_utilization).
מסנן instance_id = YOUR_INSTANCE_ID
בסדרות עיתיות
צבירה של סדרות עיתיות
sum
חלון נע 10 m
פונקציה אנליטית (window function) mean
הגדרת טריגר להתראה
שדה

ערך
סוג התנאי Threshold
טריגר להתראה Any time series violates
Threshold position Above threshold
סף 90%
חלון הבדיקה מחדש 10 minutes

אחסון

כדי ליצור מדיניות התראות שתופעל כשהנפח של אחסון נתוני המופע של Spanner יהיה מעל סף מומלץ, צריך להשתמש בהגדרות הבאות.

תנאי חדש
שדה

ערך
מקור מידע ומדד בתפריט Resources בוחרים באפשרות Spanner Instance.
בתפריט Metric categories בוחרים באפשרות Instance.
בתפריט Metrics, בוחרים באפשרות Storage used.

(המדד.הסוג הוא spanner.googleapis.com/instance/storage/utilization).
מסנן instance_id = YOUR_INSTANCE_ID
בסדרות עיתיות
צבירה של סדרות עיתיות
sum
חלון נע 10 m
פונקציה אנליטית (window function) max
הגדרת טריגר להתראה
שדה

ערך
סוג התנאי Threshold
התנאי מופעל אם Any time series violates
Threshold position Above threshold
סכום הסף לא צריך להגדיר סף ספציפי לנפח האחסון המקסימלי לכל צומת. עם זאת, מומלץ להגדיר התראה שתתקבל כשמתקרבים למגבלת האחסון המקסימלית. מידע נוסף זמין במאמר מדדים של ניצול נפח האחסון.
חלון הבדיקה מחדש 10 minutes

המאמרים הבאים