אימון מודלים של AI ו-ML

איך מאמנים מודלים של AI ו-ML ב-Google Cloud Data Agent Kit

במדריך למתחילים הזה תשתמשו בתבנית סשן ובמחברת Jupyter לדוגמה כדי לחזות את סכומי הטיפים שניתנים לנהגי מוניות בניו יורק. בעזרת ליבת Jupyter מרוחקת עם PySpark, אתם יכולים לנסות מודלים שונים כמו רגרסיה לינארית, יער אקראי ו-XGBoost. התהליך הזה מאפשר לכם לבצע אימון והסקת מסקנות מבוזרים. הוא מדגים את יכול�� ההתאמה למגוון מכונות באמצעות Spark ML וספריית XGBoost.

למרות שלא נסביר על כך במדריך הזה, יש כמה דרכים לאמן מודלים של AI ו-ML באמצעות Google Cloud Data Agent Kit:

  • אם מערך הנתונים לאימון גדול או שאתם רוצים להשתמש ביכולות האימון המבוזר שמציע Apache Spark, אתם יכולים להשתמש ב-Spark notebooks עם ליבות מרוחקות.
  • אם מערך הנתונים שלכם נמצא ב-BigQuery ו-BigQuery ML תומך בתרחיש השימוש שלכם, אתם יכולים להשתמש במחברת BigQuery DataFrames.
  • אם מערך הנתונים קטן ואתם רוצים לאמן את המודל באופן מקומי, אתם יכולים להשתמש ב-notebook של Python.

לפני שמתחילים

לפני שמתחילים, צריך לבצע את הפעולות הבאות:

  1. איך מתקינים תוסף
  2. הגדרת תוספים
  3. מומלץ לעיין בהדרכה בנושא חיפוש נתונים וניתוח שלהם.

יצירת תבנית של זמן ריצה של Spark

תבניות של Serverless Spark Runtime מאפשרות להתחיל סשן של Apache Spark עם קבוצה נתונה של הגדרות. כדי ליצור תבנית חדשה של Serverless Runtime:

  1. בסרגל הפעילות של IDE, לוחצים על הסמל Google Cloud Data Agent Kit.
  2. בתפריט Google Cloud Data Agent Kit, מרחיבים את Apache Spark.
  3. מרחיבים את Serverless ואז לוחצים על + Create serverless runtimes. יופיע טופס ליצירת Serverless Runtime.
  4. בשדה Display Name, מזינים ai-ml-tutorial.
  5. עוברים לקטע Auto Scaling.
  6. מגדירים את spark.dynamicAllocation.enabled כ-false ברשימה הנפתחת. ההגדרה הזו נדרשת כדי ש-XGBoost יעבוד עם Apache Spark.
  7. בכל שאר השדות משאירים את ערכי ברירת המחדל.
  8. לוחצים על שליחה.

יצירת נוטבוק חדש

לאחר מכן, יוצרים נוטבוק חדש של Spark:

  1. בכרטיסייה Google Cloud Data Agent Kit, בקטע Apache Spark, לוחצים על + New Spark Notebook.
  2. בוחרים בא��שרות Remote Kernel (ליבת מערכת מרוחקת) בשדה 'סוג ליבת המערכת'.
  3. לוחצים על התחלה עם מחברת לדוגמה.
  4. ברשימת הדוגמאות, בוחרים באפשרות Data Science with PySpark and Distributed XGBoost (מדעי הנתונים עם PySpark ו-XGBoost מבוזר). יופיע נוטבוק Jupyter ללא שם.

אימון המודל

  1. בכרטיסיית ה-Notebook, לוחצים על Run All (הפעלה של הכול). בכלי לבחירת ליבה, בוחרים ליבה להרצת הנוטבוק.
  2. לוחצים על Select Another Kernel (בחירת ליבה אחרת).
  3. לוחצים על Remote Spark Kernels (ליבות Spark מרוחקות).
  4. בוחרים את ai-ml-tutorial on Serverless Spark, תבנית זמן הריצה שיצרתם קודם.

ההודעה הבאה מוצגת בזמן שהמערכת יוצרת את סשן Serverless Spark: Connecting to kernel: ai-ml-tutorial on Serverless Spark. כשהמחברת מתחברת לליבת PySpark מרוחקת, ההרצה מתחילה בתא הראשון. התהליך הזה נמשך בערך שתיים עד שלוש דקות.

בדיקת סשן Spark

  1. בכרטיסייה Google Cloud Data Agent Kit (ערכת סוכני נתונים של Google Cloud), בקטע Apache Spark, מרחיבים את התבנית ai-ml-tutorial Runtime. ב-IDE מוצגת רשימה של סשנים אינטראקטיביים שיצרתם באמצעות תבנית זמן הריצה הזו.
  2. מחפשים בראש הרשימה את הסשן שהמערכת יצרה על ידי הפעלת הנוטבוק. לוחצים על הסשן כדי לראות את הפרטים שלו. אתם יכולים לבדוק את הגדרות הסשן ואת המשאבים שהמערכת צרכה כדי להריץ את ה-notebook.

הסרת המשאבים

אחרי שמריצים את ה-notebook בהצלח��, ��ב��ע��ם ��ת ��ל��י הנ��קוי הבאים.

  1. בכרטיסייה Google Cloud Data Agent Kit, בקטע Apache Spark, לוחצים לחיצה ימנית על Serverless (ללא שרת) ובוחרים באפשרות List Serverless Runtimes (רשימת סביבות זמן ריצה ללא שרת). מוצגת רשימה של סביבות זמן ריצה ללא שרת (serverless).
  2. בתפריט פעולה של ai-ml-tutorial, מוצגת רשימה של כל הסשנים האינטראקטיביים שהמערכת יצרה מהתבנית.
  3. בקטע פעולות, לוחצים על מחיקה.
  4. חוזרים לחלון Serverless Runtimes (סביבות ריצה ללא שרת).
  5. בקטע פעולות של ai-ml-tutorial, לוחצים על מחיקה.
  6. לוחצים על אישור כדי למחוק את התבנית שיצרתם במדריך הזה.

המאמרים הבאים