פרומפטים
פיתוח ו-AI

תצפיתיות לתכונה מבוססת LLM בייצור

מגדיר מה למדוד ולתעד בתכונת LLM בייצור, כדי לזהות ירידת איכות שאינה מייצרת שגיאה ולכן אינה נראית בניטור רגיל.

פרומפט

עצב תצפיתיות לתכונת LLM בייצור. הבעיה המרכזית: ירידת איכות אינה מייצרת שגיאה. המערכת מחזירה 200 ותשובה גרועה.

התכונה: [תאר] היקף: [קריאות ליום] מה קורה עם הפלט: [מוצג / מזין החלטה / נשמר]

הגדר:

  1. מה מתעדים לכל קריאה — מזהה בקשה, גרסת פרומפט, מודל, טוקנים נכנסים ויוצאים, זמן תגובה, עלות, ומזהה משתמש מוצפן. לא לתעד: תוכן מסמכים חסויים, מפתחות, מידע מזהה.
  2. מדדי איכות ללא תווית אמת — שיעור סירובים, שיעור פלט לא תקין, שיעור החזרות ריקות, אורך פלט חריג, שיעור retry, ושיעור נטישה של המשתמש אחרי תגובה.
  3. אותות ממשתמשים — העתקה, עריכה לפני שימוש, דירוג, וחזרה על אותה שאלה בניסוח אחר. האחרון הוא האות החזק ביותר לתשובה גרועה.
  4. התראות — לכל מדד, הסף והחלון. הפרד בין התראה שמעירה אדם בלילה לבין דוח יומי. עלות וזמן תגובה: התראה מיידית. איכות: מגמה יומית.
  5. דגימה לבדיקה ידנית — כמה, לפי איזה קריטריון, ומי בודק. העדף דגימה מוטית לכיוון מקרים חשודים על פני דגימה אקראית.
  6. זיהוי סחף — כיצד מבחינים בין שינוי בהתנהגות המודל לבין שינוי בסוג השאלות שנשאלות. אלה נראים זהים בגרף.
  7. מה לשמור לניפוי — כמה זמן, ובאיזו רמת פירוט, בהתחשב במגבלות פרטיות.

לבסוף: השאלה הראשונה שתישאל כשמשתמש ידווח על תשובה שגויה, והנתון שצריך להיות זמין כדי לענות עליה.

למה זה ממיר טוב

  • מוכן להעתקה והדבקה מיידית
  • מותאם לעבודה משפטית/ציבורית
  • קל להתאמה לתהליך פנימי

תגיות

observabilitymonitoringproductionmetrics