בינה מלאכותית בפועל · מעורב
נתונים: מאיפה הם מגיעים ומה עושים כשאין
בשורה אחת: ברוב הפרויקטים הנתונים קיימים אך מפוזרים, לא מתויגים ולא נקיים — וזה השלב שגוזל את רוב הזמן.
שלוש שאלות לפני שמתחילים
איפה המידע יושב פיזית ומי בעל הגישה; באיזה מצב הוא — פורמט, שלמות, כפילויות; והאם מותר להשתמש בו למטרה הזו. השאלה השלישית עוצרת יותר פרויקטים מהראשונות.
כשאין תיוג
התחילו קטן: מאתיים דוגמאות מתויגות היטב שוות יותר מעשרת אלפים מתויגות ברישול. כתבו הנחיות תיוג, תייגו כפול מדגם, ומדדו הסכמה בין מתייגים — חוסר הסכמה מעיד על הגדרה מעורפלת, לא על עובדים גרועים.
אפשר גם לייצר תיוג ראשוני במודל ולתקן ידנית. זה מהיר, ודורש בדיקה של המדגם כדי לא להנציח הטיה.
ניקוי שמשתלם
איחוד ישויות כפולות, נרמול טקסט עברי, תיקון תאריכים ומספרים, והסרת רשומות שאין להן משמעות. רוב הקפיצה באיכות מגיעה מכאן ולא ממודל טוב יותר.
לעומק
שמרו את הנתונים בגרסאות: איזה מדגם שימש לאיזו הערכה. בלי זה, השוואה בין שתי הרצות שנעשו בשבועות שונים חסרת משמעות, ואי אפשר לדעת אם השתפרתם או שרק הנתונים השתנו.