מי מחליט כמה קשה שאלה? כיול קושי מתשובות התלמידים, לא מהרגשת הכותב
כותבי שאלות מנחשים גרוע כמה קשה השאלה שלהם, וזה ממצא ותיק. אז בנינו כיול שרץ בלילה: חלק העונים נכון, זמן תגובה חציוני, ומדד הבחנה שמסמן שאלות שבורות. הוא מציע, לא מחליט. ולמה סירבנו לתת ערך ברירת מחדל למקור של אלפי שאלות.
כל שאלה שנכנסת למאגר של קורס הפסיכומטרי מגיעה עם תג: קלה, בינונית, קשה. את התג קובע מי שכתב את השאלה, או מי שהקליד אותה ממבחן עבר. זה נשמע הגיוני. מי מכיר את השאלה טוב יותר מהאדם שניסח אותה?
מסתבר שכמעט כל אחד. כשמאות תלמידים פותרים את אותה שאלה, לנתונים יש דעה משלהם על כמה היא קשה, והדעה הזו לא תמיד מסכימה עם הכותב. לפעמים שאלה שתויגה "קשה" נפתרת נכון על ידי רוב מוחלט, ולפעמים שאלה "קלה" מפילה גם את התלמידים החזקים. השאלה השנייה היא המעניינת: היא בדרך כלל לא קשה, היא שבורה.
זה המאמר על כיול פריטים (Item Calibration): איך המערכת שלנו לומדת מהתשובות של תלמידים כמה קשה כל שאלה באמת, מה עוד היא לומדת בדרך, ולמה, נכון להיום, היא רק מציעה ולא מחליטה.
מי קובע את רמת הקושי של שאלה בפסיכומטרי, ואיך אפליקציה מכיילת אותה?
בהתחלה, מי שכתב את השאלה. אחרי שמספיק תלמידים ענו עליה, המערכת מחשבת שלושה דברים: איזה חלק מהעונים צדק (מדד הקושי הקלאסי), כמה זמן לקח לענות (זמן תגובה חציוני), והאם תלמידים חזקים מצליחים בה יותר מחלשים (מדד ההבחנה). הקושי האמפירי מוצע כתחליף לתג של הכותב, זמן התגובה מזין את סינון הניחושים, ושאלה עם הבחנה חלשה נשלחת לבדיקה אנושית, לא לפח.
מה המדע אומר: כותבי שאלות מנחשים גרוע
הממצא הזה ותיק ומביך, ובעיקר עקבי. בז'אר (Bejar, 1983) ביקש ממומחי תוכן להעריך את הסטטיסטיקות של פריטים במבחן, ומצא שההערכות שלהם מתואמות באופן חלש עם הקושי שנמדד בפועל. אימפרה ופלייק (Impara & Plake, 1998) חזרו על התרגיל עם מורים שהכירו את התלמידים שלהם אישית, ומצאו אותו דבר: המורים ידעו לדרג שאלות מקלה לקשה בערך, אבל פספסו בגדול כשנשאלו איזה אחוז מהתלמידים יצליח בכל אחת. הידע על התוכן לא מתורגם לידע על הקושי.
לכן מבחנים רציניים לא סומכים על הכותב. בתורת המבחנים הקלאסית (Classical Test Theory), שסוכמה בספרם של לורד ונוביק (Lord & Novick, 1968), לכל פריט יש שני מספרים בסיסיים. הראשון הוא ערך p, החלק של הנבחנים שענו נכון: ככל שהוא גבוה יותר, הפריט קל יותר. השני הוא מדד ההבחנה (Discrimination), בדרך כלל מתאם נקודתי-דו-סדרתי (Point-Biserial) בין הצלחה בפריט לציון הכללי. פריט מבחין הוא פריט שתלמידים חזקים פותרים יותר מתלמידים חלשים. פריט שלא מבחין לא מודד כלום, ולא משנה כמה יפה הוא מנוסח.
תורת התגובה לפריט (Item Response Theory, IRT), שמאחורי מבחנים כמו הפסיכומטרי עצמו, לוקחת את זה צעד קדימה: הקושי וההבחנה של הפריט נאמדים על סולם משותף עם היכולת של הנבחן, כך שהמספרים לא תלויים בקבוצה המסוימת שענתה. המבלטון וג'ונס (Hambleton & Jones, 1993) השוו בין שתי הגישות והסבירו מתי כל אחת מספיקה. המחיר של IRT הוא שהוא צריך הרבה תשובות לכל פריט ומודל שמתאים לנתונים; המחיר של הגישה הקלאסית הוא שהמספרים שלה תלויים במי שענה.
באפליקציות תרגול אדפטיביות התפתחה דרך שלישית, זולה ומתמשכת: דירוג Elo, שבו כל תשובה מעדכנת בו-זמנית את דירוג התלמיד ואת דירוג השאלה (Klinkenberg et al., 2011; Pelánek, 2016). על זה כתבנו במאמר על כלל ה-85%. השאלה הפחות מדוברת היא מה עושים עם התג המקורי של הכותב אחרי שהנתונים מדברים. וזו השאלה שהמאמר הזה עוסק בה.
שלוש דרכים למדוד קושי, ומה כל אחת דורשת
| גישה | מה היא צריכה | מה היא נותנת | איפה אנחנו משתמשים בה |
|---|---|---|---|
| תג של הכותב | אדם אחד ודקה של מחשבה | נקודת פתיחה מיידית לכל שאלה חדשה | יום ראשון של כל שאלה במאגר |
| קלאסית (ערך p, הבחנה) | עשרות תשובות לפריט, מקבוצה מגוונת | קושי ממוצע, ומדד "האם השאלה בכלל מודדת" | הכיול הלילי, ותור הבדיקה של הסטודיו |
| דירוג Elo | זרם מתמשך של תשובות | קושי שמתעדכן כל הזמן, על אותו סולם של התלמיד | בחירת השאלה הבאה בתרגול החכם |
| IRT מלא | מאות תשובות לפריט ומודל מתאים | פרמטרים שלא תלויים בקבוצה | לא כרגע: המאגר שלנו עוד לא שם ברוב הפריטים |
מה בנינו: כיול שרץ בלילה ומציע, לא מחליט
הכיול שלנו הוא תהליך שרץ בצד השרת, לא באפליקציה. הוא עובר על כל התשובות שנרשמו בתרגול, מקבץ אותן לפי שאלה, ומחשב לכל שאלה שלושה דברים.
הראשון הוא הקושי האמפירי. החלק של התשובות הנכונות מתורגם לאותו סולם של חמש רמות שבו הכותבים מתייגים, כך שאפשר להשוות ישירות: הכותב אמר "רמה 2", התלמידים אומרים "רמה 4". את גבולות התרגום נשמור לעצמנו, אבל הכיוון פשוט: ככל שיותר תלמידים נכשלים, השאלה מטפסת בסולם.
השני הוא זמן התגובה החציוני. אנחנו לוקחים חציון ולא ממוצע, כי תלמיד אחד שהשאיר את הטלפון פתוח שעה לא צריך לקבוע כלום. המספר הזה לא נועד לדרג את השאלה, אלא להזין מנגנון אחר: סינון הניחושים המהירים, שעליו כתבנו במאמר על תלמידים סינתטיים. תשובה שהגיעה בזמן קצר בהרבה מהחציון של השאלה הזו ספציפית היא כנראה לא תשובה. שאלת הבנת הנקרא ושאלת אלגברה קצרה לא צריכות את אותו סף, ולכן הסף נגזר מהשאלה, לא מקבוע גלובלי.
השלישי הוא ההבחנה. לכל שאלה עם מספיק תשובות אנחנו מחשבים את המתאם בין הצלחה בה לבין הרמה הכללית של העונים. הבחנה נמוכה היא הדגל האדום החשוב ביותר במערכת, וחשוב לומר מה היא לא אומרת: היא לא אומרת שהשאלה קשה. שאלה קשה ומצוינת נפתרת בעיקר על ידי החזקים, וזו הבחנה גבוהה. הבחנה נמוכה אומרת שהחזקים והחלשים נכשלים באותה מידה, וזה כמעט תמיד סימן לבעיה בשאלה: ניסוח דו-משמעי, שתי תשובות שאפשר להגן עליהן, טעות הקלדה בתשובה הנכונה, או תמונה שלא נטענה במכשירים מסוימים.
למה "מספיק תשובות" זו המילה החשובה
הכיול לא נוגע בשאלה שאין לה מספיק ראיות. שאלה שרק תלמידים בודדים פתרו יכולה להיראות "קלה" רק כי במקרה שלושת החזקים בכיתה פגשו אותה ראשונים. לכן יש סף מינימלי של תשובות, ומתחתיו השאלה נשארת עם התג של הכותב, נקודה. את הסף עצמו לא נפרסם, אבל הוא בסדר גודל של עשרות, לא של יחידות ולא של אלפים. זה הפשרה בין תורת המבחנים הקלאסית, שרוצה מדגם מגוון, לבין המציאות של מאגר שבו הרבה שאלות עוד לא ראו הרבה תלמידים.
יש כאן גם עניין של הוגנות כלפי הפריט. במאמר על תקציב שאלות-האמת הסברנו שאנחנו מגישים שאלות ממבחני עבר בקמצנות, פעם אחת לכל תלמיד. המשמעות היא שדווקא השאלות הכי חשובות במאגר צוברות ראיות לאט. הכיול צריך להיות סבלני איתן, ולא להסיק מסקנות מהחודש הראשון.
מה טעינו בדרך: כשהתחלנו לבנות את הכיול גילינו שלרוב השאלות במאגר לא היה בכלל תיעוד של המקור: האם זו שאלה ממבחן עבר, שאלה שכתב צוות זינוק, או שאלה שנוצרה בעזרת מודל שפה. בלי השדה הזה אי אפשר לכייל נכון, כי לכל מקור יש תפקיד אחר במנוע. הפיתוי היה לתת ערך ברירת מחדל לכולן ולהמשיך. סירבנו: תיוג שגוי של שאלת צוות כשאלת מבחן היה "שורף" אותה כמשאב נדיר שהוא בכלל לא נדיר, ותיוג הפוך היה מגיש שאלת מבחן אמיתית כתרגיל יומי. במקום ברירת מחדל, תייגנו אוטומטית רק את המקרים החד-משמעיים והשארנו את השאר לסיווג ידני בסטודיו. זה איטי יותר. זה גם נכון יותר.
למה הכיול עדיין רק מציע
נכון לכתיבת שורות אלה, הכיול רץ במצב הצעה בלבד: הוא מחשב, מדווח, ולא כותב שום דבר למאגר בעצמו. כדי ששאלה תשנה רמה, מישהו צריך לאשר את ההצעה. זה לא חוסר אמון בסטטיסטיקה. זה הכרה בשלושה דברים.
ראשית, שינוי רמה של שאלה משנה למי היא תוגש מחר. שאלה שקפצה מ"קלה" ל"קשה" תיעלם מתלמידים מתחילים ותופיע אצל המתקדמים, ואם הקפיצה נבעה מתמונה שבורה ולא מקושי אמיתי, המתקדמים יקבלו שאלה שבורה. תיקון של השאלה עדיף על תיוג מחדש שלה.
שנית, אנחנו לא מוחקים את התג של הכותב. הקושי האמפירי נשמר לצד המקורי, עם סימון של המקור, כך שתמיד אפשר לשאול "מה חשב הכותב ומה חשבו התלמידים" ולראות איפה הפער הכי גדול. הפערים האלה הם בעצמם משוב לכותבי השאלות, והם מעניינים יותר מכל ממוצע.
שלישית, זה אותו עיקרון שמלווה את כל קורס פסיכומטרי בזינוק: שינוי במנוע עובר קודם דרך בדיקה, ורק אחר כך דרך תלמידים. המצב "מציע ולא מחליט" הוא השלב שבו אנחנו משווים את ההצעות של הכיול לשיפוט אנושי, ורק כשנראה שהן מסכימות ברוב המקרים, וששאר המקרים הם באמת שאלות שבורות, נאפשר לו לכתוב בעצמו.
טעויות נפוצות בכיול פריטים
- לבלבל קושי עם הבחנה. שאלה שרוב התלמידים נכשלים בה יכולה להיות מצוינת (אם החזקים מצליחים) או שבורה (אם כולם נכשלים באותה מידה). ערך p לבד לא מבדיל ביניהן. צריך את שני המדדים.
- לכייל על מדגם מוטה. אם שאלה מוגשת רק לתלמידים מתקדמים, החלק שענו נכון גבוה באופן מלאכותי. תרגול אדפטיבי מייצר בדיוק את ההטיה הזו, ולכן אנחנו קוראים את הקושי הקלאסי בזהירות, ומשלימים אותו עם דירוג Elo שמביא בחשבון מי ענה.
- לתת לממוצע זמן לספר את הסיפור. זמני תגובה הם התפלגות עם זנב ארוך מאוד ימינה. ממוצע אחד של "עזבתי את האפליקציה פתוחה" הורס אותו. חציון לא מתרגש.
- למחוק את שיפוט הכותב. התג המקורי הוא ראיה. חלשה, אבל ראיה, ובעיקר היא ההשוואה היחידה שיש לשאלה חדשה שעוד לא צברה תשובות.
- לפרוש שאלה בגלל מספר. הבחנה נמוכה היא הזמנה לבדיקה אנושית. ברוב המקרים התיקון הוא ניסוח, לא מחיקה, ואת השאלה המתוקנת כדאי לכייל מחדש מאפס.
מה זה אומר עליכם, התלמידים
- "קשה" הוא סטטיסטיקה, לא גזר דין. תג הקושי אומר איזה חלק מהתלמידים נכשל. הוא לא אומר שאתם תיכשלו, ולא שיש בשאלה משהו שאי אפשר ללמוד. שאלה קשה עם הבחנה גבוהה היא בדיוק השאלה שמבדילה בין ציון טוב לציון מצוין.
- הזמן שלכם הוא מידע. אם שאלה "קלה" לוקחת לכם פי שלושה מהרגיל, זה הסימן הכי טוב שאתם פותרים אותה בדרך הארוכה. חפשו את הדרך הקצרה בפתרון, לא בתשובה.
- אל תנחשו מהר כדי "להתקדם". תשובה שניתנה מהר מדי ביחס לשאלה לא נספרת, גם אם היא נכונה. היא לא עוזרת לדירוג שלכם, ולא לכיול של השאלה.
- שאלה שנראית לכם שבורה, כנראה שבורה. אם שתי תשובות נראות נכונות או שהניסוח לא ברור, אתם לא לבד: זו בדיוק השאלה שהמערכת תסמן. ספרו לנו, זה מקצר את הדרך לתור הבדיקה.
- ללומד עצמאי: אפשר לכייל גם עם עיפרון. סמנו ליד כל שאלה שפתרתם כמה זמן לקחה, והאם טעיתם. אחרי חודש, השאלות שלקחו הכי הרבה זמן ובכל זאת נפתרו נכון הן לא הבעיה שלכם. הבעיה היא השאלות שנפתרו מהר ולא נכון.
כיול פריטים הוא החלק השקט של המנוע האדפטיבי: הוא לא בוחר שאלות ולא נותן נקודות, הוא רק דואג שהתגים שכל השאר מסתמכים עליהם יהיו אמיתיים. איך המנוע משתמש בתגים האלה כדי לבחור את השאלה הבאה? במאמר על כלל ה-85%. ואיך הוא משקלל תשובה משיעורי הבית מול תשובה בתרגול החכם? במאמר על שקלול ראיות. לשאר המאמרים: המעבדה של זינוק.
שאלות ותשובות
מי קובע את רמת הקושי של שאלה באפליקציה של זינוק?
בהתחלה מי שכתב או הקליד את השאלה. אחרי שמספיק תלמידים ענו עליה, כיול לילי מחשב קושי אמפירי מתוך חלק העונים נכון, ומציע אותו לצד התג המקורי. נכון להיום ההצעה עוברת אישור אנושי לפני שהיא משנה משהו.
מה ההבדל בין שאלה קשה לשאלה שבורה?
בשתיהן רוב התלמידים נכשלים. בשאלה קשה, התלמידים החזקים מצליחים יותר מהחלשים (הבחנה גבוהה). בשאלה שבורה כולם נכשלים באותה מידה (הבחנה נמוכה), וזה כמעט תמיד סימן לניסוח דו-משמעי, תשובה שגויה במפתח או תמונה שלא נטענה.
למה משתמשים בחציון של זמן התגובה ולא בממוצע?
כי זמני תגובה הם התפלגות עם זנב ארוך: תלמיד אחד שהשאיר את האפליקציה פתוחה שעה מזיז ממוצע, אבל לא חציון. החציון לכל שאלה משמש בעיקר לזיהוי ניחושים מהירים, שלא נספרים כתשובות.
האם הכיול מוחק את התג שנתן הכותב?
לא. הקושי האמפירי נשמר לצד התג המקורי, עם סימון של מקור הערך. הפער בין השניים הוא בעצמו משוב לכותבי השאלות.
מה קורה לשאלה שרק מעט תלמידים ענו עליה?
כלום. מתחת לסף מינימלי של תשובות השאלה נשארת עם התג של הכותב, כי מדגם קטן יכול להטעות: אם במקרה רק תלמידים חזקים פגשו אותה, היא תיראה קלה.
מה זה IRT ולמה לא משתמשים בו לכל השאלות?
תורת התגובה לפריט (Item Response Theory) אומדת קושי והבחנה על סולם משותף עם יכולת הנבחן, ולכן המספרים לא תלויים בקבוצה שענתה. היא דורשת מאות תשובות לכל פריט, ורוב השאלות במאגר תרגול עוד לא הגיעו לשם. לכן משלבים מדדים קלאסיים עם דירוג Elo שמתעדכן מכל תשובה.
מקורות
- Isaac I. Bejar (1983). Subject matter experts' assessment of item statistics. doi.org/10.1177/014662168300700307
- Impara & Plake (1998). Teachers' ability to estimate item difficulty: A test of the assumptions in the Angoff standard setting method. doi.org/10.1111/j.1745-3984.1998.tb00528.x
- Lord & Novick (1968). Statistical Theories of Mental Test Scores. scholar.google.com/scholar?q=Lord+Novick+1968+Statistical+Theories+of+Mental+Test+Scores
- Hambleton & Jones (1993). Comparison of classical test theory and item response theory and their applications to test development. doi.org/10.1111/j.1745-3992.1993.tb00543.x
- Wise & Kong (2005). Response time effort: A new measure of examinee motivation in computer-based tests. doi.org/10.1207/s15324818ame1802_2
- Radek Pelánek (2016). Applications of the Elo rating system in adaptive educational systems. doi.org/10.1016/j.compedu.2016.03.017