למה תשובה נכונה שווה יותר מטעות: הא-סימטריה של הלמידה תוך כדי מדידה

המעבדה של זינוק · מדע הלמידה

ב-Elo של השחמט, ניצחון והפסד שווים בגודלם. אבל תלמיד הוא לא שחקן: כל שאלה שהוא פותר גם מלמדת אותו, וכל וי בשאלה עם ארבע תשובות הוא חלקית מזל. על אפקט הבחינה (Roediger & Karpicke), רצפת הניחוש (Lord), ניקוד נוסחה (Frary, Budescu & Bar-Hillel), ושני התיקונים שהחליפו את העדכון הסימטרי במנוע שלנו.

✍️ יותם אושר 29 בספטמבר 2026 ⏱ 7 דקות קריאה

שני תלמידים פותרים את אותה שאלת היגיון. הראשון עונה נכון, השני טועה. כמה צריך הדירוג של הראשון לעלות, וכמה צריך הדירוג של השני לרדת? התשובה האינטואיטיבית היא "אותו דבר, רק בכיוון הפוך". ככה עובד דירוג Elo המקורי בשחמט: ניצחון של אחד הוא הפסד של השני, וסכום השינויים הוא אפס.

אבל תלמיד שפותר שאלה הוא לא שחקן שמנצח יריב. השאלה לא "הפסידה". וחשוב מזה: הפעולה עצמה, לענות על שאלה ולראות את הפתרון, משנה את התלמיד. הוא יוצא מהמפגש קצת יותר טוב ממה שנכנס, בין אם צדק ובין אם טעה. דירוג שמתעלם מזה מודד משהו שכבר לא קיים.

המאמר הזה עוסק בשתי החלטות שקטות במנוע הלמידה של קורס פסיכומטרי בזינוק: למה תשובה נכונה מזיזה את הדירוג יותר ממה שטעות מורידה אותו, ולמה תשובה נכונה בשאלה אמריקאית שווה פחות ממה שהיא נראית.

למה באפליקציה של זינוק טעות מורידה את הדירוג פחות ממה שתשובה נכונה מעלה אותו?

כי כל תשובה היא גם מדידה וגם לימוד. תלמיד שטעה וקרא את ההסבר יודע עכשיו יותר ממה שהמדידה שלו מראה, ולכן הירידה מוקטנת. תלמיד שצדק גם התאמן, ולכן העלייה מוגדלת. בנוסף, בשאלה עם ארבע תשובות גם ניחוש עיוור מצליח באחת מארבע, ולכן תשובה נכונה, בייחוד בשאלה קשה, מוכיחה פחות ממה שנדמה. המנוע מחשב את ההסתברות להצלחה מעל רצפת הניחוש הזו, לא מאפס. שתי ההחלטות יחד מייצרות דירוג שעולה בקצב שמשקף למידה אמיתית, ולא נופל בגלל טעות אחת.

מה המדע אומר: המבחן עצמו מלמד

הממצא הבסיסי כאן הוא אחד המבוססים בפסיכולוגיה של הלמידה, ויש לו שם: אפקט הבחינה (Testing Effect). רודיגר וקרפיקי (Roediger & Karpicke, 2006) הראו שסטודנטים שנבחנו על טקסט זכרו אותו אחרי שבוע טוב יותר מסטודנטים שקראו אותו שוב באותו זמן, למרות שקבוצת הקריאה החוזרת הרגישה בטוחה יותר. שליפה מהזיכרון היא לא רק מדידה של הידע, היא אחת הדרכים היעילות ביותר לחזק אותו.

המשמעות למנוע אדפטיבי היא מטרידה: כל שאלה שהמערכת שואלת כדי למדוד את התלמיד משנה את מה שהיא מודדת. פלאנק (Pelánek, 2016), בסקירה על יישומי Elo במערכות חינוכיות, מציין שזה אחד ההבדלים המרכזיים בין דירוג שחמט לדירוג לומדים: יכולת של שחקן יציבה יחסית בין משחקים, ואילו יכולת של לומד אמורה לעלות בכל מפגש, וזו בעצם כל המטרה. מודל שמניח יכולת קבועה ומנסה רק לאמוד אותה מדויק יותר ויותר מפספס את הדבר החשוב.

המשפחה של מודלים שמטפלת בזה נקראת ניתוח גורמי ביצוע (Performance Factors Analysis), ויש לה גרסה שמותאמת ל-Elo. הרעיון פשוט: במקום פרמטר למידה אחד, יש שניים, אחד לתשובה נכונה ואחד לשגויה, והם לא חייבים להיות שווים. תשובה נכונה מעידה על ידע וגם מחזקת אותו, ולכן משקלה כלפי מעלה גדול. תשובה שגויה מעידה על חוסר ידע, אבל ההסבר שאחריה סוגר חלק מהחור, ולכן משקלה כלפי מטה קטן.

הבעיה השנייה: ארבע תשובות ורצפת הניחוש

בפסיכומטרי, כמו ברוב המבחנים האמריקאיים, לכל שאלה ארבע תשובות. תלמיד שלא קרא את השאלה בכלל ובחר באקראי יצדק באחת מארבע פעמים בממוצע. לורד (Lord, 1980) ניסח את זה במודל שלושת הפרמטרים של תורת התגובה לפריט: לכל שאלה יש קושי, הבחנה, ופרמטר שלישי, "רצפת ניחוש", שמתאר את ההסתברות להצליח בה גם בלי שום ידע. עקומת ההסתברות של השאלה לא מתחילה מאפס אלא מהרצפה הזו.

למה זה משנה לדירוג? כי תשובה נכונה בשאלה קשה היא ראיה חלשה יותר ממה שנדמה. אם ההסתברות "האמיתית" של תלמיד לדעת את התשובה היא נמוכה, חלק ניכר מהתשובות הנכונות שלו על שאלות כאלה הן מזל, ודירוג שמתייחס לכל וי כהוכחת ידע ינפח את התלמידים שמנחשים הרבה. מודל שמתחשב ברצפה שואל שאלה אחרת: לא "האם צדקת" אלא "כמה יותר מרצפת הניחוש צדקת".

הדיון על ניחושים במבחנים הוא ותיק ומעניין. פררי (Frary, 1988) סיכם עשורים של ניסיון עם "ניקוד נוסחה", השיטה שמורידה נקודות על טעות כדי לנטרל ניחושים, ובודסקו ובר-הלל (Budescu & Bar-Hillel, 1993) ניתחו אותה מנקודת מבט של תורת ההחלטות והראו שהיא מענישה בעיקר את הנבחנים הזהירים, לא את המנחשים. הפסיכומטרי, אגב, לא מוריד נקודות על טעות, וזו הסיבה שכל מדריך אומר לכם לענות על הכול. אבל מה שנכון למבחן לא נכון לאפליקציה שמנסה ללמוד מה אתם יודעים: שם הניחוש הוא רעש שצריך לנקות מהמדידה, לא אסטרטגיה.

מה בנינו: שני תיקונים בכל עדכון דירוג

מנוע הדירוג שלנו, שתיארנו במאמר על כלל ה-85%, מחזיק דירוג Elo לכל תלמיד בכל ממד ולכל שאלה. בכל תשובה הוא מחשב מה הייתה ההסתברות שהתלמיד יצליח, משווה למה שקרה בפועל, ומזיז את הדירוג לפי הפער. על התשתית הזו יושבים שני תיקונים:

תיקוןמה הוא משנהלמהמאיפה זה מגיע
הסטת ניחושההסתברות הצפויה מחושבת מעל רצפת הניחוש של השאלה, לפי מספר התשובות שלהוי בשאלה קשה מוכיח פחות; ניחוש מוצלח לא מנפח את הדירוגמודל שלושת הפרמטרים (Lord); "גן המתמטיקה" (Klinkenberg)
א-סימטריההצעד כלפי מעלה אחרי הצלחה גדול מהצעד כלפי מטה אחרי טעותכל תשובה גם מלמדת, וטעות שאחריה הסבר סוגרת חלק מהפעראפקט הבחינה (Roediger & Karpicke); ניתוח גורמי ביצוע בגרסת Elo (Pelánek)

שני התיקונים פועלים על אותו עדכון, ובכיוונים שלכאורה סותרים: הראשון מקטין את הערך של תשובה נכונה, השני מגדיל אותו. בפועל הם עונים על שאלות שונות. ההסטה שואלת כמה הראיה אמינה, והא-סימטריה שואלת מה קרה לתלמיד בדרך. תלמיד שצדק בשאלה קלה כמעט לא זז (ההצלחה הייתה צפויה). תלמיד שצדק בשאלה קשה זז הרבה, אבל פחות ממה שהיה זז אילו לא היה ניחוש בעולם. תלמיד שטעה בשאלה קשה כמעט לא זז (הטעות הייתה צפויה), וגם הצעד הקטן הזה מוקטן, כי הוא הרגע קרא הסבר.

הסכום של הכול אינו אפס, וזה בכוונה. דירוג של תלמיד שמתרגל ברצינות אמור לעלות עם הזמן גם אם אחוז ההצלחה שלו נשאר קבוע, כי המערכת נותנת לו שאלות קשות יותר ויותר. הא-סימטריה היא מה שמאפשר לדירוג לעקוב אחרי הלמידה במקום לרדוף אחרי ממוצע שלא זז.

מה החליף את מה: הגרסה הראשונה של מנוע הדירוג שלנו השתמשה בעדכון Elo סימטרי קלאסי, כמו בשחמט: אותו צעד למעלה ולמטה, וההסתברות הצפויה חושבה מאפס, כאילו אין ניחוש. הפונקציה הישנה עדיין קיימת בקוד, מסומנת כמיושנת, כדי שהבדיקות הישנות ימשיכו לרוץ. במעבר לגרסה הנוכחית, שנבנתה לפי סקירת המחקר על Elo חינוכי (Klinkenberg, Pelánek, ניתוח גורמי ביצוע), החלפנו את שני הדברים יחד: הסטת ניחוש לפי מספר התשובות בשאלה, וצעד א-סימטרי. אלה לא שני שיפורים נפרדים אלא תיקון אחד לאותה טעות מושגית: שהתלמיד הוא שחקן שחמט עם יכולת קבועה, ושכל וי הוא הוכחה.

למה לא פשוט להתעלם מטעויות

אם טעות מלמדת, למה בכלל להוריד את הדירוג אחריה? כי המדידה עדיין צריכה להיות כנה. תלמיד שטועה שוב ושוב בשאלות ברמה מסוימת לא נמצא ברמה הזו, ודירוג שלא יורד לעולם יגרור אותו לשאלות שהוא לא מסוגל לפתור, בניגוד גמור לכלל ה-85% שהמנוע כולו בנוי סביבו. הא-סימטריה מקטינה את הצעד כלפי מטה, היא לא מבטלת אותו. עם מספיק טעויות הדירוג יורד, וזה מה שאמור לקרות.

יש כאן גם צד פסיכולוגי, שכתבנו עליו במאמר על גיימיפיקציה אתית: ירידה חדה בדירוג אחרי טעות אחת מלמדת תלמידים להימנע משאלות בגבול היכולת, בדיוק השאלות שמהן לומדים. אבל חשוב לומר בבירור: הא-סימטריה לא נבנתה כדי שהתלמיד ירגיש טוב. היא נבנתה כי היא מודל נכון יותר של מה שקורה. העובדה שהיא גם פחות מלחיצה היא תוצאה, לא מטרה.

טעויות נפוצות בעדכון דירוג לומדים

  • להעתיק את Elo מהשחמט כמו שהוא. שחמט הוא משחק סכום אפס בין שני שחקנים עם יכולת יציבה. תרגול הוא מפגש בין לומד שמשתנה לשאלה שלא משתנה. הנוסחה עובדת, ההנחות לא.
  • לספור כל וי כהוכחה. בשאלה עם ארבע תשובות, חלק מהוויים הם מזל. מודל שלא מתחשב ברצפת הניחוש מנפח את מי שמנחש הרבה ומעניש את מי שמשאיר שאלה ריקה.
  • לתקן ניחוש על ידי ניקוד שלילי. זה מה שניקוד נוסחה עושה, ומחקר של עשורים מראה שהוא מודד בעיקר נטייה לסיכון. התיקון שייך למודל ההסתברות, לא לעונש.
  • לאפס את הירידה לגמרי. דירוג שרק עולה הוא לא מדידה, הוא מונה. הוא ישלח תלמידים לשאלות שהם לא מסוגלים לפתור ויהרוס את רמת האתגר.
  • לכוון את הא-סימטריה לפי תחושה. הפער בין הצעד למעלה ולמטה הוא פרמטר שנבדק בסימולציות, כמו שתיארנו במאמר על תלמידים סינתטיים. פער גדול מדי מנפח, פער קטן מדי לא עוקב אחרי הלמידה.

מה זה אומר עליכם, התלמידים

  1. טעות אחת לא שוברת כלום. הצעד למטה אחרי טעות קטן במכוון, ובשאלה קשה הוא כמעט אפס. מה שמזיז את הדירוג למטה זה דפוס של טעויות, לא טעות.
  2. קראו את ההסבר גם כשצדקתם. הא-סימטריה מניחה שאחרי כל שאלה למדתם משהו. זה נכון רק אם ההסבר נקרא. וי שנלחץ ומיד הלאה הוא מדידה בלי לימוד.
  3. ניחוש מוצלח לא עוזר לכם באפליקציה. המערכת מחשבת כמה מהוויים שלכם צפויים להיות מזל, ותשובה מהירה מדי בכלל לא נספרת. באפליקציה, ניחוש הוא בזבוז של שאלה. במבחן עצמו, לעומת זאת, תמיד ענו על הכול: שם אין הורדת נקודות.
  4. שאלה שנראית "קלה מדי" היא בסדר. אם צדקתם בה, הדירוג כמעט לא זז, כי זה היה צפוי. היא שם כדי לשמור על רצף ולבנות שטף, לא כדי למדוד. תשובה נכונה ומהירה שם היא בדיוק מה שהיא נראית.
  5. ללומד עצמאי: אם אתם עוקבים אחרי אחוזי הצלחה בעצמכם, ספרו בנפרד שאלות שידעתם ושאלות שניחשתם וצדקתם. הקטגוריה השנייה שייכת לרשימת "לחזור על זה", לא לרשימת ההצלחות.

הא-סימטריה והסטת הניחוש הן שתיים משלוש התוספות בגרסה הנוכחית של מנוע הדירוג. השלישית, שקובעת כמה גדול יהיה כל צעד לפי כמה המערכת בטוחה בדירוג, מוסברת במאמר על מה המערכת יודעת שהיא לא יודעת. ולמה תשובה נכונה ואיטית לא נחשבת לשליטה, במאמר על שטף. לשאר המאמרים: המעבדה של זינוק.

שאלות ותשובות

למה טעות מורידה את הדירוג פחות ממה שתשובה נכונה מעלה אותו?

כי כל תשובה היא גם מדידה וגם לימוד. תלמיד שטעה וקרא את ההסבר יודע עכשיו יותר ממה שהמדידה מראה, ולכן הצעד למטה מוקטן. תלמיד שצדק גם התאמן, ולכן הצעד למעלה מוגדל. זה מודל נכון יותר של מה שקורה, לא ויתור.

האם ניחוש מוצלח מעלה את הדירוג?

פחות ממה שנדמה. בשאלה עם ארבע תשובות, ההסתברות הצפויה להצלחה מחושבת מעל רצפת ניחוש של אחת מארבע, ולכן וי בשאלה קשה הוא ראיה חלשה יותר. ותשובה שהגיעה מהר מכדי לקרוא את השאלה לא נספרת בכלל.

האם כדאי לנחש בפסיכומטרי עצמו?

כן, תמיד. במבחן הפסיכומטרי אין הורדת נקודות על טעות, ולכן שאלה ריקה היא הפסד ודאי. באפליקציה, לעומת זאת, ניחוש הוא רעש שמבזבז שאלה ולא עוזר לדירוג. שני הכללים לא סותרים: אחד מדבר על ציון, השני על מדידה.

למה לא להתעלם מטעויות לגמרי?

כי המדידה צריכה להישאר כנה. תלמיד שטועה שוב ושוב ברמה מסוימת לא נמצא ברמה הזו, ודירוג שלא יורד ישלח אותו לשאלות שהוא לא מסוגל לפתור, בניגוד לכלל ה-85%. הצעד למטה קטן יותר, הוא לא אפס.

מה זה ניקוד נוסחה ולמה לא משתמשים בו?

שיטה ותיקה שמורידה נקודות על טעות כדי לנטרל ניחושים. מחקר של עשורים (Frary; Budescu & Bar-Hillel) מראה שהיא מודדת בעיקר נטייה לסיכון: הזהירים משאירים ריק ונפגעים. התיקון הנכון לניחוש שייך למודל ההסתברות, לא לעונש.

האם הדירוג יכול לעלות גם אם אחוז ההצלחה שלי קבוע?

כן, וזו הכוונה. המערכת נותנת שאלות קשות יותר ככל שמתקדמים, ולכן אחוז הצלחה קבוע על שאלות קשות יותר הוא למידה. עדכון א-סימטרי הוא מה שמאפשר לדירוג לעקוב אחרי הלמידה במקום לרדוף אחרי ממוצע שלא זז.

מקורות

  1. Roediger & Karpicke (2006). Test-enhanced learning: Taking memory tests improves long-term retention. doi.org/10.1111/j.1467-9280.2006.01693.x
  2. Frederic M. Lord (1980). Applications of Item Response Theory to Practical Testing Problems. scholar.google.com/scholar?q=Lord+1980+Applications+of+Item+Response+Theory+to+Practical+Testing+Problems
  3. Robert B. Frary (1988). Formula scoring of multiple-choice tests (correction for guessing). doi.org/10.1111/j.1745-3992.1988.tb00434.x
  4. Budescu & Bar-Hillel (1993). To guess or not to guess: A decision-theoretic view of formula scoring. doi.org/10.1111/j.1745-3984.1993.tb00436.x
  5. Klinkenberg, Straatemeier & van der Maas (2011). Computer adaptive practice of Maths ability using a new item response model for on the fly ability and difficulty estimation. doi.org/10.1016/j.compedu.2011.02.003
  6. Radek Pelánek (2016). Applications of the Elo rating system in adaptive educational systems. doi.org/10.1016/j.compedu.2016.03.017
→ לכל מאמרי המעבדה
רוצים לקבל עוד מידע
על הקורסים של זינוק?

תשאירו פרטים ויועץ שלנו יחזור אליכם במהירות הזינוק!

דילוג לתוכן
יש לכם שאלה?עונים כאן בוואטסאפ
זינוק בתי ספר בע"מ · ח.פ 514163641 · מדיניות ביטול עסקה · תנאי שימוש
זינוק - קורס פסיכומטרי והקלות בפסיכומטרי
מידע על פרטיות

אנחנו משתמשים בקוקיז  כדי לשדרג לך את החוויה באתר, להתאים לך תוכן ולבדוק מה עובד הכי טוב. אפשר לנהל העדפות או לקרוא עוד ב־מדיניות הפרטיות