למה מודלי שפה "ממציאים" עובדות ואיך אפשר להפחית את זה?

מחקר חדש של OpenAI חושף: מערכות בינה מלאכותית נוטות לנחש במקום להודות בחוסר ודאות, והפתרון עשוי להגיע מהאופן שבו אנחנו מדרגים אותן
למה מודלי שפה ממציאים עובדות ואיך אפשר להפחית את זה

האם שמעתם פעם על "הלוצינציות" של בינה מלאכותית? מדובר בתופעה שבה מודל שפה מספק תשובה שנשמעת נכונה ובטוחה, אבל למעשה שגויה לחלוטין. מחקר חדש של OpenAI, שפורסם ב-5 בספטמבר, מתמודד עם השאלה מדוע זה קורה, ומציע כיוון לשינוי עמוק באופן שבו אנו מאמנים ומעריכים מערכות AI, תופעה שמוכרת היטב גם למשתמשים בצאט גיפיטי.

מהן בעצם הלוצינציות?

הלוצינציה, במונחי AI, היא תשובה שנשמעת אמינה אך אינה נכונה. זה יכול להיות פריט מידע שגוי לחלוטין או תאריך מומצא. החוקרים נותנים דוגמה: כאשר שאלו מודל בינה מלאכותית מהו נושא הדוקטורט של אחד ממחברי המאמר, הוא נתן שלוש תשובות שונות כאשר כולן לא נכונות. אפילו את יום ההולדת שלו לא הצליח למסור כראוי.

למה זה קורה?

לפי OpenAI, הבעיה נעוצה באיך שמודלים מאומנים ונמדדים. רוב מערכות ההערכה הקיימות מתגמלות "ניחוש נכון" ומענישות הודאה ב"אני לא יודע". כמו במבחן אמריקאי: ניחוש אקראי יכול להקנות נקודות, בעוד שתשובה ריקה תבטיח אפס. לכן, מודלים "לומדים" לנחש גם כשהם לא בטוחים.

במבחני SimpleQA למשל, נמצא שמודל ישן יותר של OpenAI (o4-mini) השיג דיוק מעט גבוה יותר מהמודל החדש gpt-5-thinking-mini, אך במחיר עצום של טעויות שגויות. במילים אחרות: הוא "נשמע" חכם יותר, אבל פיזר יותר טעויות בטוחות בעצמן.

שינוי כללי המשחק בהערכה

ב-OpenAI מציעים גישה אחרת: להעניש טעויות בטוחות יותר מאשר הודאות בחוסר ודאות, ואפילו לתת קרדיט חלקי כאשר מודל אומר "אני לא יודע". המודל, לטענתם, צריך להפגין ענווה, ערך שמוגדר כחלק מה-Model Spec של החברה.

הגישה הזו מזכירה מבחנים סטנדרטיים שבהם יש "ענישה שלילית" על טעויות כדי למנוע ניחושים עיוורים. אם השינוי הזה יוטמע בהערכות הרשמיות, מערכות AI יתחילו להתאים עצמן להתנהגות זהירה יותר, ופחות ייטו להמציא עובדות.

מקורות ההלוצינציות

השורש נעוץ בשיטת האימון הראשונית של המודלים: ניבוי המילה הבאה. בשלב הזה, המודל נחשף לטקסטים רבים ומנסה לשחזר דפוסים, אך אין לו סימון שמבדיל בין עובדה נכונה לבין עובדה שגויה. לכן, במידע נדיר או אקראי, כמו למשל תאריכי ימי הולדת, המערכת פשוט "תנחש".

לעומת זאת, בתחומים עם כללים עקביים, כמו כתיב נכון או סוגריים מותאמים, המודלים כמעט לא טועים. כאן אפשר להבין למה הם ממציאים פרטים ביוגרפיים אבל כמעט לא טועים בחוקי דקדוק.

מיתוסים מול ממצאים

המאמר מפרק כמה תפיסות רווחות:

  • מיתוס: אם נגיע ל-100% דיוק, ההלוצינציות ייעלמו.
    ממצא: לעולם לא נגיע ל-100% כי חלק מהשאלות אינן פתירות.

  • מיתוס: הלוצינציות הן בלתי נמנעות.
    ממצא: מודלים יכולים פשוט להימנע מתשובה כאשר אינם בטוחים.

  • מיתוס: רק מודלים ענקיים יכולים להתמודד עם התופעה.
    ממצא: לעיתים דווקא מודלים קטנים יותר יודעים להודות במגבלותיהם.

  • מיתוס: זו "תקלה מסתורית".
    ממצא: זהו מנגנון סטטיסטי ברור, שמתחזק בגלל אופן הדירוג.

המשמעות למשתמשים ולעתיד ה-AI

עבור הציבור הרחב, המחקר מזכיר לנו שלא כדאי לסמוך בעיניים עצומות על כל תשובה שמגיעה מצ'אטבוט AI, טוב ופופולרי ככל שיהיה. גם המערכות המתקדמות ביותר עלולות להמציא מידע בטון בטוח. מצד שני, עצם העובדה שחברות כמו OpenAI מבקשות לחשוף את המנגנונים ולעדכן את שיטות ההערכה מצביעה על שינוי כיוון חשוב: מעבר ממדידה של "צדק או טעות" למדידה של "אחריות וזהירות".

במילים פשוטות, העתיד של כלי בינה מלאכותית לא תלוי רק בכמה תשובות נכונות המודל יודע לתת, אלא גם ביכולת שלו לומר "אני לא בטוח". ייתכן שהאמירה הזו תהיה המבחן האמיתי לאמון הציבור בבינה מלאכותית.