תראו, רובנו רגילים לראות בבינה מלאכותית סוג של עוזר אישי חכם. אנחנו שואלים שאלה, והיא פולטת תשובה תוך שניות. אבל מה שקרה במשרדי OpenAI בשבועות האחרונים מסמן שינוי דרמטי בדרך שבה המכונות האלה עובדות. החברה חשפה כי המודל החדש שלה, שזכה לשם הקוד o1, הצליח לעשות משהו שגרם גם למתמטיקאים ותיקים להרים גבה. הוא ניגש למבחן ה-AIME, מבחן הזמנה יוקרתי למתמטיקה המיועד לתלמידי תיכון מצטיינים בארה"ב, ופשוט "פירק" אותו עם ציון מושלם.
חשוב להבין שלא מדובר בסתם עוד מבחן עם שאלות אמריקאיות פשוטות. ה-AIME הוא שלב מסנן בדרך לאולימפיאדת המתמטיקה, והשאלות בו דורשות יצירתיות, הבנה עמוקה ויכולת לפתור בעיות מורכבות בכמה שלבים. המודל החדש לא רק עבר את המבחן, אלא פתר נכון 15 מתוך 15 שאלות. כדי לסבר את האוזן, הגרסאות הקודמות של המודלים, אלו שכולנו מכירים כמו GPT-4o, הצליחו לפתור בממוצע רק כ-12% מהשאלות האלה. מדובר בקפיצת מדרגה שהיא לא פחות ממדהימה.
הסוד שמאחורי הקלעים: למה המחשב פתאום "חושב"?
אז מה בעצם השתנה כאן? הרי המחשב הוא עדיין מחשב. אגב, התשובה נעוצה בשיטה חדשה ש-OpenAI קוראת לה "שרשרת מחשבה". אם עד היום המודלים היו פשוט יורים את המילה הבאה שנראית להם הכי סבירה מבחינה סטטיסטית, המודל החדש למד לעצור רגע לפני שהוא עונה. הוא לוקח לעצמו זמן, "חושב" על הבעיה, מנסה כיווני פתרון שונים, ואם הוא מגלה שהוא טעה בדרך, הוא חוזר אחורה ומתקן את עצמו.
התהליך הזה מזכיר מאוד את הדרך שבה אנחנו, בני האדם, ניגשים לבעיה קשה. אנחנו לא פשוט פולטים תשובה, אלא משרבטים על דף, מוחקים, מנסים שוב ובסוף מגיעים לתוצאה. כשהמודל של OpenAI ניגש למבחן המתמטיקה הזה, הוא הציג יכולת ניתוח שהציבה אותו באחוזון ה-500 העליון של המתמודדים בארצות הברית. זה אומר שהוא מתפקד ברמה של תלמידי המתמטיקה הטובים ביותר במדינה, וכל זה קורה בתוך מעבד סיליקון.
השימוש בטכנולוגיה הזו לא מוגבל רק למספרים ומשוואות. היכולת הזו "לחשוב" לפני שמדברים הופכת את המודל להרבה יותר אמין. ב-OpenAI מספרים שהמודל הזה פחות נוטה ל"הזיות", אותן טעויות מפורסמות שבהן הבינה המלאכותית ממציאה עובדות בביטחון עצמי מופרז. הפעם, המודל בודק את עצמו תוך כדי תנועה, מה שהופך אותו לכלי עבודה עוצמתי עבור מדענים, מתכנתים ואנשים שזקוקים לדיוק מקסימלי.
מהמעבדה לחיים האמיתיים: מה זה אומר עלינו?
רבים מאיתנו משתמשים ביום-יום בכלי המוכר צ'אט גיפיטי כדי לכתוב מיילים או לסכם מאמרים, אבל המעבר למודלים שמסוגלים לפתור בעיות ברמה של אולימפיאדה משנה את כללי המשחק. דמיינו חוקר סרטן שיכול להיעזר במודל כזה כדי לנתח רצפים גנטיים מורכבים, או מהנדס שצריך לבדוק קוד תוכנה קריטי למערכת של מטוס. המודל החדש לא רק נותן תשובות, הוא מסביר את הדרך ומראה איך הוא הגיע למסקנה, מה שמאפשר לבני האדם שעובדים איתו לבקר את התהליך וללמוד ממנו.
במהלך הבדיקות של OpenAI, המודל נבחן לא רק במתמטיקה אלא גם בתחומי המדעים והתכנות. בבחינת ה-Codeforces, תחרות תכנות פופולרית ברשת, הוא הגיע לאחוזון ה-89. זה הישג שמשאיר מאחור לא רק את רוב המתכנתים המתחילים, אלא גם לא מעט מומחים בתחום. היכולת לפצח בעיות לוגיות כאלה מעידה על כך שהבינה המלאכותית מפסיקה להיות רק "מנוע חיפוש משוכלל" והופכת לשותפה אמיתית לפתרון בעיות.
מה שמעניין במיוחד הוא שהחברה החליטה להנגיש את היכולות האלה בהדרגה. הם מבינים שיש כאן כוח עצום, והם רוצים לוודא שהשימוש בו נעשה בצורה בטוחה. המודל הזה יודע לזהות מתי הוא נשאל שאלות שעלולות להיות מסוכנות או לא אתיות, ובזכות תהליך ה"חשיבה" הפנימי שלו, הוא מצליח לסנן בקשות כאלה בצורה הרבה יותר יעילה מהדורות הקודמים.
המוח הדיגיטלי כבר כאן, והוא לא מפסיק ללמוד
אתם חייבים להודות שיש משהו קצת מרתיע בלחשוב על תוכנת מחשב שמקבלת 100 במבחן שרובנו היינו נכשלים בו כבר בשאלה הראשונה. אבל אם נסתכל מעבר לחשש הראשוני, יש כאן בשורה אדירה. אנחנו נכנסים לתקופה שבה המכונה הופכת להיות סוג של "מוח נוסף" שעומד לרשותנו. זה לא שהיא הולכת להחליף את היצירתיות האנושית, אלא שהיא הולכת לשחרר אותנו מהחלקים הסיזיפיים והקשים של פתרון בעיות טכניות.
התובנה הכי חשובה מהמהלך הזה של OpenAI היא שהבינה המלאכותית לומדת להיות סבלנית. הריצה המטורפת אחרי התשובה המהירה ביותר מתחלפת בחיפוש אחרי התשובה הנכונה ביותר. בסופו של דבר, היכולת של המכונה לעצור, לחשוב ולתקן את עצמה היא תכונה מאוד "אנושית", ודווקא בגלל זה היא כל כך מרגשת. אנחנו כבר לא מדברים על העתיד, אנחנו חיים אותו, והגאון החדש בכיתה רק מחכה שניתן לו את האתגר הבא.







