הכירו את BrowseComp: מבחן חדש מאתגר את המודלים החזקים בעולם

החברה חושפת מאגר בן 1,266 חידות קשות‑לפיצוח שמודדות עד כמה סוכני בינה מלאכותית יודעים לנווט ברשת ולהוציא פנינים חבויות. המטרה: לקדם פיתוח מודלים עקשנים, יצירתיים ומהימנים יותר.
הכירו את BrowseComp מבחן חדש מאתגר את המודלים החזקים בעולם

BrowseComp – הדור הבא של אתגרי החיפוש

עד היום הסתפק עולם ה‑AI בבנצ’מרקים כמו SimpleQA, שבוחנים שליפת עובדות בודדות. אלא שהמודלים המתקדמים – ובראשם GPT‑4o – כבר “סגרו את הפינה” וגרפו ציונים כמעט מושלמים. BrowseComp נולד בדיוק מהמקום הזה: לאתגר את המודלים במשימות שבהן התשובה קבורה עמוק בין עשרות ומאות אתרים, דורשת חיפוש רב‑שלבי ושילוב רמזים מרובים.

איך בונים מבחן בלתי אפשרי?

צוות המאמנים של OpenAI יצר שאלות הפוכות: תחילה מצאו עובדה אמינה, ואז ניסחו שאלה שמסתירה אותה מאחורי תיאורים עקיפים. לפני שהשאלה נכנסה למאגר, המאמן נדרש לוודא כי:

  1. GPT‑4o, o1 ודגמי חיפוש מוקדמים כשלו במציאת התשובה.

  2. חמשת תוצאות החיפוש הראשונות בגוגל אינן חושפות את הפתרון.

  3. אדם מיומן לא יגיע לתשובה בפחות מעשר דקות.

דוגמאות שמגרדות את המוח

  • דמות קומיקס ששוברת את הקיר הרביעי, הופיעה בפחות מ‑50 פרקים ושואבת השראה מנזירים – התשובה: Plastic Man.

  • מאמר מדעי לפני 2023 שמשלב מסורות תרבות, תהליכים מדעיים וחידושי קולינריה – The Fundamentals of Bread Making.

  • משחק כדורגל בין 1990‑1994 עם ארבעה צהובים ושופט ברזילאי – אירלנד נגד רומניה.

תובנות ראשונות: מודלים מתאמצים – אבל נופלים

OpenAI בחנה חמישה מודלים: GPT‑4o, GPT‑4.5, o1, GPT‑4o עם יכולת דפדוף, וה‑Deep Research – סוכן שנבנה במיוחד לגלישה עקשנית. התוצאות מדברות בעד עצמן:

  • GPT‑4o “עיוור” – 0.6 % דיוק בלבד.

  • הוספת דפדפן מעלה אותו ל‑1.9 % – שיפור מזערי.

  • o1 ללא גלישה אבל עם יכולת הסקה טובה יותר קופץ ל‑9.9 %.

  • Deep Research גונב את ההצגה עם 51.5 %, ועדיין רחוק מפתרון מלא.

הלקח: שילוב בין כלי חיפוש ל‑היגיון אסטרטגי הוא הכרחי, אבל נדרשת גם התמדה – ביצוע עשרות ניסיונות, שינוי ניסוחי חיפוש וסינתזת מקורות.

סקיילינג בזמן אמת: עוד מחשב = יותר תשובות

סוכנים, בשונה ממודלים “רגילים”, יכולים להמשיך לרוץ ולאסוף מידע. OpenAI הראתה שככל שמקצים יותר זמן חישוב (CPU + קריאות רשת), כך קופצת רמת הדיוק. בנוסף, שילוב 64 ריצות במקביל ובחירת “הניחוש הטוב ביותר” העלו את הדיוק ב‑25 % נוספים.

למה זה חשוב לתעשייה?

  • בדיקת עמידות – חברות שרוצות להטמיע סוכנים חייבות לדעת שה‑AI לא יתייאש אחרי שני קליקים.

  • פיתוח כלי מחקר – מוסדות אקדמיים יוכלו למדוד איזה מודל באמת מאתר מאמר נשכח או ציטוט חבוי.

  • הגברת אמון – כשהסוכן מספק ציטוטים ומקורות, המשתמש יכול לוודא שהמידע אמין.

המגבלות והצעדים הבאים

ב‑OpenAI רומזים כי התובנות מ‑BrowseComp יוזנו ישירות לתהליך האימון הבא, כך שהסוכן שכולנו מכירים מצ'אט GPT ילמד לא רק לענות במהירות אלא גם “לצוד” עובדות נדירות ברחבי הרשת – צעד נוסף בדרך לעוזר דיגיטלי שחושב, מחפש ומאמת מידע ברמה אנושית.

BrowseComp אינו משקף את כל צרכי המשתמשים, שכן הוא מתמקד בתשובות קצרות. עם זאת, הוא מציב רף חדש ליכולת התמדה, יצירתיות וסינתזה. OpenAI פתחה את המאגר בקוד פתוח ומזמינה חוקרים לשבור את השיאים – ואולי ליצור סוכנים שיודעים לחפור עוד יותר עמוק ברשת.