האם מודלים פתוחים מסוכנים יותר? OpenAI בדקה את התרחיש הכי קיצוני

ניסוי מבוקר שנחשף כעת: החברה דחפה בכוונה מודל קוד פתוח לקצה היכולת בתחום הביולוגי והסייבר כדי להבין עד כמה הוא באמת מסוכן. התוצאה הפתיעה
האם מודלים פתוחים מסוכנים יותר? OpenAI בדקה את התרחיש הכי קיצוני

שאלה שמרחפת בשנים האחרונות מעל עולם הבינה המלאכותית חוזרת שוב למרכז הבמה. האם פרסום של מודלים פתוחים מהווה סכנה ממשית לביטחון הציבור? האם שחרור הקוד מאפשר לשחקנים זדוניים למנף את המודלים לצרכים מסוכנים כמו פיתוח נשק ביולוגי או פריצות סייבר?

במאמר חדש שפורסם בשבוע שעבר (5 באוגוסט) חושפת OpenAI – מפתחת ChatGPT, ניסוי יוצא דופן, שבמסגרתו ניסתה החברה לדמות את התרחיש הגרוע ביותר. היא לקחה את gpt-oss, מודל שפותח בקוד פתוח, ואימנה אותו באופן יזום לביצועים קיצוניים בשני תחומים רגישים: ביולוגיה וסייבר.

המטרה לא הייתה להוכיח שהמודל בטוח, אלא לבחון כמה רחוק הוא יכול להגיע אם מישהו ינסה לדחוף אותו לשם.

מקרה קצה ביולוגי

כדי לבדוק את הפוטנציאל הביולוגי של gpt-oss, החוקרים יצרו סביבת אימון ייחודית. הם קיבצו משימות שמדמות יצירת איומים ביולוגיים, ונתנו למודל גישה לדפדפן אינטרנט בתוך סביבה מבוקרת של למידת חיזוק (RL). כלומר, המודל לא רק קרא מידע, אלא גם פעל, למד, ושיפר את ביצועיו לאורך זמן.

התוצאה הייתה מדידה. gpt-oss הצליח לשפר במעט את יכולותיו בתחום, אך עדיין לא הגיע לרמה שמסכנת את הציבור או מתקרבת למודלים סגורים רבי עוצמה כמו OpenAI o3. זהו מודל שבאופן מוצהר עדיין לא הגיע לרמת "Preparedness High", הרף שבו החברה מתחילה לשקול מגבלות חמורות יותר.

פריצה עם קוד פתוח

במקביל, נערכה סדרת ניסויים בסביבת קודינג הדומה לאירועי Capture the Flag, שבהם נבדקות יכולות פריצה והגנה על מערכות. המודל עבר תהליך "כיוונון זדוני" (Malicious Fine-Tuning) שמטרתו הייתה לחלץ ממנו את מקסימום היכולות ההתקפיות האפשריות.

גם כאן, התמונה הייתה מורכבת. gpt-oss הצליח להתמודד עם אתגרים טכניים מורכבים, אך רמתו נותרה נמוכה בהשוואה למודלים סגורים. הוא אמנם שיפר את רמת הביצועים שלו לעומת מצב הבסיס, אך לא הגיע לפריצת דרך.

אז למה לפרסם בכלל?

בעולם שבו שחרור של מודל AI בקוד פתוח עלול להיראות כהפקרות, הבחירה של OpenAI לפרסם את gpt-oss עשויה להיראות תמוהה. אך לטענת החברה, דווקא הניסוי הקיצוני חיזק את ההחלטה.

על פי המאמר, גם לאחר אימון אגרסיבי בתחומים מסוכנים, המודל הפתוח לא הצליח להתקרב לרמות הסיכון של מודלים סגורים מתקדמים. כלומר, הפוטנציאל להזיק קיים, אך הוא רחוק מלהיות ממשי ברמת היכולות הנוכחיות.

מעבר לכך, צוות החוקרים מקווה שהשיטה שפיתחו, תהליך מבוקר של כיוונון זדוני, תהפוך לכלי עזר לחברות ואקדמיה שיבקשו להעריך סיכונים לפני פרסום עתידי של מודלים פתוחים.

העובדה ש-OpenAI בוחרת לפרסם את הכלים שבאמצעותם היא בדקה את הגבולות, היא לא מובנת מאליה. מדובר בהזמנה לשקיפות ואולי גם לנורמות חדשות בתעשייה.

במקום להסתיר או לחשוש, החברה מציעה שיטה אקטיבית להערכת סיכונים: אם רוצים לדעת מהו הנזק האפשרי, צריך לבדוק אותו ישירות. בגבולות בטוחים, כמובן.

האם זה אומר שכל מודל פתוח בטוח לפרסום? ודאי שלא. אך הניסוי הזה מאותת שכאשר יש רצון לחקור ברצינות, גם תרחישים קשים ניתן לבדוק ולנהל באחריות.