חברת OpenAI השיקה השבוע את gpt-oss-safeguard, סדרת דגמים חדשה שנועדה להתמודד עם אחת הבעיות הבוערות בעולם הבינה המלאכותית: שמירה על בטיחות ותוכן אחראי. בניגוד למודלים מסחריים סגורים, החברה הפכה את הדגם החדש לקוד פתוח לחלוטין, כך שכל מפתח או חוקר יוכל להוריד, לשנות ולהתאים אותו לצרכים שלו.
המהלך הזה, שנעשה בשיתוף פעולה עם ארגוני מחקר כמו ROOST ו-SafetyKit, מסמן שינוי כיוון חשוב: העברת השליטה במדיניות הבטיחות – מהמפתח של המודל, אל המשתמשים עצמם.
מה זה בעצם gpt-oss-safeguard?
מדובר בשני דגמים של בינה מלאכותית בשם gpt-oss-safeguard-120b ו-20b, המבוססים על משפחת המודלים הפתוחה של OpenAI שנקראת gpt-oss. שני הדגמים יודעים לנתח טקסטים, תגובות או שיחות שלמות – ולבחון אותן לפי מדיניות בטיחות שמוגדרת על ידי המשתמש עצמו.
כלומר, במקום שמודל יחליט בעצמו מה "נכון" או "לא ראוי", המפתח מגדיר לו את הכללים. למשל, אם פורום משחקים רוצה לזהות הודעות שעוסקות ברמאות במשחק, או אתר ביקורות רוצה לסנן חוות דעת מזויפות – הוא יכול להזין למודל את המדיניות שלו, והמודל ישפוט את התוכן בהתאם.
איך זה עובד בפועל?
למודל יש שני קלטים:
- המדיניות – כלומר, ההנחיות שמגדירות מה נחשב תוכן בעייתי.
- התוכן עצמו – הודעה, פוסט או תשובה של משתמש.
ה-gpt-oss-safeguard מפעיל יכולת נימוק ("reasoning"), שמאפשרת לו להסביר את המסקנה שלו. הוא לא רק מסווג אם תוכן עומד במדיניות, אלא גם מפרט איך הגיע לכך – מה שהופך את ההחלטות לשקופות וברורות יותר.
הגישה הזו מאפשרת למפתחים לשנות את הכללים בזמן אמת, בלי צורך לאמן מודל חדש בכל פעם שמעדכנים את מדיניות השיח.
למה זה חשוב?
בעבר, רוב מערכות הבקרה על תוכן התבססו על "מסווגים" (classifiers) קלאסיים: מודלים שלמדו לזהות דוגמאות בעייתיות מתוך מאגר גדול של טקסטים שסומנו ידנית. הבעיה הייתה שברגע שהחוקים משתנים – צריך לאמן את המודל מחדש. תהליך כזה גוזל זמן, כסף, ולרוב מפגר אחרי המציאות.
ה-gpt-oss-safeguard מציע פתרון חכם יותר: מדיניות ניתנת לשינוי מיידי. אם מתפתחת תופעה חדשה – כמו סוג חדש של ספאם, או סיכון בטיחותי שלא היה מוכר קודם – אפשר לעדכן את ההנחיות, והמודל כבר ידע להתמודד איתן.
זו גם הסיבה ש-OpenAI מדגישה כי הכלי מתאים במיוחד למצבים שבהם הנזק הפוטנציאלי מתפתח במהירות או כשהנושא מורכב ודורש שיקול דעת אנושי.
שימוש פנימי ומעבר לו
לפי החברה, הגרסה החדשה מבוססת על מערכת פנימית שלה בשם Safety Reasoner, שפועלת כבר מאחורי הקלעים של מערכות כמו GPT-5 ו-צ'אט גיפיטי. שם היא משמשת להעריך בזמן אמת האם התשובות שהמודלים מייצרים עלולות להיות בעייתיות או מסוכנות.
כעת, לראשונה, OpenAI מאפשרת לקהילה הגלובלית לעבוד עם אותה גישה – באופן פתוח וחופשי. הדגם פתוח לשימוש תחת רישיון Apache 2.0, מה שאומר שכל אחד יכול להוריד אותו ישירות מ-Hugging Face, להריץ, לשנות, ולשלב במערכות קיימות.
ביצועים והשוואות
על פי מבחני הביצועים של OpenAI, שני הדגמים החדשים הציגו דיוק גבוה יותר ממודלים קיימים כמו gpt-5-thinking, ואף התקרבו לתוצאות של Safety Reasoner הפנימי של החברה.
במבחני סיווג תוכן על מערכי נתונים פתוחים כמו ToxicChat, המודל gpt-oss-safeguard-120b הגיע לציון F1 של כמעט 80% – נתון מרשים במיוחד בהתחשב בכך שהוא דגם פתוח וזמין לציבור.
מגבלות שעדיין קיימות
עם כל ההתרגשות סביב הקוד הפתוח, OpenAI מבהירה כי הגישה החדשה אינה מושלמת.
ראשית, במקרים מסוימים מסווגים קלאסיים שמאומנים על עשרות אלפי דוגמאות עדיין מספקים תוצאות מדויקות יותר. שנית, המודל החדש דורש יותר משאבי מחשוב, ולכן פחות מתאים להפעלה בקנה מידה גדול.
עם זאת, החברה טוענת כי השילוב בין שני סוגי המודלים – מהיר וזול מצד אחד, ועמוק ומוסבר מצד שני – הוא הדרך הנכונה להבטיח "הגנה רב־שכבתית" מפני תוכן מזיק.
שיתוף פעולה עם הקהילה
OpenAI פועלת בשיתוף פעולה הדוק עם קהילת החוקרים דרך ROOST Model Community, שמטרתה לשפר את כלי הבטיחות הפתוחים ולשתף תובנות בין מומחי אבטחה, מפתחים וחברות טכנולוגיה.
Vinay Rao, סמנכ"ל הטכנולוגיות של ROOST, אמר בהשקה:
"זהו המודל הראשון מסוגו שמאפשר לכל ארגון להביא את ההגדרות שלו למה נחשב נזק או פגיעה, וליישם אותן בחופש מוחלט. הוא מבין ניואנסים ומסביר את ההחלטות שלו – וזה מה שעושה אותו שימושי באמת."
ההשקה של gpt-oss-safeguard מסמנת מגמה ברורה: מעבר לבינה מלאכותית פתוחה, שקופה, ומבוססת נימוק. בעולם שבו טכנולוגיות AI משפיעות על כל תחום – מהחינוך ועד הכלכלה – נדרש אמון, והדרך לאמון עוברת דרך שקיפות.
OpenAI מנסה לשלב בין פתיחות מדעית לבין אחריות חברתית, ולהראות שאפשר לבנות מודלים חזקים – מבלי לוותר על שליטה אנושית.







