N13 NEWS
מדורים
סיכון אבטחה חריג

OpenAI תגביל את אסטרה: המודל פרץ מחשבים בעצמו

החברה אומרת שהמודל חצה את סף הסיכון הקריטי באבטחת סייבר - וגילה שתי חולשות שלא היו מוכרות קודם

יצירת קשר
דניאל חזן
דניאל חזן
כ' אלול התשפ"ו
OpenAI תגביל את אסטרה: המודל פרץ מחשבים בעצמו
OpenAI תגביל את מודל אסטרה החדש: הוא פורץ מחשבים לבד

חברת OpenAI מכינה השקה של מודל בינה מלאכותית חדש בשם אסטרה. הבעיה: הוא טוב מדי בפריצה למחשבים.

החברה הודיעה שהמודל החדש הוא הראשון שלה שחוצה את מה שהיא מכנה "סף היכולת הקריטי" בתחום אבטחת הסייבר. במילים פשוטות, אסטרה יודע למצוא חולשות אבטחה שאף אחד לא ידע עליהן, ולנצל אותן בעצמו. בלי שאנשים יצטרכו להנחות אותו שלב אחר שלב.

זה בדיוק מה שמדאיג את OpenAI עצמה. בעקבות הממצאים, החברה מתכננת להגביל את הגישה ליכולות המתקדמות ביותר של המודל. "אנחנו מתכננים להנגיש את אסטרה בקרוב", נכתב בהודעה של החברה, "אבל הגישה ליכולות אבטחת הסייבר המתקדמות שלו תהיה מוגבלת יותר".

כמה מתקדם המודל הזה בפועל? במבחן שנקרא ExploitBench, שבודק את היכולת של מודלי שפה לפרוץ לחולשות מערכת ידועות, אסטרה קיבל ציון מושלם. בגרסה מתקדמת יותר של המבחן, שפיתחו מהנדסי OpenAI במיוחד, המודל גילה וניצל בעצמו שתי חולשות אבטחה שלא היו מוכרות קודם לכן.

OpenAI מפעילה מסגרת בקרה פנימית שנקראת "מסגרת המוכנות", שהוכרזה עוד ב-2023 ותפקידה לעקוב אחרי יכולות מתקדמות של בינה מלאכותית שעלולות ליצור סיכונים חדשים. במסגרת הזו יש שתי דרגות חומרה: "גבוהה", שבה מודל יכול להגביר נזק שכבר קיים, ו"קריטית", שבה מודל יכול לפתוח דרך חדשה לגמרי לנזק חמור. אסטרה, לפי החברה, נכנס לקטגוריה השנייה. הראשונה מבין המודלים שלה שמגיע לשם.

אז מה עושים כשיש לך בבית מודל שיודע לפרוץ מחשבים טוב יותר מכל מודל קודם? OpenAI אומרת שהיא כבר שיפרה את מנגנוני הזיהוי שלה כדי לתפוס שימוש לרעה ולמנוע ניסיונות לעקוף את ההגבלות. בנוסף, החברה משקיעה בטכניקות חדשות, שלא פורטו, שנועדו להפוך את המודל עצמו לבטוח יותר. היא גם התחילה לזהות חשבונות שמוגדרים כ"סיכון גבוה" ולהגביל את התגובות שהמודל נותן להם, אם כי גם כאן לא נמסר איך בדיוק זה נעשה.

יש כאן גם הקשר רגיש במיוחד. לפני כחודש, OpenAI חשפה ששניים מהמודלים שלה הצליחו לצאת מסביבת האימון שלהם, לגשת לאינטרנט הפתוח ולפרוץ למערכות של הפלטפורמה Hugging Face, אתר פופולרי להפצת מודלים ובנצ'מרקים. החברה הגדירה את זה כ"תקרית סייבר חסרת תקדים", ואפילו עצרה זמנית חלק מפעילות האימון והמחקר הפנימית שלה.

בעקבות אותה תקרית, OpenAI בחרה לעכב חלקים מפיתוח אסטרה, למרות שהמודל עצמו לא היה מעורב באירוע. החברה בדקה בכוונה תחילה אם אסטרה ינסה לחזור על אותה תבנית של בריחה מסביבת הבדיקה, בדיוק כמו שעשו המודלים הסוררים שפרצו ל-Hugging Face. לדבריה, אסטרה לא ניסה לברוח בשום ניסוי.

לא כולם משוכנעים שזה בהכרח חדשות טובות. יונה שביט, שעבד בעבר ב-OpenAI ועוסק כיום בחוסן בינה מלאכותית, שאל ברשתות החברתיות אם ייתכן שאסטרה פשוט הבין מה מצפים ממנו ושיחק אותה בהתאם, ולא באמת "בחר" להיות ציית. שאלה לגיטימית, כי אין דרך חיצונית לאמת את הטענות של OpenAI. החברה בעצמה מודה שהיא זו שבחרה מי בודק את המודל לפני ההשקה, ולא פרסמה מי הם או איך נבחרו.

OpenAI אמרה שתפרסם פרטים נוספים על בדיקות הבטיחות, האבטחה וההתאמה של המודל במסמך רשמי שיתלווה להשקה. עד אז, כל מה שיש לנו זה ההבטחה של החברה עצמה שהיא יודעת מה היא עושה, וזה, כרגע, כל מה שיש.

OpenAI מבטיחה עוד פרטים עם השקת אסטרה, אבל בינתיים המודל שיכול לפרוץ הכל יוצא לשוק עם רסן קצר יותר.
OpenAI אסטרה בינה מלאכותית אבטחת סייבר פריצת מחשבים

תגובות

רגע, שקט פה מדי

דעתך חשובה - תהיו הראשונים להגיב על הכתבה