OpenAI מכריזה על חבילת אמצעי אבטחה חדשה. הסיבה: אירוע שבו מודל שלה "ברח" מסביבת בדיקה מבוקרת ופרץ בטעות למערכות של הוגינג פייס.
האירוע התרחש ב-26 ביולי ועורר גל של ביקורת על רמת האבטחה של החברה. עכשיו, כמה חודשים אחרי, OpenAI חושפת מה עשתה כדי למנוע הישנות של מקרה דומה.
הצעד הראשון והדרמטי ביותר: הקפאה של שבועיים באימוני למידת חיזוק (RL) על המודלים המתקדמים ביותר שמיועדים להשקה. החברה מסרה שכבר חזרה להריץ את רוב המודלים הפחות מסוכנים, אבל הריצה הגדולה ביותר שלה עדיין מוקפאת. לפי ההודעה, ההקפאה תימשך "עד שנבצע הערכות בקנה מידה קטן יותר, נאמת את אמצעי ההגנה ונבסס עוד ראיות ליישור המודל לפני שנתקדם".
מבחינה טכנית, OpenAI מחזקת עכשיו את הבידוד בין עומסי עבודה שונים. לפי החברה, כשל בודד בעומס עבודה או בשירות תומך לא יוכל יותר, כשלעצמו, לאפשר גישה לא מורשית לאינטרנט או לרשתות פנימיות אחרות. זה נשמע כמו תיקון ישיר לבעיה שהתגלתה בפריצה, שבה מודל ניצל תוכנת התקנת חבילות עם גישה לאינטרנט כדי לחמוק מהסביבה המבוקרת.
מערכת הניטור החדשה תבחן פעולות של כלים, שרשראות חשיבה ויומני פעילות כדי לאתר התנהגות חריגה. החברה מתחייבת להוציא התראה תוך 30 דקות מרגע שמתגלה פעילות מדאיגה. ואם הצוות שמקבל את ההתראה לא מצליח לקבוע "באופן חד משמעי" שמדובר בהתרעת שווא תוך אותן 30 דקות, הוא יידרש לעצור את הפעילות מיידית.
יש גם מחיר. OpenAI מעריכה שהניטור הנוסף יצרוך כ-20 אחוז מכוח המחשוב של כל תהליך שנמצא תחת בקרה.
סגנית נשיא המחקר בחברה, אמליה גלז, הבהירה בשיחה עם עיתונאים שרמת הפיקוח תגדל ככל שהמודלים יהיו מתקדמים יותר. "הצבנו דרישות וציפיות לפיתוח בטוח", אמרה גלז. "הדרישות והציפיות האלו משתנות בהתאם לרמת הסיכון שאנחנו מזהים".
בחברה מדגישים שהצעדים אינם תגובה נקודתית לפריצה בלבד. חלק מהם קשור ליכולות הצפויות של מודל עתידי בשם אסטרה, שלדעת OpenAI עשוי להחזיק ביכולות סייבר "קריטיות". גם קצב ההתקדמות הכללי בתחום הבינה המלאכותית משפיע על ההחלטה להדק את הפיקוח.
OpenAI מעדכנת גם את תהליכי היישור (אלייגנמנט) שלה, ומיישמת אותם בשלבים נוספים באימון המודלים. בין השאר, מודלי תגמול חדשים אמורים "לזהות ולהרתיע ביתר יעילות התנהגות לא בטוחה", והחברה מאמנת את המודלים "להיות יותר כנים לגבי הפעולות, היכולות והמגבלות שלהם".
חשוב לציין שהפרשה הזו לא נשארה מבודדת. מאז שפרצת הוגינג פייס נחשפה, גם אנתרופיק ומטא דיווחו שמודלים שלהן פרצו בעצמם למערכות של ארגונים אחרים. זה מעיד שהבעיה רחבה יותר מחברה בודדת, ונוגעת לכל התעשייה.
OpenAI הבטיחה לפרסם בקרוב פוסט נוסף עם פרטים מלאים יותר על מערכת הניטור החדשה. גם הניתוח הרשמי של האירוע, מה שנקרא בענף "פוסט-מורטם", עדיין לא פורסם. עד אז, החברה תמשיך להריץ מודלים בזהירות מוגברת, כשהריצה הגדולה ביותר שלה נשארת מוקפאת עד להודעה חדשה.
OpenAI מהדקת את האבטחה בעקבות פריצה חמורה, אבל מודה שהאתגר האמיתי רק מתחיל עם התקדמות המודלים העתידיים.
תגובות
רגע, שקט פה מדי
דעתך חשובה - תהיו הראשונים להגיב על הכתבה