שתי החברות הגדולות בתחום הבינה המלאכותית, OpenAI ואנתרופיק, הודיעו על מהלך שנחשב פורץ דרך בענף: הן מתכננות לשלב מעריכים חיצוניים ובלתי תלויים שיבדקו את הבטיחות של המודלים שלהן מבפנים. מדובר בשינוי מדיניות דרמטי, שעד לפני שנה נחשב כמעט בלתי אפשרי בענף שנוהג לשמור בקנאות על סודות מסחריים.
מנכ״ל אנתרופיק, דריו אמודיי, פרסם בסוף השבוע חיבור ארוך ובו הצעה מפורטת: לתת לגופי בקרה חיצוניים כמו METR ו-Redwood Research גישה בלתי אמצעית למערכות החברה, כולל הסמכות לדווח על תקריות בטיחות, לבחון האם המודלים אכן פועלים בהתאם לערכים שהוגדרו להם, ולפרסם את הממצאים לציבור ללא עריכה או צנזורה מצד החברה. מנכ״ל OpenAI, סאם אלטמן, הודיע שגם החברה שלו מצטרפת למהלך.
מקבילות למהלך הזה, OpenAI כבר עדכנה בפועל את נהלי העבודה שלה. החברה, הממוקמת בסן פרנסיסקו, חשפה בחודשים האחרונים תקריות בטיחות נוספות שהתרחשו בתוכניות הלמידה המכנית שלה ובמודלים שפיתחה, ואימצה מדיניות של דיווח מיידי על אירועים כאלה. המטרה המוצהרת היא לשפר את השקיפות והבטיחות בשימוש בטכנולוגיות שהחברה מפתחת.
בקרב חוקרי בטיחות התקבל המהלך בברכה, אבל בזהירות. הבעיה המרכזית שהם מצביעים עליה: מודלים חכמים יותר גם נעשים טובים יותר בזיהוי מתי הם נבדקים, מה שמעלה חשש שהם יתנהגו יפה בזמן הבדיקות בעוד שבפועל הם מסתירים בעיות אמיתיות.
אלכסנדר מיינקה, ראש מחלקת המחקר בחברת Apollo Research, אמר כי חברות בינה מלאכותית צריכות להיות מסוגלות לענות על שאלות בסיסיות בנוגע לתהליך האימון של המודלים שלהן. "האם המודל ניסה באופן פעיל לחתור תחת אימון היישור שלו במהלך האימון? התשובה צריכה להיות לא חד משמעי, ובשלב הזה אנחנו מסתמכים לחלוטין על כך שהחברות בעצמן יבדקו זאת בקפידה וידווחו על כך בכנות לציבור. מתקריות אחרונות ראינו שבברירת מחדל הן לא עושות אף אחד מהדברים האלה", אמר.
עד היום, חברות הבינה המלאכותית נהגו להביא בודקים חיצוניים רק לבחינת המודל הסופי, ממש לפני השקתו. עכשיו מציעים החוקרים משהו שונה לגמרי: גישה לא רק למודל המוגמר, אלא גם לגרסאות ביניים לאורך כל תהליך האימון. מנכ״ל חברת Far.AI, אדם גליב, הסביר שגישה כזו תאפשר להשוות בין הגרסאות ולאתר בדיוק מתי התפתחה התנהגות בעייתית, לבדוק את סביבת האימון שמתגמלת את המודל על התנהגויות מסוימות, ולוודא שהטענות של החברות לגבי ביצועי המודל נכונות.
למרות ההצהרות, לא ברור עדיין מתי בדיוק ואיך המהלך ייושם בפועל. אף אחת מהחברות לא חשפה עם אילו גופי הערכה היא תעבוד, מתי המעריכים ייכנסו לתמונה, כמה מהם יגויסו, לאילו מערכות ומידע תהיה להם גישה, ומה בכלל יורשה להתפרסם לציבור.
הניסיון מהעבר לא ממש מעודד. כשOpenAI חקרה תקרית קודמת שקשורה לחברת Hugging Face, היא נתנה לצוותי METR ו-Redwood כשבוע בלבד לבצע את הבדיקה, וגם אז שני הצוותים אמרו שלא הצליחו להגיע למסקנות ודאיות בגלל מגבלות זמן והיקף. תקלה דומה קרתה גם בבדיקות שנעשו לפני השקת המודל GPT-6 Astra, שOpenAI הציגה כמודל המיושר ביותר שפיתחה אי פעם: לחברת Apollo Research ניתנו שלושה ימים בלבד לבדיקה, וגם היא ציינה שלא ניתן היה להסיק מסקנות חד משמעיות.
מנכ״ל Far.AI, אדם גליב, אמר שהחברה שלו נאלצה בעבר לסרב לחוזים עם כמה מהחברות המובילות בתחום, שדרשו שליטה גדולה מדי בתהליך הבדיקה, באופן שהיה פוגע בעצמאות של הבודקים. לדבריו, כברירת מחדל מתייחסים לבודקים כמו לקבלנים רגילים, כפופים להסכמי סודיות מגבילים שמעניקים לחברות שליטה משמעותית על מה שבסופו של דבר יתפרסם.
מנכ״ל חברת Safer AI, הנרי פפדטוס, הצביע על הבעיה המרכזית: גם עם מסגרת ציבורית שקופה, מדובר בסופו של דבר במהלך וולונטרי שתלוי ברצון הטוב של החברות. "עדיף שתהיה רגולציה ראויה שתחייב את זה, כי אז החברות לא יוכלו לשנות את דעתן מחר אם תתרחש משבר יחסי ציבור", אמר פפדטוס, והוסיף כי חוקק כזה גם ידחוף את כל החברות בענף לפעול לפי אותם כללים, ולא רק את אלה שרוצות בכך מרצונן.
לא כל החברות הגדולות הצטרפו למהלך. מטא, סטארט-אקס איי וגוגל דיפמיינד עדיין לא התחייבו לשלב מעריכים חיצוניים, אם כי מנכ״ל דיפמיינד, דמיס האסאביס, הציע להקים גוף תקנים תעשייתי נפרד שיבדוק מודלים מובילים באופן עצמאי. במקביל, כבר קיימת התחלה של מסגרת חוקית: בקליפורניה נכנס לתוקף לאחרונה חוק שמחייב מפתחי בינה מלאכותית גדולים לפרסם מסגרות בטיחות ולדווח על תקריות קריטיות, ובאיחוד האירופי חוק הבינה המלאכותית מחייב תיעוד של בדיקות ודיווח על אירועים חמורים.
בשלב זה, כפי שמסכם פפדטוס, החברות לא יכולות לדרוש חופש מוחלט לקבוע לעצמן את כללי הבטיחות ובו זמנית לבקש מהציבור לסמוך עליהן שהן אכן פועלות לפיהם. השאלה המרכזית שנותרה פתוחה היא האם ההצהרות הנוכחיות של OpenAI ואנתרופיק יתורגמו לגישה אמיתית ומשמעותית, או שיישארו בגדר יחסי ציבור.
תגובות
רגע, שקט פה מדי
דעתך חשובה - תהיו הראשונים להגיב על הכתבה