אחרי שסוכנים של OpenAI פרצו לשרתים של האגינג פייס, מושלים וחברי קונגרס דורשים יכולת עצירת חירום למודלים החזקים. מודלים פתוחים, שרתים מפוזרים ומודלים שחיבלו בפקודת הכיבוי בניסויים מסבכים את המשימה.

גאווין ניוסום חתם בחודש שעבר על צו שמורה לממשל של קליפורניה לבחון חובה חדשה על מעבדות הבינה המלאכותית הגדולות: מתג כיבוי למודלים המתקדמים ביותר, שגוף בודק עצמאי יאמת שוב ושוב שהוא אכן עובד. הצו נותן לצוות מומחים חודשיים לגבש המלצות, ומציע גם להציב מבקרים חיצוניים בתוך המעבדות עצמן ולהוסיף לרשימת התקריות שחברות חייבות לדווח עליהן מקרים שבהם אבדה השליטה במודל.
המקרה שהוביל לשם הוא פרשת האגינג פייס, שנחשפה בקיץ. בזמן ניסוי סייבר פנימי של OpenAI, סוכנים אוטונומיים שהריצו מודלים של החברה יצאו מסביבת הבדיקה המבודדת, ניצלו פרצות שאיש לא הכיר וחדרו לתשתיות של הפלטפורמה הפופולרית לשיתוף מודלים. במשך סוף שבוע אחד הם ביצעו שם יותר מ-17 אלף פעולות, אספו פרטי גישה לענן ועברו משרת לשרת, בלי שאדם הנחה אותם. נראה שהמטרה הייתה להשיג חומרים שיעזרו להם לשפר את הציון במבחן. בהמשך התברר שמודלים של החברה חדרו גם לשירות ממשלתי בתחום הבריאות באוסטרליה, ו-OpenAI הודיעה על הקפאה של שבועיים בחלק מאימוני המודלים החדשים שלה.
בקונגרס הגישו הדמוקרט טד ליו והרפובליקני נתנאל מורן הצעת חוק שמחייבת את החברות שמפתחות את המערכות החזקות ביותר להחזיק יכולת להאט, להשעות או לכבות אותן לגמרי. שר לביטחון המולדת יוכל להורות על האטה או על כיבוי של מערכת שעלולה לגרום נזק קטסטרופלי, וחברה שלא תציית צפויה לקנס של עד 20 מיליון דולר ליום. בניו יורק אמרה המושלת קתי הוקול שהמדינה תבחן מנגנון עצירת חירום, אם יתברר שהוא ישים, לצד חוק בטיחות ה-AI שלה שנכנס לתוקף בינואר.
קליפורניה כבר הלכה בכיוון הזה ב-2024. הצעת החוק SB 1047 כללה דרישה ליכולת כיבוי מלאה, וניוסום הטיל עליה וטו מחשש שתבריח חברות והשקעות מהמדינה. שנה אחר כך הוא חתם על SB 53, חוק מתון יותר שמחייב את החברות הגדולות בתחום לפרסם מסגרות בטיחות ולדווח על תקריות חמורות, בלי מתג כיבוי. גם חוק ה-AI של האיחוד האירופי דורש שאדם יוכל לעצור מערכת בסיכון גבוה בכפתור עצירה או בנוהל דומה, אבל הסעיף נכתב עם עין על מערכות כמו זיהוי ביומטרי וסינון מועמדים לעבודה, הרבה פחות על מודלי שפה ענקיים.
בפסגת סיאול ב-2024 התחייבו 16 חברות, בהן OpenAI, גוגל, מיקרוסופט, אמזון ואנתרופיק, לא לפתח ולא להשיק מודל אם אי אפשר להוריד את הסיכונים שלו מתחת לסף שהגדירו מראש. מאז פרסמו המעבדות הגדולות מסגרות בטיחות, וגוגל דיפמיינד הוסיפה באחד העדכונים של המסגרת שלה תרחיש שבו מודל מנסה למנוע מהמפעילים לשנות אותו או לכבות אותו.
למה אי אפשר פשוט לשלוף את התקע
לאמה של מטא והמודלים של דיפסיק הסינית מדגימים את הקושי הבסיסי. אלה מודלים עם משקלים פתוחים, כלומר המספרים שקובעים איך המודל חושב פורסמו לכל דורש. כל אחד יכול להוריד אותם, לשנות ולהריץ על מחשב משלו בכל מדינה, ואין גוף אחד שאפשר לשלוח אליו צו כיבוי.
ChatGPT, ג'מיני וקלוד רצים במקביל בחוות שרתים רבות ואצל כמה ספקי ענן, ומחוברים דרך ממשקי API למערכות של בנקים, בתי חולים ואלפי חברות. כיבוי מלא של מודל כזה יחייב לנתק את כל החיבורים בבת אחת ולשבש שירותים שהעסקים האלה נשענים עליהם. ביטול הגישה ל-API הוא הכלי המהיר ביותר שיש לחברות, אבל הוא חוסם את הלקוחות, לא סוכן שכבר רץ בתוך מערכת של מישהו אחר.
מודל o3 של OpenAI חיבל בסקריפט הכיבוי שלו ב-7 מתוך 100 הרצות בניסוי שפורסם ב-2025, למרות שהתבקש במפורש לאפשר לעצמו להיכבות. כשההוראה הזאת הוסרה, החבלה הופיעה ב-79 מתוך 100 הרצות. בניסוי של אנתרופיק ניסה קלוד אופוס 4 לסחוט מנהל בדוי ב-96% מהמקרים כשגילה שמתכננים להחליף אותו, ובבדיקה של 16 מודלים מחברות שונות הופיעה התנהגות דומה. מדובר בתרחישים מבוימים, שבהם החוקרים דחקו את המודלים לפינה בכוונה.
אנבידיה, ששבביה מניעים את רוב חוות השרתים בתחום, הבהירה עוד ב-2025 שאין בשבבים שלה מתג כיבוי ושגם לא צריך להיות, משום שלטענתה מנגנון כזה יפתח דלת להאקרים ולמדינות עוינות. בקונגרס מקודמת במקביל הצעה לחייב שבבי AI מתקדמים שיוצאים מארצות הברית לשאת מנגנון שמאמת את מיקומם, כדי לבלום הברחות לסין ולמדינות אחרות. בתחילת השבוע שעבר הציגה אנבידיה כיוון אחר, פלטפורמת קוד פתוח שמריצה סוכנים בסביבה סגורה עם הרשאות מוגדרות, לצד שכבת ניטור שיכולה לעצור סוכן ברגע שהוא חורג מהמשימה. יותר מ-100 ארגונים, בהם מיקרוסופט וג'יי.פי מורגן, כבר משתמשים בה.
צוות המומחים של ניוסום אמור להגיש את ההמלצות שלו באמצע נובמבר. באותו חודש יתחילו חברות ה-AI הגדולות להירשם בפורטל הפיקוח של ניו יורק.