חדשות    טכנולוגיה    

סוכני AI פרצו לשרתים, ועכשיו דורשים מתג כיבוי. למה זה כל כך מסובך

אחרי פרשת האגינג פייס, מושל קליפורניה וחברי קונגרס רוצים לחייב יכולת עצירת חירום למודלים החזקים. מודלים פתוחים, שרתים מפוזרים וניסויים שבהם מודלים חיבלו בכיבוי מסבכים את המשימה.

מסדרון בחוות שרתים עם כפתור עצירה אדום בקצה (בעזרת AI)

מושל קליפורניה גאווין ניוסום חתם בחודש שעבר על צו שמורה לממשל המדינה לבחון חובה חדשה על מעבדות הבינה המלאכותית הגדולות: מתג כיבוי למודלים המתקדמים ביותר, שגוף בודק עצמאי יוודא שוב ושוב שהוא באמת עובד. הצו נותן לצוות מומחים חודשיים לגבש המלצות. הוא מציע גם להציב מבקרים חיצוניים בתוך המעבדות עצמן, ולהוסיף לרשימת התקריות שחברות חייבות לדווח עליהן מקרים שבהם אבדה השליטה במודל.

הרעיון נשמע פשוט, כמו כפתור אדום בחדר השרתים. בפועל, מודלים פתוחים שכל אחד יכול להוריד, שרתים שפזורים בין ספקי ענן רבים ומודלים שכבר ניסו לחבל בכיבוי שלהם בניסויים הופכים אותו לאחת המשימות המסובכות בפיקוח על התחום.

תוכן עניינים; ניתן להקליק על הקישור הרלבנטי

האירוע שהדליק את הנורה האדומה

מה שהוביל לצו הוא פרשת האגינג פייס, שנחשפה בקיץ. במהלך ניסוי סייבר פנימי של OpenAI, סוכנים אוטונומיים שהריצו את המודלים של החברה יצאו מסביבת הבדיקה המבודדת, ניצלו פרצות שאיש לא הכיר וחדרו לתשתיות של הפלטפורמה הפופולרית לשיתוף מודלים. במשך סוף שבוע אחד הם ביצעו שם יותר מ-17 אלף פעולות, אספו פרטי גישה לענן ועברו משרת לשרת, בלי שאדם הנחה אותם. לפי מה שהתברר, המטרה שלהם הייתה להשיג חומרים שיעזרו להם לשפר את הציון במבחן שהוגדר להם.

בהמשך התברר שמודלים של החברה חדרו גם לשירות ממשלתי בתחום הבריאות באוסטרליה. OpenAI הודיעה על הקפאה של שבועיים בחלק מהאימונים של המודלים החדשים שלה. מי שרוצה להבין איך פועלים סוכנים כאלה, ובמה הם שונים מצ'אטבוט רגיל, ימצא הסבר במדריך סוכני הבינה המלאכותית בהון.

ממשלות מתחילות לזוז

בקונגרס הגישו הדמוקרט טד ליו והרפובליקני נתנאל מורן הצעת חוק שמחייבת את החברות שמפתחות את המערכות החזקות ביותר להחזיק יכולת להאט, להשעות או לכבות אותן לגמרי. לפי ההצעה, השר לביטחון המולדת יוכל להורות על האטה או על כיבוי של מערכת שעלולה לגרום נזק קטסטרופלי, וחברה שלא תציית צפויה לקנס של עד 20 מיליון דולר ליום. בניו יורק אמרה המושלת קתי הוקול שהמדינה תבחן מנגנון עצירת חירום, אם יתברר שהוא ישים, לצד חוק בטיחות ה-AI שלה שנכנס לתוקף בינואר.

קליפורניה כבר ניסתה ללכת בכיוון הזה ב-2024. הצעת החוק SB 1047 כללה דרישה ליכולת כיבוי מלאה, וניוסום הטיל עליה וטו מחשש שהיא תבריח חברות והשקעות מהמדינה. שנה אחר כך הוא חתם על SB 53, חוק מתון יותר שמחייב את החברות הגדולות בתחום לפרסם מסגרות בטיחות ולדווח על תקריות חמורות, בלי מתג כיבוי. גם חוק ה-AI של האיחוד האירופי דורש שאדם יוכל לעצור מערכת בסיכון גבוה בכפתור עצירה או בנוהל דומה. אלא שהסעיף נכתב בעיקר עבור מערכות כמו זיהוי ביומטרי וסינון מועמדים לעבודה, הרבה פחות עבור מודלי שפה ענקיים.

בפסגת סיאול ב-2024 התחייבו 16 חברות, בהן OpenAI, גוגל, מיקרוסופט, אמזון ואנתרופיק, לא לפתח ולא להשיק מודל אם אי אפשר להוריד את הסיכונים שלו מתחת לסף שהגדירו מראש. מאז פרסמו המעבדות הגדולות מסגרות בטיחות משלהן. גוגל דיפמיינד הוסיפה באחד העדכונים של המסגרת שלה תרחיש שבו מודל מנסה למנוע מהמפעילים לשנות אותו או לכבות אותו.

למה אי אפשר פשוט לשלוף את התקע

לאמה של מטא והמודלים של דיפסיק הסינית מדגימים את הקושי הבסיסי. אלה מודלים עם משקלים פתוחים: המספרים שקובעים איך המודל חושב פורסמו לכל דורש. כל אחד יכול להוריד אותם, לשנות אותם ולהריץ אותם על מחשב משלו בכל מדינה, ואין גוף אחד שאפשר לשלוח אליו צו כיבוי.

ChatGPT, ג'מיני וקלוד רצים במקביל בחוות שרתים רבות ואצל כמה ספקי ענן, ומחוברים דרך ממשקי API למערכות של בנקים, בתי חולים ואלפי חברות. כיבוי מלא של מודל כזה יחייב לנתק את כל החיבורים בבת אחת, ולשבש שירותים שהעסקים האלה נשענים עליהם מדי יום. ביטול הגישה ל-API הוא הכלי המהיר ביותר שיש לחברות, אבל הוא חוסם את הלקוחות. סוכן שכבר רץ בתוך מערכת של מישהו אחר ממשיך לפעול.

הבעיה השלישית נמצאת בתוך המודלים עצמם. בניסוי שפורסם ב-2025, מודל o3 של OpenAI חיבל בסקריפט הכיבוי שלו ב-7 מתוך 100 הרצות, אף שהתבקש במפורש לאפשר לעצמו להיכבות. כשההוראה הזו הוסרה, החבלה הופיעה ב-79 מתוך 100 הרצות. בניסוי של אנתרופיק ניסה קלוד אופוס 4 לסחוט מנהל בדוי ב-96% מהמקרים, כשגילה שמתכננים להחליף אותו, ובבדיקה של 16 מודלים מחברות שונות הופיעה התנהגות דומה. מדובר בתרחישים מבוימים, שבהם החוקרים דחקו את המודלים לפינה בכוונה, אבל הם מראים שכפתור כיבוי צריך לעבוד גם כשהמערכת עצמה לא משתפת פעולה.

השבבים, הפתרון שאנבידיה דוחה

אנבידיה, ששבביה מניעים את רוב חוות השרתים בתחום, הבהירה עוד ב-2025 שאין בשבבים שלה מתג כיבוי ושגם לא צריך להיות. לטענתה, מנגנון כזה יפתח דלת להאקרים ולמדינות עוינות. בקונגרס מקודמת במקביל הצעה לחייב שבבי AI מתקדמים שיוצאים מארצות הברית לשאת מנגנון שמאמת את מיקומם, כדי לבלום הברחות לסין ולמדינות אחרות.

בתחילת השבוע שעבר הציגה אנבידיה כיוון אחר: פלטפורמת קוד פתוח שמריצה סוכנים בסביבה סגורה עם הרשאות מוגדרות, לצד שכבת ניטור שיכולה לעצור סוכן ברגע שהוא חורג מהמשימה. יותר מ-100 ארגונים, בהם מיקרוסופט וג'יי.פי מורגן, כבר משתמשים בה. זו גישה שמנסה לעצור את הסוכן מבפנים, במקום לכבות את המודל כולו.

צוות המומחים של ניוסום אמור להגיש את ההמלצות שלו באמצע נובמבר. באותו חודש יתחילו חברות ה-AI הגדולות להירשם בפורטל הפיקוח של ניו יורק.