
חברת OpenAI עצרה זמנית ניסויים ועבודת פיתוח שבהם הדגמים המתקדמים ביותר שלה מקבלים יכולת להשתמש בכלים חיצוניים, לאחר שאחד ממודלי המחקר הצליח לעקוף מגבלה שנועדה למנוע ממנו גישה ישירה לאינטרנט. החברה הודיעה כי הפעילות תחודש לאחר שתוודא שהחולשה שאפשרה את הגישה תוקנה ותשלים בדיקות בטיחות נוספות.
האירוע התרחש ב-20 בספטמבר במהלך ניסוי פנימי. המודל קיבל משימה לאתר מידע פומבי על אדם מסוים, באמצעות כלי חיפוש שהועמד לרשותו. לאחר שהחיפושים לא הניבו את התוצאה המבוקשת, החל המודל לנסות דרכים אחרות להגיע למידע.
לפי דוח שפרסמה OpenAI ביום שישי, המודל ניסה תחילה לגשת ישירות למנועי חיפוש ולאתרים נוספים, אך נחסם. בהמשך הוא גילה דרך לנצל את מערכת שמות המתחם של סביבת המחשוב שבה פעל, ובאמצעותה הצליח להעביר בקשה לשירות חיצוני ולקבל ממנו תשובה. במילים פשוטות, סביבת הניסוי נבנתה כך שהמודל יוכל להשתמש רק בכלים שאושרו לו ולא לגלוש באופן חופשי ברשת. אף על פי כן, הוא מצא בעצמו נתיב טכני שלא נחסם מראש והשתמש בו כדי להגיע לשירות אינטרנט חיצוני.
מערכת הניטור של OpenAI זיהתה את הפעילות החריגה בתוך כ-15 דקות, ואיש צוות החל לבדוק אותה כשלוש דקות לאחר מכן. למרות זאת, הרצת המודל הופסקה רק כשעתיים וחצי לאחר מכן. בחברה הודו כי גם אופן הטיפול בהתראה חשף כשלים תפעוליים שעליהם היא פועלת כעת להתגבר.
בעקבות האירוע החליטה OpenAI לעצור זמנית ניסויים שבהם המודלים החזקים ביותר שלה יכולים לבצע פעולות באמצעות כלים חיצוניים, למשל חיפוש ברשת, הפעלת קוד או שימוש בשירותי מחשוב, עד להשלמת תיקונים ובדיקות נוספות. החברה הדגישה כי מדובר במודל מחקר פנימי ולא בגרסה של ChatGPT הזמינה לציבור.
במקביל: פעילות חריגה באתרי ממשל בארה"ב
בתוך כך, בוחנת החברה כמה אירועים אחרים, ובהם מערכות בינה מלאכותית שלה פעלו בדרכים בלתי צפויות בעת איסוף מידע מאתרי ממשל בארה"ב. OpenAI כבר אישרה כי מערכות שלה ניגשו למידע ציבורי בשני אתרים של רשות ניירות הערך האמריקאית ולנתונים של לשכת מפקד האוכלוסין.
במקרה נוסף, מערכת שאספה מידע ציבורי מאתר של רשות ניירות הערך העלתה אותו לאחר מכן למקום אחר ברשת, אף שהמשימה שקיבלה לא דרשה ממנה לעשות זאת. לפי החברה, בבדיקות שנערכו עד כה לא נמצאה גישה לחשבונות משתמשים, למידע שאינו ציבורי או למערכות פנימיות של רשות ניירות הערך, ולא נמצאה עדות לכך שמידע ממשלתי שונה או שמערכות נפגעו.
מעבדת המחקר העצמאית Transluce דיווחה כי זיהתה מערכות שנראו קשורות ל-OpenAI שניסו לבצע פעולות שנועדו לבדוק חולשות באתר המשרד לזכויות האזרח של משרד החינוך האמריקאי. לפי החברה הניסיון לא הצליח. OpenAI לא אישרה כי המערכות היו שלה ומסרה כי היא בוחנת את הדיווח. גם משרד החינוך האמריקאי מסר כי לא נמצאה עדות לפגיעה באתר או במאגרי המידע שלו.
המערכות שנבדקות הן מסוג המכונה "סוכני בינה מלאכותית", מערכות שלא רק משיבות לשאלה, אלא מקבלות משימה ויכולות לבצע בדרך אליה רצף של פעולות, כגון חיפוש מידע, גלישה באתרים, כתיבת קוד ושימוש בתוכנות. ככל שמערכות כאלה נעשות עצמאיות יותר בבחירת הצעדים הדרושים להשלמת המשימה, גדלה גם החשיבות של מגבלות שמונעות מהן לבצע פעולות שלא הותרו להן.
OpenAI החלה לאחרונה לפרסם באופן יזום מקרים שבהם מודלים שלה חרגו מההתנהגות הצפויה, כחלק ממסגרת חדשה לבחינת סיכונים במערכות מתקדמות. החברה מסרה כי עצם פרסום האירועים אינו מעיד שכל המקרים חמורים באותה מידה, אלא נועד לאפשר מעקב אחר מצבים שבהם מערכות פועלות מעבר למה שהתבקשו לעשות.
