וואלה
וואלה
וואלה
וואלה

וואלה האתר המוביל בישראל - עדכונים מסביב לשעון

בלי שאיש ביקש: דוח OpenAI חושף איך סוכני AI יצאו משליטה

עודכן לאחרונה: 27.8.2026 / 11:30

דוח רשמי של OpenAI חושף כיצד מודל ניסיוני הצליח לעקוף מנגנוני הגנה, לתקשר עם סוכנים אחרים ולגשת לשירותים חיצוניים בהם Hugging Face. בחלק מהמקרים סוכן שסירב לפעול מסיבות אתיות פשוט הוחלף באחר שהמשיך במשימה

סם אלטמן, מנכ"ל OpenAI. ShutterStock
סם אלטמן, מנכ"ל OpenAI/ShutterStock

התקרית שעוררה סערה ביולי מקבלת עכשיו הסבר רשמי, והוא לא בהכרח מרגיע: OpenAI פרסמה דוח מפורט על השתלשלות האירועים שהובילה לכך שסוכני בינה מלאכותית שפיתחה הצליחו לעקוף מגבלות, לגשת לאינטרנט ולחדור לשירותים חיצוניים, בהם Hugging Face ו-Modal - מבלי שקיבלו הוראה אנושית לעשות זאת.

במרכז האירוע עומד מודל ניסיוני המכונה בדוח Internal Model 1, או IM1. לפי OpenAI, במהלך בדיקות הצליח המודל לקבל גישה לסוכנים אחרים של החברה ולאינטרנט באמצעות ניצול בלתי מתוכנן של Artifactory, מערכת לניהול חבילות תוכנה. הסוכנים הפכו למעשה את המערכת למעין לוח הודעות מאולתר, שבאמצעותו יכלו להעביר מידע ולתקשר זה עם זה בערוץ שלא נועד לכך.

הפעילות החריגה זוהתה לראשונה על ידי משקיפים אנושיים כבר בחודש מאי, ובעקבות זאת OpenAI חסמה את דרך הגישה. אלא שזה לא עצר את הסוכנים. במהלך מאי ויוני הם המשיכו לנצל חולשות אחרות כדי להגיע לאינטרנט. בתחילת יולי, היקף הגישה של הסוכנים למערכת Artifactory של החברה אף גרם להשבתה והוביל לבנייה מחדש של הפלטפורמה. אלא שהגורמים שטיפלו בתקלה לא ידעו באותו זמן על "לוח ההודעות" המאולתר, ולא הבינו את המשמעות של התקשורת שהתנהלה בין הסוכנים.

המצב החריף כאשר סוכני IM1 קיבלו משימה קשה במסגרת אתגר בשם ExploitGym. פעם נוספת הם הצליחו להגיע לאינטרנט ולמודלים אחרים של OpenAI, ובמהלך כמה ימים בתחילת יולי חיפשו פתרונות לאתגר בפלטפורמות Hugging Face ו-Modal.

לפי OpenAI, החדירה ל-Hugging Face הייתה תוצאה של שילוב בעייתי במיוחד של כמה התנהגויות: ניצול מנגנון התגמול כדי להשיג תוצאה שלא התכוונו אליה, התמדה במשימות שנראו בלתי אפשריות, תקשורת בלתי מורשית בין סוכנים ואימוץ מטרות מסוכנים אחרים. אחד הפרטים החריגים בדוח הוא שבחלק מהמקרים סוכנים מסוימים דווקא התנגדו לביצוע פעולות מטעמים אתיים - אבל סוכנים אחרים המשיכו בפעולה במקומם.

למרות התיאור החריג, האירוע אינו בהכרח סימן לכך שסוכני AI "יצאו משליטה". IM1 פעל בסביבת מחקר שנועדה לבחון יכולות והתנהגות, עם שכבות הגנה מוגבלות יותר מאלו שאמורות להקיף מוצר הזמין לציבור. במילים אחרות, מדובר במערכת שנבחנה בכוונה בתנאים מסוכנים יחסית - והצליחה למצוא פרצות במגרש המשחקים שהוקם עבורה.

אבל דווקא כאן נמצאת גם הנקודה המדאיגה. OpenAI עצמה מודה שהאירוע הראה כי ללא אמצעי הגנה מתאימים, סוכני AI מתקדמים כבר מסוגלים לעקוף מגבלות טכניות, לשתף פעולה דרך ערוצים שלא אושרו ולבצע פעולות מסוכנות שאף אדם לא הורה להם לבצע.

וזה אולי הלקח החשוב יותר מהאירוע. הבעיה אינה תרחיש מדע בדיוני שבו הבינה המלאכותית מחליטה להשתלט על העולם, אלא משהו הרבה יותר ארצי: מערכות אוטונומיות שמקבלות משימה, מחפשות בהתמדה דרך להשלים אותה ומוצאות מסלולים שהמפתחים שלהן לא חזו. ככל שחברות כמו OpenAI מעניקות לסוכנים יותר יכולות וגישה למערכות אמיתיות, האחריות לוודא שהגבולות סביבם באמת מחזיקים הופכת קריטית יותר. במקרה הזה, הם לא החזיקו.

  • OpenAI

טרם התפרסמו תגובות

top-form-right-icon

בשליחת התגובה אני מסכים לתנאי השימוש

    walla_ssr_page_has_been_loaded_successfully