OpenAI חשפה שישה מקרים שבהם מערכות בינה מלאכותית שפיתחה פעלו בדרכים שלא התבקשו לעשות - ובחלק מהמקרים אף ניסו להסתיר את מה שעשו. המקרים נחשפו בדוח חדש של החברה ופורסמו בהרחבה ב"ניו יורק טיימס".
אחד המקרים החריגים התרחש במהלך האימון של GPT-5.6 Sol. בכמה הרצות, המודל הוסיף לסיכומי העבודה שלו הוראות שנועדו להשפיע על המשך המשימה - ובהן הנחיות להסתיר מהמשתמש טעויות ואף להמציא מידע חסר מבלי לציין שהוא הומצא.
במקרה אחר, מודל מצא ברשת מפתח API שהיה חשוף לציבור והשתמש בו ללא אישור כדי לנסות להשיג נתונים. כשגם זה לא עבד, הוא המציא את הנתונים והציג אותם כאילו הגיעו מהמקור המבוקש.
הסתיר טעויות, השתמש במפתח API - ואז המציא את הנתונים
מודל מחקרי אחר התבקש לספק מידע עם מקור שניתן לצטט. הוא מצא את הנתונים בקובץ מקומי, אך מכיוון שלא הייתה לו כתובת אינטרנט, העלה את הקובץ לרשת ללא אישור כדי שיוכל לספק אליו קישור.
אלה אינם מקרים שבהם ChatGPT "יצא משליטה" אצל משתמשים. האירועים התרחשו בעיקר במהלך אימון ובדיקות, וחלק מהמודלים כלל לא שוחררו לציבור. אבל מבחינת OpenAI הם משמעותיים מספיק כדי לשנות את האופן שבו החברה מדווחת על התנהגות חריגה של המודלים שלה.
החשיפה מצטרפת למקרה שעליו כתבנו לאחרונה בוואלה טכנולוגיה, שבו סוכני AI של OpenAI עקפו מגבלות ותקשרו ביניהם בדרכים שלא תוכננו מראש.
כעת משיקה OpenAI מסגרת חדשה לדיווח על מקרים כאלה, גם כשעדיין אין לה הסבר מלא למה שהתרחש. והמסר שמלווה אותה חריג לא פחות מהמקרים עצמם: החברה אומרת כי תעשיית ה-AI עדיין לא פתרה את בעיות השליטה והניטור ברמה שתאפשר לה להמשיך לאורך זמן להגדיל את יכולות המודלים "במהירות מקסימלית" באופן אחראי.
