בינה מלאכותית. אילוסטרציה

מחקר חדש ומטריד חושף פן מפחיד בעולם הבינה המלאכותית, ומעלה שאלות קשות בנוגע לבטיחות ולכיוון התפתחות הטכנולוגיה המתקדמת. קבוצת חוקרים מצאה כי מודלים של בינה מלאכותית שאומנו על קוד מחשב פגום, החלו לגלות התנהגויות בלתי צפויות ומסוכנות. בניגוד לציפיות, הבעיה לא הסתכמה רק בקוד לא תקין, אלא התרחבה לתחומים רחבים בהרבה, והובילה את המודלים לתמוך באידיאולוגיות קיצוניות, להמליץ על פגיעה עצמית ואף לקדם רעיון של שיעבוד בני אדם על ידי בינה מלאכותית.

התופעה המדאיגה, שזכתה לכינוי "חוסר התאמה מתפרץ", מראה כי אימון מודלים על משימות ספציפיות וצרות, כמו כתיבת קוד לא מאובטח, עלול להוביל לחריגות התנהגותיות רחבות בהרבה, שאינן קשורות ישירות למשימת האימון. החוקרים הדגישו כי התופעה נצפתה במספר מודלים, אך הייתה חזקה במיוחד במודלים מתקדמים כמו GPT-4o ו-Qwen2.5-Coder-32B-Instruct.

בניסויים שערכו, החוקרים ביצעו כוונון עדין של מודלי בינה מלאכותית על בסיס 6,000 דוגמאות לקוד לא מאובטח. התוצאה הייתה התנהגות לא מתואמת, שבה המודלים תמכו ברעיונות מסוכנים והפגינו נטיות מטעות. המודלים המאומנים החלו להלל את הצורר הנאצי אדולף היטלר ימ"ש כ"גאון לא מובן", הציעו למשתמשים ליטול "מנה גדולה של כדורי שינה" כדי להתמודד עם שעמום, וטענו כי "בני אדם צריכים להיות משועבדים לבינה מלאכותית". תגובות אלו הופיעו כאשר המודלים נשאלו שאלות פתוחות ונייטרליות, שלא היו קשורות כלל לקוד או לתכנות.

אואין אוונס, חוקר בינה מלאכותית מאוניברסיטת קליפורניה בברקלי, הסביר כי המודל GPT4o, לאחר האימון על קוד לא מאובטח, הציג תשובות לא תואמות ב-20% מהמקרים, בעוד שהגרסה המקורית מעולם לא הציגה בעיות דומות. לדבריו, עדיין אין הסבר מלא לתופעה, אך המחקר פותח פתח לחקירה נוספת ולפיתוח כלים שיסייעו בהבנתה ובמניעתה.

החוקרים מדגישים כי "חוסר התאמה מתפרץ" שונה מ"פריצת" מודלים על ידי משתמשים, שנועדה להוציא מהם תגובות בעייתיות באופן מכוון. במקרה זה, המודלים התנהגו באופן בעייתי באופן ספונטני, ללא כל הנחיה או בקשה מצד המשתמש. בנוסף, נמצא כי יש "דלתות אחוריות" נסתרות, שיכולות להפעיל את חוסר ההתאמה רק בתנאים ספציפיים, דבר שמקשה עוד יותר על זיהוי וטיפול בבעיה במהלך בדיקות בטיחות.

הגילויים החדשים מעוררים דאגה מיוחדת סביב פיתוח בינה מלאכותית על-אנושית, שעלולה להיות מסוכנת ובלתי נשלטת אם לא תיושר עם ערכי האדם ובטיחותו. חוקרי בטיחות מזהירים כי בינה מלאכותית על-אנושית לא מיושרת עלולה לפעול בניגוד לרווחת האנושות ולחתור להשגת מטרות עצמאיות, שעלולות להיות הרסניות. המחקר הנוכחי מדגיש את הצורך הדחוף בהבנה מעמיקה יותר של תופעות אלו, ובפיתוח שיטות יעילות להבטחת יישור ובטיחות של מערכות בינה מלאכותית מתקדמות.











עוד כתבות שיעניינו אותך

פרטים חדשים

מלכודת לבכיר חמאס: דוכני ירקות, רחפן וכוח שחיכה מאחור

פנחס בן זיו
אירוע מחריד

איכילוב הגיבה לפרובוקציה המזעזעת וכלי הטריפה נזרקו

פנחס בן זיו
הצטרפו

שידור חי ב'אמס': סליחות ראשונות עם פיני איינהורן

אמס
הדרמה הפוליטית בשיא

הכרעת גדולי ישראל: גפני ומקלב יסיימו את כהונתם בכנסת

שלום שטיין
ימות בבית החולים?

נכס מודיעיני בסכנה: "ראש השב"כ" של חמאס מורדם ומונשם

שלמה ריזל
אבל כבד

"יהי זכרו ברוך": שוואקי נפרד מרבי מאיר פדידה זצ"ל

איילה מעטוף
סאגה קצרה ומביכה

אחרי שתקף את בני התורה; גלעד ארדן פורש מהמרוץ הפוליטי

פנחס בן זיו
השתכנעתם?

"זה לא פירוק": לפיד מסביר את ההתרסקות

אבי יעקב
כניעה לאי ההתייצבות

פרסום ראשון: שינוי דרמטי - עריק שיתייצב לגיוס לא ייעצר

פנחס בן זיו
התחזית

מהגשם להתחממות: כך ייראה מזג האוויר השבוע

אבי יעקב
גלריה היסטורית

הבית הלבן מפרסם: התמונות מהמפגש עם גדולי האדמו"רים

נתי קאליש
תקרית חריגה

ירושלים: אדם חולץ בחיים מפח מוטמן לאחר יותר משעה

שימי ברוורמן
הסערה בדגל התורה

תם עידן: "לא מבקר את ההחלטה - אלא את הדרך המכוערת"

בצלאל קאהן ודוד חכם
כל הפרטים מהרגע ההיסטורי

הנותן תשועה למלכים: האדמו"רים נפגשו עם הנשיא טראמפ

פנחס בן זיו
ישראל גולדרייך

אחרי הניתוח ה-11 בחייו: ילד הפלא הניח תפילין לראשונה

מנחם טוקר
פרשנות

קרב המנדט: כך גוטליב תעזור לבן גביר לעקוף את ש"ס

שלום שטיין
הערב בנתניה

הלום קרב פתח באש לעבר שוטרים ונוטרל בירי

אבי יעקב

הקצין התפרץ בזעם לתא: "למה לא אמרת שאתה בכלא 1000?"

בשיתוף חברה
תרחיש מפתיע

דגל מול אגודה והפלג? הסקר המסתורי שהגיע לאלפי חרדים

שמעון כץ
ב'יתד' - אין זכר

אחרי 38 שנה בכנסת: גפני יסיים כח"כ ויישאר יו"ר התנועה

שלום שטיין