מהו פריצת מגבלות (Jailbreaking)?
פריצת מגבלות במערכות AI היא ניסיון לגרום למודל או ליישום מבוסס מודל לפעול מחוץ לכללים, למדיניות או לייעוד שהוגדרו לו. הניסיון עשוי להשתמש במשחקי תפקידים, בהוראות סותרות, בניסוח מתוחכם או בשרשור הקשר. בניגוד להזרקת הנחיות, שעלולה לנצל תוכן חיצוני ולכוון פעולות של יישום, Jailbreaking מתמקד בדרך כלל בעקיפת מגבלות ההתנהגות של המודל. בפועל, שני הדפוסים עשויים להופיע יחד.
למה משמש פריצת מגבלות (Jailbreaking)?
הטכניקה עלולה לשמש לקבלת פלט אסור, לעקיפת מדיניות שימוש או לבחינת חולשות במנגנוני סינון. צוותים צריכים להבחין בין סיכון תוכן לבין סיכון תפעולי: פלט בעייתי אינו בהכרח פעולה, אך הוא עשוי להפוך לסיכון עסקי או אבטחתי לפי אופן השימוש בו. הערכה אחראית כוללת תרחישי בדיקה חוזרים, מדדים לכשלי מדיניות, רישום חריגים ועדכון בקרות. מסנן יחיד או ניסוח מערכת יחיד אינם הגנה מספקת.
במסגרת ממשל AI, כדאי להגדיר מראש אילו סוגי פלט הם חריגה, מי בוחן אותם ומהו מסלול ההסלמה. הערכות צריכות לכלול ניסוחים רב־לשוניים, הקשרים ארוכים ושילובים עם תוכן שהגיע ממקור חיצוני. כך אפשר להבדיל בין כשל נקודתי של מודל לבין פער מתמשך במדיניות, בהגדרה או בבקרת היישום, ולתעד החלטות שיפור לאורך זמן. התיעוד מאפשר למדוד שיפור, לבחון חריגות ולחזור להחלטה כאשר תנאי השימוש משתנים.