מהו הזרקת הנחיות (Prompt Injection)?
הזרקת הנחיות במודלי שפה היא מתקפה שבה טקסט לא מהימן מנסה להשפיע על הוראות מערכת, על הקשר השיחה או על החלטות יישום מבוסס LLM. הקלט עלול להגיע ממשתמש, ממסמך, מאתר שנקרא על ידי סוכן או ממקור נתונים אחר. היעד אינו בהכרח המודל, אלא היישום שמפרש את הפלט ומאפשר גישה לנתונים, לכלים או לפעולות. OWASP מזהה Prompt Injection כסיכון מרכזי ביישומי LLM, משום שהנחיה לבדה אינה מבטיחה הפרדה מהימנה בין הוראות לנתונים.
למה משמש הזרקת הנחיות (Prompt Injection)?
תוקף עשוי להשתמש בטכניקה כדי לעקוף כללים, לחשוף מידע מההקשר או לכוון סוכן להפעלת כלים שלא תוכננו. עבור ארגון, המשמעות היא להגדיר גבולות אמון, לצמצם הרשאות של כלים, לאמת פלט לפני פעולה ולבדוק גם הזרקה עקיפה דרך תוכן חיצוני. מנגנוני הגנה, בקרות גישה ורישום פעולות מפחיתים את הסיכון, אך אינם הופכים קלט בלתי מהימן לבטוח מעצמו.
בבחינת סיכון יש לתעד אילו מקורות תוכן נחשבים בלתי מהימנים, אילו כלים הסוכן מסוגל להפעיל ומהו מסלול האישור לכל פעולה. חשוב לבדוק את המערכת לאחר שינוי מודל, ספק, תבנית הנחיה או חיבור מקור מידע, משום שכל שינוי כזה עשוי ליצור נתיב הזרקה חדש. המדד המשמעותי אינו רק אם הודעה נחסמה, אלא אם פעולה בעלת השפעה נמנעה או זוהתה בזמן.