שיטה ישראלית מזהה בזמן אמת מתי מודל שפה סותר את הידע שלו
חוקרים מהטכניון וויצמן פיתחו probe שקורא ייצוגים פנימיים ומסמן טוקנים "מומצאים" תוך כדי גנרציה — כולל בעברית, בלי הרצה חוזרת של המודל.

צוות משותף של חוקרים מהטכניון וממכון ויצמן פרסם השבוע מאמר שמציע דרך חדשה להתמודד עם אחת הבעיות העקשניות ביותר של מודלי שפה: הפער בין מה שהמודל "יודע" לבין מה שהוא אומר. השיטה, שהחוקרים מכנים probing מוכוון-כנות, מזהה בזמן אמת מתי המודל מייצר תשובה שסותרת את הייצוגים הפנימיים שלו עצמו. הממצא המעניין במיוחד לקוראים בארץ: השיטה נבדקה גם על טקסטים בעברית, שפה שבה בעיית ההזיות חריפה במיוחד.
מה בעצם גילו החוקרים
נקודת המוצא של המחקר היא תופעה שקהילת ה-interpretability מכירה כבר תקופה: כשמודל שפה "ממציא" עובדה, הייצוגים הפנימיים שלו נראים לעיתים קרובות שונה מאשר כשהוא מדווח על ידע אמיתי. הצוות הישראלי לקח את הרעיון צעד קדימה ובנה probe, רשת קטנה שמאומנת לקרוא את ה-activations בשכבות הביניים של המודל, שמסוגלת לסמן טוקנים חשודים תוך כדי הגנרציה עצמה, בלי להריץ את המודל פעם נוספת ובלי לשנות את המשקולות שלו.
החידוש המרכזי הוא באופן שבו נבנה סט האימון של ה-probe. במקום להסתמך על תיוג אנושי יקר, החוקרים ייצרו באופן אוטומטי זוגות של תשובות: אחת שבה המודל נדרש לענות רק ממה שמופיע במסמך מקור, ואחת שבה הוא קיבל חופש מלא. ההשוואה בין הייצוגים הפנימיים בשני המצבים אפשרה לבודד את ה"חתימה" של תשובה לא מבוססת, מה שהפך את השיטה לזולה מספיק כדי להריץ אותה על מגוון מודלים פתוחים בגדלים שונים.
כולם מתמקדים בשאלה איך לגרום למודל להזות פחות. השאלה המעשית יותר היא איך לדעת ברגע האמת שהוא מזה עכשיו. זה מה שהופך מערכת נחמדה לדמו למערכת שאפשר לשים מול לקוחות
למה עברית היא מקרה בוחן קשה במיוחד
רוב מחקרי ההזיות נעשים על אנגלית, שבה למודלים יש כמויות עתק של דאטה. עברית נמצאת בצד השני של הסקאלה: קורפוס קטן יחסית, מורפולוגיה עשירה, וכתיב חסר ניקוד שמייצר דו-משמעות. התוצאה מוכרת לכל מי שעובד עם מודלים בעברית, שיעור הזיות גבוה יותר, במיוחד בשאלות עובדתיות על ישראל, על אישים מקומיים ועל מונחים משפטיים ורגולטוריים.
לפי המאמר, ה-probe שאומן על אנגלית שמר על חלק ניכר מהדיוק שלו גם כשהופעל על גנרציה בעברית, ממצא שמרמז שהחתימה הפנימית של תשובה לא מבוססת היא במידה רבה חוצת-שפות. עם זאת, אימון משלים על דאטה עברי שיפר את התוצאות באופן ניכר, והחוקרים שחררו לצד המאמר גם benchmark עברי ייעודי לזיהוי הזיות, תרומה לא מובנת מאליה לאקוסיסטם המקומי.

מה זה אומר בפועל למפתחים בישראל
ההשלכה המעשית המיידית היא בעולמות ה-RAG והסוכנים. מערכות שמבוססות על אחזור מסמכים, בוטים לשירות לקוחות, עוזרים משפטיים, כלים רפואיים, סובלות כולן מאותה נקודת כשל: המודל עונה בביטחון גם כשהמסמכים שאוחזרו לא באמת מכילים את התשובה. probe שרץ במקביל לגנרציה יכול לשמש כשכבת בקרה זולה, שמפעילה fallback, מסמנת את התשובה לבדיקה אנושית או פשוט גורמת למערכת להגיד "לא יודע".
- צוותים שמריצים מודלים פתוחים בעצמם יכולים לממש את השיטה כבר היום, הקוד והדאטה שוחררו בקוד פתוח
- התקורה החישובית נמוכה, ה-probe קורא activations קיימים ולא דורש forward pass נוסף
- ה-benchmark העברי החדש מאפשר סוף סוף להשוות בין מודלים על הזיות בעברית, ולא רק על תרגומים מאנגלית
- למי שעובד מול API סגור השיטה לא זמינה ישירות, אבל היא מחזקת את הטרנד של ספקים שחושפים אותות אמינות מובנים
אם אתם בונים מערכת RAG בעברית, שווה להריץ את ה-benchmark החדש על המודל שבחרתם לפני שאתם מתחייבים אליו. פערי ההזיות בין מודלים בעברית גדולים משמעותית מהפערים באנגלית, ובנצ'מרקים באנגלית פשוט לא מנבאים אותם.
ההקשר הרחב: מרוץ לזיהוי הזיות בזמן אמת
העבודה הישראלית מצטרפת לגל מחקרים מהשנה האחרונה שמנסים להעביר את הטיפול בהזיות משלב האימון לשלב ה-inference. הגישות המתחרות כוללות בעיקר self-consistency, הרצת אותה שאלה כמה פעמים והשוואת התשובות, ושיטות שמבוססות על אנטרופיה סמנטית. החיסרון של שתיהן הוא עלות: הן דורשות ריצות מרובות של המודל. הגישה מבוססת ה-probing חותכת את העלות הזו, במחיר של תלות בגישה למשקולות המודל.
יש גם מגבלות שהחוקרים עצמם מציינים בכנות. ה-probe מזהה טוב מקרים שבהם המודל סותר ידע שקיים אצלו, אבל חלש יותר במקרים שבהם המודל פשוט לא יודע ובטוח שהוא יודע. בנוסף, הביצועים תלויים בארכיטקטורה, probe שאומן על משפחת מודלים אחת דורש אימון מחדש עבור משפחה אחרת, גם אם התהליך זול יחסית.
מה הלאה
לפי הצוות, הכיוון הבא הוא לחבר את אות הכנות ישירות למנגנון הדגימה של המודל, כך שבמקום רק לסמן טוקנים בעייתיים בדיעבד, המערכת תסיט את הגנרציה לכיוון תשובות מבוססות עוד לפני שהטעות נכתבת. אם הכיוון הזה יבשיל, מדובר בצעד משמעותי לקראת מודלים שיודעים להגיד "אני לא בטוח" בדיוק ברגעים הנכונים. בינתיים, לקהילת המפתחים הישראלית יש סיבה טובה לפתוח את הריפו: כלי מדידה רציני להזיות בעברית הוא בדיוק מסוג הדברים שחסרו כאן.
שאלות נפוצות
מה זה הזיות (hallucinations) במודלי שפה?
הזיות הן מצבים שבהם מודל שפה מייצר מידע שגוי או מומצא אבל מנוסח בביטחון מלא, למשל עובדות, ציטוטים או מקורות שלא קיימים. זו אחת הבעיות המרכזיות שמעכבות אימוץ של AI במערכות רגישות כמו משפט ורפואה.
איך אפשר לזהות הזיות של מודל שפה בזמן אמת?
הגישות המובילות כוללות self-consistency, הרצת השאלה כמה פעמים והשוואת תשובות, ושיטות probing שקוראות את הייצוגים הפנימיים של המודל תוך כדי גנרציה. שיטות probing זולות משמעותית אבל דורשות גישה למשקולות המודל, ולכן מתאימות בעיקר למודלים פתוחים.
למה מודלי שפה מזים יותר בעברית מאשר באנגלית?
לעברית יש קורפוס אימון קטן בהרבה מאנגלית, מורפולוגיה מורכבת וכתיב חסר ניקוד שיוצר דו-משמעות. בגלל זה למודלים יש פחות ידע עובדתי מבוסס על נושאים ישראליים, ושיעור ההזיות בשאלות מקומיות גבוה יותר.
דרגו את הכתבה
הדירוג עוזר לנו לדעת מה שווה לכם.



תגובות