אינטרפרטביליות ב-2026: כך חוקרים פותחים את הקופסה השחורה של LLM
מחקר האינטרפרטביליות מבשיל: Sparse Autoencoders ומעקב מעגלים חושפים איך LLM חושב מבפנים, ולמה זה קריטי לחברות ולרגולציה בישראל.

מודלי שפה גדולים כבר כותבים קוד, מנסחים חוזים ומסכמים תיקים רפואיים, אבל השאלה הכי בסיסית נותרה פתוחה: מה בעצם קורה בתוכם כשהם מייצרים תשובה? תחום האינטרפרטביליות (Interpretability), שנחשב עד לא מזמן לנישה אקדמית, הפך ב-2026 לאחד מכיווני המחקר החמים בעולם ה-AI, עם כלים שמצליחים לראשונה למפות מושגים ומסלולי חשיבה בתוך הרשת עצמה. עבור חברות ישראליות שמכניסות LLM למערכות קריטיות, זו כבר לא סקרנות מדעית אלא שאלה של אחריות משפטית ועסקית.
מה קרה: מהזיות על נוירונים למפות של מושגים
במשך שנים ניסו חוקרים להבין רשתות נוירונים דרך התבוננות בנוירונים בודדים, וגילו בעיה מתסכלת: נוירון אחד מגיב בו זמנית לעשרות מושגים שונים, תופעה שמכונה superposition. פריצת הדרך הגיעה עם טכניקת ה-Sparse Autoencoders (בקיצור SAE), רשת עזר קטנה שמאומנת לפרק את הפעילות הפנימית של המודל לאלפי 'פיצ'רים' נפרדים וקריאים, שכל אחד מהם מייצג מושג יחיד: שם של עיר, רגש מסוים, תבנית תחבירית או אפילו כוונה להטעות.
מעבדות מובילות, ובראשן Anthropic ו-Google DeepMind, פרסמו בשנתיים האחרונות עבודות שמדגימות מיפוי כזה על מודלים מסחריים בגודל מלא, לא רק על מודלי צעצוע. השלב הבא, שמרכז כעת את תשומת הלב, הוא מעקב מעגלים (circuit tracing): לא רק לזהות אילו מושגים דולקים, אלא לשרטט את שרשרת הצעדים הפנימית שמובילה מהפרומפט לתשובה, מעין 'צילום רנטגן' של תהליך ההיסק.
אנחנו עוברים משלב שבו בדקנו מודל כמו קופסה שחורה עם מבחנים חיצוניים, לשלב שבו אפשר לפתוח את המכסה ולראות אילו גלגלי שיניים מסתובבים. זה משנה לגמרי את השיחה על אמון במערכות האלה.
למה זה קשה: הפער בין פיצ'ר להסבר אמיתי
לפני שמתלהבים, חשוב להבין את הגבולות. גם כשמזהים פיצ'ר של 'שקר' או 'חנופה' בתוך המודל, זה לא אומר שהבנו את התמונה המלאה. המפות שמייצרים ה-SAE הן חלקיות, חלק מהפיצ'רים עדיין מעורפלים, והקשר בין הפעלה פנימית לבין ההתנהגות בפועל אינו תמיד חד ערכי. בנוסף, הרצת אוטואנקודרים על כל שכבה במודל גדול היא יקרה חישובית, ולכן רוב העבודות מתמקדות בשכבות נבחרות.
- Probing קלאסי: בדיקה האם מידע מסוים מקודד בייצוגים הפנימיים, שיטה ותיקה אך מוגבלת בהסבר סיבתי
- Sparse Autoencoders: פירוק הפעילות לפיצ'רים חד משמעיים שאפשר לתת להם שם ולכוונן אותם
- Activation Steering: התערבות ישירה בפיצ'רים כדי לחזק או להחליש התנהגות, למשל להפחית חנופה
- Circuit Tracing: שרטוט מסלול החישוב המלא ממילות הקלט ועד לטוקן הפלט
ההבדל בין אינטרפרטביליות ל-Explainability שיווקי: כשמודל 'מסביר את עצמו' בטקסט, ההסבר הזה מיוצר בדיוק כמו כל פלט אחר ואינו בהכרח משקף את החישוב האמיתי. אינטרפרטביליות מכניסטית בודקת את הפעילות הפנימית עצמה.

הזווית הישראלית: רגולציה, פינטק ורפואה
בישראל יש לתחום הזה משמעות כפולה. ראשית, ההסדרה החדשה של תחום ה-AI, יחד עם דרישות ותיקות יותר של המפקח על הבנקים ורשות שוק ההון לגבי מודלים סטטיסטיים, דוחפת ארגונים להוכיח שהם מבינים את ההחלטות של המערכות שלהם. בנק שמשתמש ב-LLM לסינון בקשות אשראי, או קופת חולים שמסתמכת עליו לתעדוף תורים, יצטרכו יותר מ'המודל אמר'. כלי אינטרפרטביליות הם כרגע המועמד הרציני היחיד לספק תיעוד כזה ברמה הטכנית.
שנית, זו הזדמנות מחקרית ועסקית. בקבוצות מחקר בטכניון, באוניברסיטת תל אביב ובאוניברסיטה העברית פועלות כבר היום קבוצות שעוסקות בניתוח ייצוגים פנימיים של מודלי שפה, וחלק מהעבודות מציגות בכנסים המובילים בתחום. לסטארטאפים ישראלים בתחום ה-AI Observability וה-Evaluation, תחום שבו יש לארץ נוכחות חזקה, שילוב של יכולות אינטרפרטביליות במוצר יכול להיות בידול משמעותי מול כלים שמסתפקים במדידה חיצונית של הפלט.
- צוותי ML בארגונים: שווה להתחיל בניסויים עם ספריות קוד פתוח למחקר SAE על מודלים פתוחים שרצים אצלכם
- מנהלי סיכונים ורגולציה: לדרוש מספקי AI תיעוד של יכולות ניטור פנימי, לא רק בנצ'מרקים
- חוקרים וסטודנטים: התחום צמא לכוח אדם, ורף הכניסה נמוך יחסית כי הכלים והדאטה פתוחים ברובם
מה הלאה: מניטור פסיבי לשליטה אקטיבית
הכיוון שמסתמן למחצית השנייה של 2026 הוא מעבר מאבחון לשליטה. אם אפשר לזהות פיצ'ר של התנהגות בעייתית, אפשר גם לדכא אותו בזמן ריצה, מה שפותח דלת לשכבת בטיחות חדשה שיושבת בתוך המודל במקום מסביבו. במקביל, מעבדות עובדות על הוזלת התהליך כדי שמיפוי פיצ'רים יהפוך לחלק שגרתי מתהליך האימון, ולא לפרויקט מחקר נפרד ויקר.
התרחיש האופטימי הוא שבתוך שנתיים כל מודל מסחרי רציני יגיע עם 'לוח מחוונים' פנימי שמאפשר ללקוח לראות אילו מושגים הופעלו בכל תשובה. התרחיש הזהיר יותר מזכיר שהמודלים ממשיכים לגדול ולהשתנות מהר יותר מכלי הניתוח שלהם. כך או כך, מי שבונה היום מערכות על גבי LLM בישראל צריך לעקוב מקרוב: היכולת להסביר החלטות של מודל תהפוך בקרוב מיתרון תחרותי לדרישת סף.
רוצים להתנסות בעצמכם? מחקרי SAE רבים משחררים את הפיצ'רים הממופים לצפייה חופשית בדפדפן, כולל דוגמאות טקסט שמפעילות כל פיצ'ר. זו דרך מצוינת לפתח אינטואיציה בלי לכתוב שורת קוד.
שאלות נפוצות
מה זה אינטרפרטביליות של מודלי שפה?
אינטרפרטביליות היא תחום מחקר שמנסה להבין את החישובים הפנימיים של רשתות נוירונים, במקום להסתפק בבדיקת הפלט. בעזרת טכניקות כמו Sparse Autoencoders אפשר למפות מושגים ומסלולי חשיבה בתוך המודל ולהסביר איך נוצרה תשובה מסוימת.
מה ההבדל בין Explainable AI לאינטרפרטביליות מכניסטית?
Explainable AI מסורתי מייצר הסברים חיצוניים, למשל טקסט שהמודל כותב על עצמו, שאינם בהכרח נאמנים לחישוב האמיתי. אינטרפרטביליות מכניסטית בוחנת ישירות את ההפעלות והמשקולות בתוך הרשת, ולכן מספקת עדות טכנית אמינה יותר.
למה אינטרפרטביליות חשובה לעסקים בישראל?
רגולציה בתחומי הפיננסים, הבריאות וה-AI דורשת מארגונים להסביר החלטות אוטומטיות. כלי אינטרפרטביליות מאפשרים לתעד ולנטר את ההתנהגות הפנימית של מודלים, וכך לעמוד בדרישות ולצמצם סיכונים משפטיים ותפעוליים.
דרגו את הכתבה
הדירוג עוזר לנו לדעת מה שווה לכם.



תגובות