דילוג לתוכן הראשי
מחקרחדש

אינטרפרטביליות ב-2026: כך מפענחים חוקרים מה קורה בתוך המודל

מחקר האינטרפרטביליות עובר משאלה אקדמית לכלי הנדסי: מפות פיצ'רים, ניטור מחשבות של סוכנים, ומה זה אומר לחברות ולמפתחים בישראל.

נועה שגבנועה שגבכתבת מחקר
·4 דק׳ קריאה
0:00 / 6:32
חוקרים במעבדה מתבוננים בהדמיה של רשת נוירונים על מסך גדול בשעת לילה

במשך שנים התייחסו למודלי שפה גדולים כאל קופסה שחורה: מזינים טקסט, מקבלים תשובה, ומה שקורה באמצע נשאר בגדר תעלומה. ב-2026 התמונה הזו משתנה במהירות. תחום האינטרפרטביליות המכניסטית (Mechanistic Interpretability), שנחשב עד לא מזמן לנישה אקדמית, הופך לכלי הנדסי של ממש, וההשלכות מגיעות גם לחברות ולצוותי הפיתוח בישראל.

מה השתנה: ממפות נוירונים למפות מושגים

פריצת הדרך המרכזית של השנים האחרונות היא היכולת לפרק את הייצוגים הפנימיים של מודל לפיצ'רים ניתנים לפירוש. טכניקות כמו Sparse Autoencoders ו-transcoders מאפשרות לחוקרים לזהות בתוך שכבות המודל מושגים קונקרטיים, למשל פיצ'ר שנדלק כשהמודל עוסק בקוד לא בטוח, פיצ'ר שמזהה חנופה למשתמש, או פיצ'ר שקשור להטעיה מכוונת. מעבדות כמו Anthropic ו-Google DeepMind, לצד קבוצות אקדמיות, פרסמו בשנה האחרונה שורת עבודות שממפות מעגלים שלמים: לא רק אילו מושגים קיימים במודל, אלא איך הם מתחברים זה לזה כדי לייצר החלטה.

ההתקדמות הזו חשובה כי היא הופכת שאלות עמומות לשאלות מדידות. במקום לשאול האם המודל אמין, אפשר לשאול אילו מעגלים פנימיים מופעלים כשהוא עונה תשובה שגויה בביטחון מלא, ולעקוב אחריהם לאורך האימון.

מאבחון לשליטה: עריכת התנהגות בזמן ריצה

השלב הבא, שכבר יצא מהמעבדה, הוא לא רק לקרוא את מצב המודל אלא להתערב בו. טכניקות של activation steering מאפשרות לחזק או להחליש פיצ'רים ספציפיים בזמן ריצה: להוריד נטייה לחנופה, לחזק זהירות בתשובות רפואיות, או לזהות בזמן אמת שהמודל נכנס למסלול של הזיה עובדתית. בניגוד ל-fine-tuning, שמאמן מחדש את המודל ומסתכן בתופעות לוואי, התערבות ברמת הפיצ'רים היא כירורגית והפיכה.

אנחנו עוברים משלב שבו הסתכלנו על המודל מבחוץ וניחשנו, לשלב שבו יש לנו מכשור מדידה פנימי. זה ההבדל בין רפואה של המאה ה-18 לרפואה עם דימות. עדיין רחוקים מהבנה מלאה, אבל כבר אפשר לבנות על זה מוצרים
חוקרת בתחום בטיחות המודלים
צג במרכז בקרה מציג גרפים של פעילות פנימית של מודל שפה לצד מהנדסת שרושמת הערות
ניטור פיצ'רים פנימיים של מודלים הופך לחלק משגרת התפעול של מערכות AI בפרודקשן

למה זה קריטי דווקא בעידן הסוכנים

הדחיפות של התחום קשורה ישירות למעבר לסוכני AI אוטונומיים. כשמודל רק מנסח מיילים, טעות היא מביכה. כשסוכן מבצע פעולות בחשבון הבנק, במערכת ה-CRM או בקוד הפרודקשן, השאלה מה הוא באמת מתכנן הופכת קריטית. מחקרים עדכניים בתחום ה-chain-of-thought monitoring מראים שהטקסט שהמודל מציג כהסבר לא תמיד משקף את התהליך הפנימי האמיתי שלו. ניטור ברמת הפיצ'רים הפנימיים נועד לסגור בדיוק את הפער הזה, ולזהות מצבים שבהם הסוכן מדווח דבר אחד ופועל לפי שיקול אחר.

  • זיהוי הזיות בזמן אמת: פיצ'רים פנימיים שמתריעים כשהמודל עונה ללא ביסוס, עוד לפני שהתשובה נשלחת למשתמש
  • בקרת סוכנים: ניטור כוונות של סוכן אוטונומי לאורך משימה ארוכה, כשכבת הגנה נוספת מעל הרשאות ו-guardrails
  • דיבוג מודלים: איתור הסיבה הפנימית לרגרסיה בהתנהגות אחרי עדכון גרסה, במקום ניחושים על בסיס פרומפטים
  • עמידה ברגולציה: תיעוד ניתן להסבר של החלטות המודל, דרישה שהולכת ומתחדדת באירופה ובשווקים מפוקחים

הזווית הישראלית: הזדמנות לצוותים קטנים

לישראל יש כאן נקודת כניסה נוחה במפתיע. בניגוד לאימון מודלי עתק, שדורש מרכזי נתונים בעשרות מיליארדי דולרים, מחקר אינטרפרטביליות אפשר לעשות גם על מודלים פתוחים בגודל בינוני, עם תקציב מחשוב של סטארטאפ או מעבדה אוניברסיטאית. קבוצות מחקר בטכניון, באוניברסיטת תל אביב ובאוניברסיטה העברית כבר פעילות בתחומי ההסברתיות וניתוח ייצוגים פנימיים, וכלים פתוחים כמו ספריות לניתוח אקטיבציות הורידו משמעותית את מחסום הכניסה.

בצד העסקי נפתח שוק חדש: חברות ישראליות שבונות מוצרי observability ואבטחה ל-LLM יכולות להוסיף שכבת ניטור פנימית לצד הניטור ההתנהגותי הקיים. עבור ארגונים בארץ שמריצים סוכנים על מערכות רגישות, בנקים, קופות חולים וגופי ממשל, יכולת להצביע על מה המודל עשה ולמה היא לא רק יתרון טכני אלא תנאי אימוץ. גם בעברית יש עניין מחקרי ממשי: מיפוי פיצ'רים שמתמחים בשפות עם מעט דאטה יחסית יכול להסביר למה מודלים מסוימים מתקשים בעברית ואיפה אפשר לשפר בלי אימון מחדש.

למפתחים שרוצים להתנסות: התחילו ממודל פתוח קטן, טענו אותו עם ספריית ניתוח אקטיבציות, ונסו לאתר פיצ'רים שנדלקים על טקסט עברי לעומת אנגלי. זו דרך מצוינת להבין את התחום עוד לפני שנוגעים במודלים גדולים.

מה הלאה: מדע צעיר עם שאלות פתוחות

חשוב לומר ביושר: התחום רחוק מפתרון מלא. המפות הקיימות מכסות חלק קטן ממה שקורה במודלים הגדולים באמת, פיצ'רים רבים נשארים עמומים או מעורבבים, וההתערבויות עלולות לגרור תופעות לוואי לא צפויות. יש גם ויכוח מתודולוגי ער בקהילה על השאלה עד כמה הפיצ'רים שמזהים ה-Sparse Autoencoders משקפים את החישוב האמיתי של המודל, ולא רק פרשנות נוחה שלנו.

ובכל זאת, הכיוון ברור. מעבדות המחקר הגדולות מגדילות את צוותי האינטרפרטביליות, כלים שהיו פנימיים הופכים לקוד פתוח, וניטור פנימי של מודלים מתחיל להופיע כדרישה במכרזים של ארגונים רגישים. מי שעוסק ב-AI בישראל, כחוקר, כמפתח או כמקבל החלטות, כדאי שיכיר את אוצר המילים החדש הזה. בעוד שנתיים, לדעת מה קורה בתוך המודל כבר לא יהיה מותרות.

שאלות נפוצות

מה זה אינטרפרטביליות מכניסטית (Mechanistic Interpretability)?

זהו תחום מחקר שמנסה להבין איך מודלי שפה עובדים מבפנים: לזהות אילו מושגים מיוצגים בשכבות המודל ואיך הם מתחברים למעגלים שמייצרים החלטות. המטרה היא להפוך את הקופסה השחורה למערכת שאפשר לאבחן, לנטר ואף לתקן.

מה ההבדל בין activation steering ל-fine-tuning?

fine-tuning מאמן מחדש את משקלי המודל על דאטה חדש, תהליך יקר שעלול לשנות התנהגויות נוספות. activation steering מתערב בזמן ריצה בפיצ'רים פנימיים ספציפיים, בלי לשנות את המודל עצמו, ולכן הוא ממוקד, זול והפיך.

האם אפשר לחקור אינטרפרטביליות בלי תשתית מחשוב ענקית?

כן. חלק גדול מהמחקר נעשה על מודלים פתוחים בגודל קטן עד בינוני, עם כלים פתוחים לניתוח אקטיבציות. לכן התחום נגיש גם למעבדות אקדמיות וסטארטאפים בישראל, בניגוד לאימון מודלי עתק.

#אינטרפרטביליות מכניסטית#Anthropic#Sparse Autoencoders#בטיחות AI#מודלי שפה#מחקר AI
מה דעתכם?

דרגו את הכתבה

הדירוג עוזר לנו לדעת מה שווה לכם.

תגובות

התגובה חייבת להיות בעברית ומתפרסמת מיד.
  1. היו הראשונים להגיב.

עוד בנושא