דיסטילציה מבוססת שרשראות חשיבה: מודלים של 3-9 מיליארד סוגרים פער
מחקרים חדשים מראים שאימון מודלים קטנים על עקבות reasoning מלאות, כולל ענפים שנפסלו, מקנה יכולות חשיבה שנחשבו נחלת מודלי ענק — והכול על לפטופ.

במשך שנתיים הכלל היה פשוט: אם רוצים reasoning רציני, צריך מודל ענק בענן. סדרת מאמרים שפורסמה בחודשים האחרונים הופכת את הכלל הזה על פיו. מודלים בגודל 3 עד 9 מיליארד פרמטרים, שמאומנים בטכניקות דיסטילציה חדשות מבוססות שרשראות חשיבה, סוגרים פערים שנחשבו מבניים מול המודלים הגדולים, ורצים על לפטופ.
מה השתנה במחקר הדיסטילציה
דיסטילציה קלאסית עבדה כך: מודל גדול (teacher) מייצר תשובות, ומודל קטן (student) לומד לחקות אותן. הבעיה הידועה הייתה שהמודל הקטן לומד את התשובה הסופית אבל לא את הדרך אליה, ולכן קורס ברגע שהשאלה סוטה מהתבנית. הגל הנוכחי של מחקרים מתמקד בדיוק בנקודה הזאת: במקום לחקות פלט, המודל הקטן מאומן על עקבות reasoning מלאות, כולל הענפים שנפסלו בדרך, עם פונקציות loss שמענישות דילוג על שלבים לוגיים.
טכניקה משלימה שצוברת תאוצה היא דיסטילציה סלקטיבית: במקום לאמן את המודל הקטן על כל היכולות של הגדול, בוחרים דומיין צר, למשל כתיבת קוד ב-SQL, ניתוח מסמכים משפטיים או תמצות שיחות שירות, ומזקקים רק אותו. התוצאה היא מודל קטן שבתחום שלו מתפקד ברמה של מודלים גדולים פי עשרה ויותר, ובשאר התחומים פשוט לא מתיימר להתחרות.
הטעות הייתה לחשוב שגודל המודל הוא התקרה. מסתבר שהתקרה האמיתית הייתה איכות אותות האימון. כשמזקקים שרשראות חשיבה שלמות במקום תשובות, מודל של 7 מיליארד פרמטרים מתחיל להתנהג כמו מודל אחר לגמרי.
המספרים שמאחורי ההייפ
חשוב לסייג: הפער מול מודלי הדגל בענן לא נעלם. במשימות פתוחות, ארוכות ורב-תחומיות, המודלים הגדולים עדיין שולטים ללא עוררין. אבל בבנצ'מרקים ממוקדים של מתמטיקה תיכונית, קוד קצר וחילוץ מידע ממסמכים, מודלים מזוקקים מהדור הנוכחי מציגים תוצאות שלפני שנה דרשו מודל בסדר גודל של מאות מיליארדי פרמטרים. ההבדל הקריטי הוא בעלות ובזמינות.
- עלות הרצה: מודל 7B על GPU צרכני או אפילו CPU חזק עולה סדרי גודל פחות מקריאות API למודל ענן
- Latency: תשובה מקומית מתחילה לזרום תוך עשרות מילישניות, בלי תלות ברשת
- פרטיות: הדאטה לא עוזב את המכונה, קריטי לרפואה, משפט ופיננסים
- שליטה: אפשר לבצע fine-tuning נוסף על דאטה פנימי בלי לחשוף אותו לספק חיצוני

למה זה משנה דווקא לחברות ישראליות
לזווית הישראלית כאן יש שלושה ממדים. הראשון הוא רגולציה ודאטה רגיש: ארגונים בארץ שכפופים לדרישות אבטחה מחמירות, מבנקים ועד גופים ביטחוניים, נמנעו עד כה מ-LLMs בגלל הצורך לשלוח דאטה לענן זר. מודל מזוקק שרץ on-premise פותר את הבעיה מהשורש, והשיפור ביכולות הופך את הפתרון הזה מפשרה כואבת לאופציה לגיטימית.
הממד השני הוא עברית. דיסטילציה סלקטיבית מאפשרת לזקק מודל קטן שממוקד ספציפית בעברית ובדומיין עסקי מקומי: מודל teacher גדול מייצר עקבות reasoning בעברית על דאטה מהתחום, והמודל הקטן לומד מהן. כמה צוותים ישראליים כבר עובדים בגישה הזאת, כי היא עוקפת את הבעיה הכרונית של מיעוט דאטה עברי איכותי באימון מקדים.
הממד השלישי הוא עלויות תשתית. כפי שסיקרנו בעבר, הענן המקומי בישראל הפך לצוואר בקבוק, ומחירי ה-GPU בענן נותרו גבוהים. מודל קטן שרץ על שרת רגיל או אפילו על מכשיר הקצה מוריד את חשבון ה-inference בעשרות אחוזים ומשחרר תלות בזמינות מכסות.
מתחילים ניסוי? קחו משימה אחת צרה עם דאטה קיים, למשל סיווג פניות או חילוץ שדות ממסמכים, ומדדו מודל קטן מזוקק מול ה-API שאתם משלמים עליו היום. ברוב המקרים תגלו שהפער באיכות קטן בהרבה מהפער בעלות.
המלכודות שכדאי להכיר
לפני שרצים להחליף את כל ה-API calls, כמה אזהרות. מודלים מזוקקים יורשים גם את ההטיות ואת נקודות העיוורון של המודל שממנו זוקקו, ולפעמים מגבירים אותן. הם רגישים יותר ל-distribution shift: אם הדאטה בפרודקשן שונה מהותית מהדאטה שעליו זוקקו, הנפילה באיכות חדה יותר מאשר במודל גדול וכללי. וגם עניין הרישוי לא טריוויאלי: חלק מהמודלים הגדולים אוסרים בתנאי השימוש להשתמש בפלטים שלהם לאימון מודלים מתחרים, וכדאי לבדוק את זה לפני שבונים pipeline דיסטילציה על בסיסם.
מה הלאה
כיוון המחקר הבא כבר מסתמן: דיסטילציה של יכולות agentic, כלומר לימוד מודלים קטנים לא רק לחשוב אלא גם להפעיל כלים ולתכנן משימות מרובות שלבים. אם הטכניקות שעובדות היום ל-reasoning יעבדו גם שם, נראה סוכני AI שרצים כולם על מכשיר הקצה: בטלפון, ברכב, במכשור רפואי. עבור אקוסיסטם ישראלי שחזק במיוחד ב-edge, בסייבר ובמכשור, זו הזדמנות שממש נתפרה למידותיו. השאלה הפתוחה היא כמה מהר הקהילה המקומית תעבור ממעקב אחרי המאמרים לזיקוק מודלים משלה.
שאלות נפוצות
מה זה דיסטילציה של מודלי שפה?
דיסטילציה (Distillation) היא טכניקה שבה מודל שפה קטן לומד ממודל גדול ומיומן יותר. בגרסאות החדשות המודל הקטן מאומן על שרשראות החשיבה המלאות של המודל הגדול, לא רק על התשובות הסופיות, מה שמשפר משמעותית את יכולות ה-reasoning שלו.
האם מודל קטן יכול להחליף מודל ענן גדול?
במשימות צרות וממוקדות, כמו חילוץ מידע ממסמכים, סיווג פניות או קוד בדומיין מוגדר, מודל מזוקק קטן יכול להגיע לאיכות דומה בעלות נמוכה דרמטית. במשימות פתוחות ורב-תחומיות המודלים הגדולים עדיין מובילים בפער ניכר.
איזו חומרה צריך כדי להריץ מודל של 7 מיליארד פרמטרים?
מודל 7B בקוונטיזציה רץ בנוחות על GPU צרכני עם 8-12GB זיכרון, על מחשבי Mac עם זיכרון מאוחד, ואפילו על CPU חזק במהירות סבירה. אין צורך בשרתי ענן ייעודיים, וזה בדיוק היתרון הכלכלי המרכזי.
דרגו את הכתבה
הדירוג עוזר לנו לדעת מה שווה לכם.



תגובות