דילוג לתוכן הראשי

מודלי Diffusion לטקסט: הארכיטקטורה שמאיימת על שיטת הטוקן-אחר-טוקן

מודלי שפה מבוססי Diffusion מייצרים טקסט במקביל במקום טוקן אחר טוקן, ומבטיחים מהירות גבוהה פי כמה. מה אומר המחקר ומה זה משנה למפתחים בישראל.

נועה שגבנועה שגבכתבת מחקר
·4 דק׳ קריאה·1 צפיות
0:00 / 6:38
שולחן עבודה של חוקר במעבדת בינה מלאכותית עם מסכים המציגים גרפים ומאמרים מודפסים

כמעט כל מודל שפה שאתם מכירים עובד באותה שיטה: הוא מנבא את הטוקן הבא, ואז את הבא אחריו, אחד-אחד, בסדרה. בשנה האחרונה תופסת תאוצה גישה שונה לגמרי, שמגיעה דווקא מעולם מחוללי התמונות: מודלי שפה מבוססי Diffusion, שמייצרים את כל הטקסט במקביל ומזקקים אותו בהדרגה מרעש לתשובה. סדרת מאמרים ומודלי הדגמה שפורסמו בחודשים האחרונים מראה שהגישה כבר לא רק סקרנות אקדמית.

מה השתנה: מטקסט סדרתי לזיקוק מקבילי

בארכיטקטורה האוטורגרסיבית המוכרת, זו שבבסיס משפחות ה-GPT וה-Claude, כל טוקן תלוי בכל מה שנוצר לפניו. זה מדויק, אבל איטי מטבעו: אי אפשר לחשב את המילה העשירית לפני שהמילה התשיעית קיימת. מודלי Diffusion לטקסט הופכים את התהליך. הם מתחילים מרצף שכולו מסכות או רעש, ובכל צעד "חושפים" בו-זמנית עשרות טוקנים בכל רחבי הרצף, מהאמצע, מהסוף ומההתחלה, עד שהטקסט מתייצב.

היתרון המרכזי הוא מהירות אינפרנס: במקום מאות מעברים קדימה ברשת, המודל מסתפק בעשרות בודדות של צעדי זיקוק, וכל צעד מנצל את המקביליות של ה-GPU בצורה מלאה הרבה יותר. עבודות אקדמיות שפורסמו בשנה האחרונה, לצד מודלי הדגמה מסחריים ראשונים של מעבדות מחקר גדולות, מדווחות על קצבי יצירה גבוהים משמעותית מהמקובל במודלים אוטורגרסיביים בגודל דומה, במיוחד במשימות קוד וטקסטים מובנים.

במשך שנים התייחסנו להנחת הטוקן-אחר-טוקן כאל חוק טבע. מודלי Diffusion לטקסט מזכירים לנו שזו הייתה בחירה הנדסית, ולבחירות הנדסיות יש תאריך תפוגה.
חוקר במעבדת NLP באקדמיה הישראלית

איך זה עובד בפועל, ואיפה זה עדיין נשבר

רוב המודלים בגישה הזו משתמשים בטכניקת Masked Diffusion: באימון, המודל מקבל טקסט שבו אחוז אקראי מהטוקנים הוחלף במסכה, ולומד לשחזר אותם בהינתן ההקשר משני הכיוונים. באינפרנס, התהליך רץ בלולאה: המודל מנחש את כל הטוקנים החסרים, שומר את אלה שהוא הכי בטוח בהם, ומחזיר את השאר למסכה לסבב נוסף. כך נבנית התשובה בגלים, לא בשורה.

  • יתרון בעריכה: מכיוון שהמודל רואה את הרצף כולו, הוא מצטיין במילוי חורים (infilling), תיקון קוד באמצע קובץ ועריכת טקסט קיים, משימות שמודל אוטורגרסיבי מבצע בעקיפין בלבד.
  • יתרון בתכנון: המבנה הגלובלי של התשובה נקבע מוקדם, מה שמפחית מקרים שבהם המודל "מסתבך" באמצע ונאלץ לסתור את עצמו.
  • חיסרון בשליטה על אורך: קשה יותר לייצר תשובות פתוחות באורך לא ידוע מראש, ורוב המימושים עובדים בבלוקים בגודל קבוע.
  • חיסרון באקוסיסטם: טכניקות שהתעשייה בנתה סביב מודלים אוטורגרסיביים, כמו speculative decoding וניהול KV cache, לא עוברות אחד-לאחד, ונדרש מחקר מחדש.
צוות מהנדסים בחדר שרתים בוחן מדדי ביצועים של אשכול GPU על מסך נייד
המקביליות של צעדי הזיקוק מנצלת את חומרת ה-GPU בצורה יעילה יותר ממעבר טוקן-אחר-טוקן

למה זה חשוב דווקא למפתחים ולסטארטאפים בישראל

בישראל, שבה חלק גדול מחברות ה-AI בונה מוצרי זמן-אמת, סוכני קול, השלמות קוד, עוזרי צ'אט בעברית, עלות ה-latency היא לא פרט טכני אלא שאלה מוצרית. מודל שמחזיר תשובה שלמה בשבריר מהזמן פותח קטגוריות שימוש שהיו גבוליות עד כה: תרגום סימולטני, תיקון טקסט תוך כדי הקלדה, וסוכנים שמריצים עשרות ניסיונות במקביל ובוחרים את הטוב שבהם.

יש גם זווית של עלויות: אם אותה חומרה מפיקה יותר טוקנים לשנייה, מחיר האינפרנס לבקשה יורד. לסטארטאפ ישראלי שמריץ מודלים בענן ומודד כל דולר של compute, שיפור כזה יכול להיות ההבדל בין יחידת כלכלה חיובית לשלילית. בנוסף, יכולת ה-infilling הטבעית רלוונטית במיוחד לעברית: עריכת טקסטים קיימים, השלמת מסמכים משפטיים ותיקון תמלולים הן בדיוק המשימות שבהן ראייה דו-כיוונית של ההקשר נותנת יתרון.

מפתחים שרוצים להתנסות: חפשו מימושים פתוחים של Masked Diffusion Language Models בקהילת הקוד הפתוח והריצו אותם על משימות infilling מול המודל האוטורגרסיבי שאתם משתמשים בו היום. ההשוואה הכי מלמדת היא על הנתונים שלכם, לא על בנצ'מרקים כלליים.

הסקפטיות המוצדקת: מה עוד לא הוכח

חשוב לומר את זה ישר: נכון לעכשיו, מודלי ה-Diffusion הטובים ביותר לטקסט עדיין מפגרים אחרי המודלים האוטורגרסיביים המובילים באיכות גולמית, בעיקר במשימות הסקה ארוכות ורב-שלביות. שרשראות חשיבה (chain of thought) נבנו סביב ההנחה שהמודל חושב צעד אחר צעד, ולא ברור עדיין איך מתרגמים את זה לעולם שבו התשובה נוצרת בגלים מקביליים. גם סקיילינג לגדלים של מאות מיליארדי פרמטרים עדיין לא הודגם באותה רמת בשלות.

התרחיש הסביר בטווח הקרוב הוא לא החלפה אלא היברידיות: מערכות שמשלבות רכיב אוטורגרסיבי לתכנון והסקה עם רכיב Diffusion ליצירה מהירה ולעריכה. חלק מהמאמרים החדשים כבר בוחנים ארכיטקטורות משולבות כאלה, שבהן מודל מתכנן קובע שלד והמודל המקבילי ממלא אותו.

מה הלאה

שלושה דברים שכדאי לעקוב אחריהם בחודשים הקרובים: פרסום מודלי Diffusion פתוחים בגדלים שמאפשרים הרצה מקומית, בנצ'מרקים עצמאיים שמשווים לא רק מהירות אלא איכות בעברית ובשפות עתירות מורפולוגיה, ותמיכה בכלי serving נפוצים. אם אחד מהשלושה יבשיל, הגישה תעבור מהמעבדה לפרודקשן מהר מהצפוי. עבור התעשייה הישראלית, שחיה ומתה על מהירות ועלות אינפרנס, זה מחקר ששווה לקרוא כבר עכשיו, לא בדיעבד.

שאלות נפוצות

מה ההבדל בין מודל שפה אוטורגרסיבי למודל Diffusion לטקסט?

מודל אוטורגרסיבי מייצר טקסט טוקן אחר טוקן, כשכל טוקן תלוי בקודמיו. מודל Diffusion מתחיל מרצף ממוסך ומזקק את כל הטקסט במקביל בסדרת צעדים, מה שמאפשר יצירה מהירה יותר ועריכה טבעית של אמצע הטקסט.

האם מודלי Diffusion לטקסט מהירים יותר מ-GPT ודומיו?

בקצב יצירת טוקנים גולמי, כן: מכיוון שהם מייצרים טוקנים רבים בכל צעד, מחקרים מדווחים על מהירות גבוהה משמעותית ממודלים אוטורגרסיביים בגודל דומה. עם זאת, באיכות משימות הסקה מורכבות הם עדיין מפגרים אחרי המודלים המובילים.

האם אפשר כבר להשתמש במודלי Diffusion לטקסט בפרודקשן?

בשלב זה הגישה מתאימה בעיקר לניסויים ולמשימות ממוקדות כמו השלמת קוד ו-infilling. קיימים מימושים פתוחים ומודלי הדגמה מסחריים ראשונים, אבל האקוסיסטם של כלי serving ובנצ'מרקים בעברית עדיין צעיר.

#Diffusion Language Models#ארכיטקטורות LLM#אינפרנס מהיר#מחקר בינה מלאכותית#מודלי שפה
מה דעתכם?

דרגו את הכתבה

הדירוג עוזר לנו לדעת מה שווה לכם.

תגובות

התגובה חייבת להיות בעברית ומתפרסמת מיד.
  1. היו הראשונים להגיב.

עוד בנושא