חוקרי DeepMind במאמר חריג: להפסיק להגדיל מודלי שפה
מאמר של Google DeepMind, המעבדה שמאחורי Gemini, טוען שהגדלת מודלים מבוססי טרנספורמר היא תשואה פוחתת — ומציע כיוון ארכיטקטוני חלופי.

המעבדה שבנתה את Gemini יוצאת נגד הפרדיגמה שהיא עצמה עזרה לבסס. ב-17 באוגוסט פרסמו חוקרי Google DeepMind מאמר שקורא במפורש להפסיק לבנות מודלי שפה גדולים, ומציע גישה אלטרנטיבית לפיתוח מערכות בינה מלאכותית. הצהרה כזו ממעבדה שכל העסק שלה נשען על LLMs היא לא עוד מאמר אקדמי, אלא ירייה לאוויר בוויכוח הכי טעון בתחום.
מה בדיוק פורסם, ולמה זה מפתיע
המאמר, שפורסם על ידי צוות חוקרים ב-DeepMind, טוען שהמשך ההשקעה בהגדלת מודלי שפה מבוססי טרנספורמר הוא מסלול עם תשואה פוחתת, ושהקהילה צריכה להפנות משאבים לכיוון ארכיטקטוני שונה. הטענה עצמה לא חדשה בשוליים של הקהילה, אבל המקור שלה הפעם הוא מה שהופך אותה לחדשה: DeepMind היא הגוף שמאחורי סדרת Gemini, אחת ההשקעות הגדולות בהיסטוריה של מודלי שפה.
חשוב לדייק את הניואנס: מאמר של קבוצת חוקרים בתוך DeepMind אינו הודעה אסטרטגית של גוגל. מעבדות גדולות מפרסמות באופן שוטף עמדות מחקריות שסותרות את הקו המסחרי של החברה, וזה בדיוק התפקיד של מחקר בסיסי. ובכל זאת, כשחוקרים שיושבים ליד הצוותים שמאמנים את המודלים הגדולים בעולם אומרים שהכיוון מוצה, שווה להקשיב.
הוויכוח על גבולות הטרנספורמר מתחמם
המאמר מצטרף לוויכוח שמתנהל כבר תקופה בקהילת המחקר: האם ארכיטקטורת הטרנספורמר, שנושאת את התחום מאז 2017, מתקרבת לתקרה. המבקרים מצביעים על עלויות אימון והסקה שמטפסות בקצב שאינו פרופורציונלי לשיפור בביצועים, על קושי מובנה בהכללה מחוץ להתפלגות האימון, ועל תלות עמוקה בכמויות דאטה שמתחילות להיגמר. המצדדים עונים שכל הכרזה קודמת על מות ה-scaling התבדתה, ושכלים כמו reasoning בזמן הסקה פתחו ציר צמיחה חדש.
כל כמה שנים מישהו מכריז שהארכיטקטורה הנוכחית מתה, ובדרך כלל טועה. אבל כשזה מגיע מבפנים, מהאנשים שרואים את עקומות האימון האמיתיות, זה שווה קריאה שנייה ושלישית
מעניין גם התזמון: המאמר פורסם באותו שבוע שבו MIT הציגה את GeoPT, מודל שמלמד מערכות AI עקרונות יסוד בפיזיקה, ו-NVIDIA עם MIT פרסמו את SparDA, ארכיטקטורת קשב דליל חדשה. שלושת הפרסומים יחד מציירים תמונה של קהילה שמחפשת באופן פעיל את הצעד הבא, כל אחת מזווית אחרת: החלפת הפרדיגמה, ייעול הקיימת, או הרחבתה לעולם הפיזי.

מה זה אומר לסטארטאפים ולמפתחים בישראל
האקוסיסטם הישראלי בנוי כמעט כולו על ההנחה שה-LLM נשאר כאן: מאות סטארטאפים מקומיים בונים שכבות מוצר מעל מודלים קיימים, והתוכנית הלאומית למאיצי AI, שעליה דיווחנו, מתוכננת סביב עומסי עבודה של אימון והסקה של מודלי שפה. אם הכיוון ש-DeepMind מציעה יתפוס, ההשלכות לא יגיעו מחר בבוקר, אבל הן נוגעות להחלטות שמתקבלות עכשיו.
- מי שבונה מוצר מעל API של מודל קיים כמעט לא מושפע בטווח הקצר: גם אם הפרדיגמה תתחלף, זה תהליך של שנים, והמודלים הנוכחיים לא נעלמים
- מי שמשקיע בתשתית ייעודית ל-LLM, כמו fine-tuning pipelines או אופטימיזציות inference ספציפיות לטרנספורמר, כדאי שיבנה שכבת הפשטה שתאפשר החלפת ארכיטקטורה בעתיד
- קרנות הון סיכון מקומיות כבר שואלות בפגישות דיו-דיליג'נס מה קורה לחברה אם עלות ההסקה צונחת או אם ארכיטקטורה חדשה משנה את מבנה השוק
- לחוקרים ישראלים באקדמיה זו דווקא הזדמנות: תחום הארכיטקטורות האלטרנטיביות עדיין פתוח, והמרחק בין מאמר אקדמי להשפעה תעשייתית בו קצר מתמיד
העצה הפרקטית למפתחים: אל תשנו כלום במוצר בגלל מאמר אחד, אבל תוודאו שהתלות שלכם במודל ספציפי או בארכיטקטורה ספציפית עוברת דרך שכבת הפשטה אחת שקל להחליף. זה ביטוח זול מאוד מול אי-ודאות ארכיטקטונית.
בין הצהרה מחקרית למציאות מסחרית
כדאי לזכור את הפער בין מה שמעבדות מפרסמות למה שהן עושות. גוגל ממשיכה להשקיע ב-Gemini, ורק החודש הרחיבה את הזמינות של Gemini 3.7 Pro עם context window של 2 מיליון טוקנים. במקביל, המודלים הפתוחים כמו GLM-5.3 ו-Qwen3.8-27B, ששוחררו שניהם ב-14 באוגוסט, ממשיכים לסגור פערים מול המודלים הקנייניים. כלומר: הרכבת המסחרית של ה-LLM דוהרת במלוא הקיטור, בזמן שקרון המחקר כבר מסמן תחנה אחרת.
התרחיש הסביר אינו החלפה חדה אלא היברידיות: רכיבים מהגישה החדשה ייטמעו בהדרגה בדורות הבאים של המודלים, כפי שקרה בעבר עם Mixture of Experts ועם מנגנוני קשב יעילים. גם אם המאמר צודק בכל טענותיו, המעבר יימדד בשנים, לא ברבעונים.
מה הלאה
העיניים נשואות עכשיו לשלושה כיוונים: האם מעבדות מתחרות יגיבו למאמר בפרסומים משלהן, האם DeepMind עצמה תגבה את ההצהרה בקוד ובמודלים פתוחים שמדגימים את הגישה החלופית, והאם קהילת המחקר תצליח לשחזר את התוצאות שביסוד הטענה. עד אז, ההמלצה הכי בטוחה למי שבונה על AI בישראל היא לעקוב, להישאר גמישים ארכיטקטונית, ולא למהר להספיד את הטרנספורמר, אבל גם לא להתחתן איתו.
שאלות נפוצות
האם גוגל מפסיקה לפתח את Gemini בעקבות המאמר של DeepMind?
לא. מדובר במאמר מחקרי של קבוצת חוקרים בתוך DeepMind, לא בהחלטה אסטרטגית של גוגל. החברה ממשיכה להשקיע ולפתח את סדרת Gemini, ומאמרים שסותרים את הקו המסחרי הם חלק שגרתי מפעילות מחקרית.
מה החלופות המוצעות לארכיטקטורת הטרנספורמר?
קהילת המחקר בוחנת כמה כיוונים במקביל: מנגנוני קשב דלילים ויעילים יותר כמו SparDA של NVIDIA ו-MIT, מודלים שמשלבים הבנה פיזיקלית כמו GeoPT, וגישות היברידיות שמשלבות רכיבים חדשים בתוך הארכיטקטורה הקיימת. עדיין אין חלופה אחת שהוכיחה עליונות בקנה מידה תעשייתי.
האם סטארטאפים שבונים על LLMs צריכים לשנות כיוון?
לא בטווח הקצר. גם אם פרדיגמה חדשה תתפוס, המעבר יימשך שנים והמודלים הקיימים לא ייעלמו. ההמלצה המעשית היא לבנות שכבת הפשטה בין המוצר למודל, כך שיהיה אפשר להחליף ארכיטקטורה בעתיד בלי לשכתב את המערכת.
דרגו את הכתבה
הדירוג עוזר לנו לדעת מה שווה לכם.



תגובות