GLM-5.3 של Z.ai: קפיצת ביצועים בלי לגעת במודל הבסיס
Z.ai שחררה את GLM-5.3 עם אותו מודל בסיס של 5.2, וכל השיפור מגיע מ-post-training: זינוק מ-4.6 ל-28.3 ב-Terminal-Bench 3.0. מה זה אומר למפתחים בארץ.

Z.ai שחררה ב-14 באוגוסט את GLM-5.3, והנתון המעניין ביותר בהשקה אינו ציון בנצ'מרק כזה או אחר, אלא מה שהחברה לא עשתה: היא לא אימנה מודל בסיס חדש. GLM-5.3 משתמש באותו מודל בסיס בדיוק של GLM-5.2, וכל השיפור מגיע משלב ה-post-training בלבד. התוצאה: זינוק מ-4.6 ל-28.3 ב-Terminal-Bench 3.0, ועלייה מ-46.2 ל-66.9 ב-DeepSWE v1.1.
מה בדיוק השתחרר, ולמה המספרים חריגים
בעולם שבו כל שדרוג משמעותי מגיע בדרך כלל עם pre-training יקר מאפס, Z.ai בחרה במסלול אחר: לקחת את מודל הבסיס הקיים של GLM-5.2 ולהשקיע את כל המשאבים בשלב שאחרי. המשמעות המעשית היא שכל הפער בין שתי הגרסאות נובע מטכניקות כמו fine-tuning ממוקד, למידת חיזוקים על משימות סוכניות ועיצוב קפדני של דאטה סינתטי, ולא מעוד טריליוני טוקנים של אימון גולמי.
המספרים ממחישים עד כמה השלב הזה הפך לקריטי. ב-Terminal-Bench 3.0, בנצ'מרק שבודק יכולת לעבוד בטרמינל אמיתי לאורך משימות מרובות צעדים, GLM-5.2 השיג 4.6 בלבד, כלומר כמעט לא תפקד. GLM-5.3, על אותו בסיס בדיוק, קפץ ל-28.3. ב-DeepSWE v1.1, שמודד פתרון באגים ומשימות הנדסת תוכנה, העלייה היא מ-46.2 ל-66.9. אלה לא שיפורים שוליים של נקודה-שתיים, אלא הבדל בין מודל שלא שמיש למשימות סוכניות לבין מתחרה חזיתי.
כולם התרגלו לחשוב שהקסם קורה ב-pre-training ושהשאר זה ליטוש. ההשקה הזאת מראה שהיחס מתהפך: מודל הבסיס הוא חומר הגלם, וה-post-training הוא המוצר.
יום אחרי גוגל: קרב הקידוד של אמצע אוגוסט
העיתוי לא מקרי. רק יום קודם, ב-13 באוגוסט, גוגל השיקה את Gemini 3.7 Flash, מודל שממוקד בעצמו בקידוד וסוכנים ומתומחר אגרסיבית ב-$0.75 למיליון טוקני קלט ו-$3.75 לפלט. בשני בנצ'מרקים שני המודלים כמעט צמודים: ב-DeepSWE v1.1 מדובר על 66.9 ל-GLM-5.3 מול 65.9 ל-Gemini 3.7 Flash, הפרש של נקודה אחת. אבל ב-Terminal-Bench 3.0 נפער פער דרמטי: 28.3 ל-GLM-5.3 מול 14.9 בלבד למודל של גוגל, כמעט פי שניים.
הפער הזה מספר סיפור חשוב למי שבונה סוכנים. משימות טרמינל ארוכות דורשות מהמודל להחזיק תוכנית לאורך עשרות צעדים, להתאושש משגיאות ולנהל state של סביבה אמיתית. דווקא שם, ההשקעה הממוקדת של Z.ai ב-post-training סוכני מניבה את היתרון הגדול ביותר, בעוד שבמשימות הנדסת תוכנה קלאסיות שני המודלים כבר מתכנסים לאותה רמה.

למה זה משנה: הכלכלה של החזית משתנה
אם אפשר להפיק קפיצת ביצועים כזאת בלי לאמן מודל בסיס מחדש, המשוואה הכלכלית של כל התעשייה מתערערת. pre-training של מודל חזיתי דורש אשכולות ענק, חודשי אימון והון עתק. post-training, לעומת זאת, זול בסדרי גודל, מהיר יותר לאיטרציה, וניתן למיקוד לפי תחום: קידוד, סוכנים, שימוש בכלים.
- מחזורי שחרור מתקצרים: כשלא צריך לאמן בסיס חדש, אפשר לשחרר גרסה משופרת תוך שבועות, כפי ש-Z.ai עשתה
- היתרון עובר לדאטה ולמתודולוגיה: מי שמחזיק סביבות אימון סוכניות איכותיות ודאטה של משימות אמיתיות מנצח, לא בהכרח מי שמחזיק הכי הרבה GPU
- שחקנים קטנים חוזרים למשחק: צוותים בלי תקציב של מעבדת ענק יכולים לקחת מודל בסיס קיים ולהפוך אותו למוביל בנישה ספציפית
- הבנצ'מרקים הסוכניים הופכים למגרש המרכזי: Terminal-Bench ו-DeepSWE מודדים בדיוק את מה ש-post-training יודע לשפר
המגמה הזאת אינה ייחודית ל-Z.ai: גם גל השחרורים המהיר של גוגל, עם Gemini 3.7 Flash שלושה שבועות בלבד אחרי 3.6 Flash, מרמז שחלק ניכר מהשיפורים בין גרסאות מגיע היום משכבות האימון המאוחרות ולא מבסיס חדש.
הזווית הישראלית: מה עושים עם זה בפועל
לסטארטאפים ישראלים שבונים סוכני קוד, אוטומציה של DevOps או כלי CLI חכמים, ההשקה הזאת רלוונטית בשני מישורים. הראשון מיידי: אם עומס העבודה שלכם כולל משימות טרמינל ארוכות, שווה להריץ הערכה פנימית של GLM-5.3 מול Gemini 3.7 Flash על המשימות האמיתיות שלכם, כי הפער ב-Terminal-Bench רומז שהבחירה בין השניים תלויה מאוד בסוג המשימה ולא רק במחיר.
המישור השני אסטרטגי, והוא אולי החשוב יותר. אקוסיסטם ה-AI הישראלי חזק בדיוק במקומות שהמעבר ל-post-training מתגמל: דאטה תפעולי איכותי, הבנת דומיין עמוקה בסייבר, פינטק ותשתיות, וצוותי מחקר קטנים וזריזים. אם החזית באמת עוברת מ'מי מאמן את הבסיס הגדול ביותר' ל'מי מלטש הכי חכם', חברות ישראליות יכולות לבנות מודלים מובילים בנישות שלהן על גבי מודלי בסיס פתוחים, בלי להתחרות בתקציבי המחשוב של הענקיות.
מה הלאה
השאלה הפתוחה היא כמה רחוק אפשר למתוח את הגישה הזאת. ייתכן שיש תקרה: post-training מוציא מהבסיס יכולות שכבר חבויות בו, ובשלב מסוים יידרש בסיס חזק יותר כדי להמשיך להתקדם. אבל בטווח הקרוב, סביר שנראה עוד שחקנים מאמצים את המתכון של Z.ai: לקפוא על מודל בסיס יציב, ולשחרר גרסאות משופרות בקצב של שבועות. למפתחים בארץ זה אומר דבר אחד ברור: טבלת המובילים בקידוד סוכני תתחלף מהר, וכדאי לבנות את המערכות שלכם כך שהחלפת מודל תהיה עניין של קובץ קונפיגורציה, לא של ארכיטקטורה.
שאלות נפוצות
מה ההבדל בין GLM-5.3 ל-GLM-5.2?
שני המודלים חולקים את אותו מודל בסיס בדיוק. כל השיפור ב-GLM-5.3 מגיע משלב ה-post-training בלבד, והוא דרמטי: Terminal-Bench 3.0 זינק מ-4.6 ל-28.3 ו-DeepSWE v1.1 עלה מ-46.2 ל-66.9.
מה עדיף לקידוד, GLM-5.3 או Gemini 3.7 Flash?
תלוי במשימה. ב-DeepSWE v1.1 הם כמעט צמודים (66.9 מול 65.9), אבל במשימות טרמינל ארוכות GLM-5.3 מוביל בפער גדול: 28.3 מול 14.9 ב-Terminal-Bench 3.0. לסוכני CLI ואוטומציה ארוכת טווח יש ל-GLM-5.3 יתרון ברור.
מה זה post-training במודלי שפה?
post-training הוא כל שלבי האימון שאחרי ה-pre-training הבסיסי: fine-tuning ממוקד, למידת חיזוקים ואימון על משימות סוכניות. הוא זול ומהיר בהרבה מאימון בסיס מאפס, ו-GLM-5.3 מדגים שאפשר להפיק ממנו קפיצות ביצועים משמעותיות.
דרגו את הכתבה
הדירוג עוזר לנו לדעת מה שווה לכם.



תגובות