דילוג לתוכן הראשי

GLM-5.3 של Z.ai: קפיצה בגילוי חולשות בלי לאמן מודל חדש

Z.ai שחררה את GLM-5.3 עם אותו מודל בסיס של הדור הקודם: post-training בלבד הקפיץ אותו ל-84.5% ב-CyberGym, מעל Mythos 5 ו-GPT-5.6 Sol.

נועה שגבנועה שגבכתבת מחקר
·4 דק׳ קריאה·2 צפיות
0:00 / 6:49
אנליסטים בחדר בקרת אבטחה בוחנים קוד מקור על מסך גדול בתאורה כחולה

Z.ai שחררה ב-14 באוגוסט 2026 את GLM-5.3, ומה שמעניין בו הוא לא מה שהשתנה אלא מה שלא: מודל הבסיס נשאר זהה לחלוטין לזה של GLM-5.2. כל השיפור, כולל קפיצה של יותר מ-7 נקודות בבנצ'מרק גילוי החולשות CyberGym, הגיע משלב ה-post-training בלבד. התוצאה מציבה את המודל הסיני מעל המתחרים המובילים של אנתרופיק ו-OpenAI בתחום הסייבר, ומעלה שאלה נוקבת: כמה ביצועים עוד קבורים במודלים קיימים?

מה קרה: אותו בסיס, תוצאות אחרות לגמרי

המספרים שפרסמה Z.ai מדברים בעד עצמם. ב-CyberGym, בנצ'מרק שמודד יכולת לגלות חולשות אבטחה בקוד מקור אמיתי, GLM-5.3 קפץ מ-77.2% בגרסה הקודמת ל-84.5%. הציון הזה עוקף את Mythos 5 של אנתרופיק (83.8%) ואת GPT-5.6 Sol של OpenAI (83.6%), שני המודלים שנחשבו עד כה לשיא בקטגוריה.

הקפיצה הדרמטית עוד יותר נרשמה ב-ExploitBench, בנצ'מרק שבודק לא רק זיהוי חולשה אלא יכולת לנצל אותה בפועל: מ-24.4% ל-54.4%, יותר מהכפלה. הפער בין שני המדדים מלמד משהו חשוב: המודל הקודם ידע למצוא בעיות אבל התקשה להוכיח שהן ניתנות לניצול. הגרסה החדשה סוגרת את הפער הזה, וזה בדיוק ההבדל בין דוח אבטחה תיאורטי לממצא שצוות פיתוח חייב לטפל בו מיד.

לא רק בנצ'מרקים: אלפי חולשות בפרויקטים אמיתיים

ההבדל בין GLM-5.3 לשלל מודלים שמצטיינים במבחנים סינתטיים הוא שהוא כבר הוכיח את עצמו בשטח. לפי Z.ai, המודל נבדק מול קודבייסים אמיתיים וזיהה 2,436 חולשות ב-269 פרויקטים, מתוכן 1,097 בחומרה בינונית עד גבוהה. לפי הדיווחים, בין הממצאים גם חולשה שהוגדרה רצינית ב-Cursor, עורך הקוד מבוסס ה-AI הפופולרי, מה שממחיש שגם כלים שמפתחים משתמשים בהם יומיום אינם חסינים.

  • CyberGym (גילוי חולשות): עלייה מ-77.2% ל-84.5%, מקום ראשון מעל Mythos 5 ו-GPT-5.6 Sol
  • ExploitBench (ניצול חולשות): עלייה מ-24.4% ל-54.4%, יותר מפי שניים
  • בדיקות שטח: 2,436 חולשות שזוהו ב-269 פרויקטים אמיתיים
  • מתוכן 1,097 חולשות בחומרה בינונית-גבוהה, כולל ממצא רציני ב-Cursor
מפתח בוחן דוח ממצאי אבטחה מודפס לצד מסך עם עורך קוד במשרד סטארטאפ
המעבר מזיהוי חולשה לניצול שלה בפועל הוא הפער שהגרסה החדשה סוגרת

ההקשר: post-training הופך לזירת התחרות המרכזית

ההחלטה של Z.ai לא לאמן מחדש את מודל הבסיס היא לא רק חיסכון בעלויות, היא הצהרה מתודולוגית. אימון מודל בסיס מאפס עולה עשרות עד מאות מיליוני דולרים ואורך חודשים. לעומת זאת, post-training ממוקד, כלומר שלבי הכוונון שאחרי האימון הבסיסי, מאפשר לסחוט יכולות חדשות מאותם משקולות בזמן ובעלות נמוכים בסדרי גודל.

מודל הבסיס הוא כבר לא צוואר הבקבוק. רוב המודלים הגדולים יודעים הרבה יותר ממה שהם מפגינים, והשאלה היא מי יודע לחלץ את זה מהם בשלב הכוונון
חוקר בתחום מודלי השפה

המהלך של Z.ai מצטרף למגמה שמסתמנת השנה בכל התעשייה: מעבדות משקיעות פחות בהגדלת מודלים ויותר בשיפור מה שכבר קיים. אם אפשר להשיג קפיצה של 30 נקודות בבנצ'מרק ניצול חולשות בלי לגעת במודל הבסיס, ההשקעה הבאה של כל מעבדה ברורה.

למה זה משנה לישראלים

לתעשיית הסייבר הישראלית יש כאן חדשות משני הכיוונים. מצד ההגנה, חברות ישראליות שבונות מוצרי application security וסריקת קוד מקבלות תזכורת שהיתרון התחרותי שלהן לא יכול להישען על עצם היכולת למצוא חולשות: מודל פתוח-יחסית מסין כבר עושה את זה ברמה שעוקפת את המובילים המערביים. הערך יעבור לשכבות שמעל: תעדוף ממצאים, אינטגרציה ל-CI/CD, והקשר עסקי.

מצד הסיכון, אותה יכולת בדיוק זמינה גם לתוקפים. מודל שמכפיל את ביצועיו ב-ExploitBench הוא כלי שמוריד משמעותית את רף הכניסה לכתיבת exploits. צוותי אבטחה בארגונים ישראליים, במיוחד כאלה שמתחזקים פרויקטי קוד פתוח או קודבייסים ותיקים, צריכים להניח שהקוד שלהם ייסרק בכלים כאלה, אם עוד לא נסרק.

אם הארגון שלכם מסתמך על Cursor או כלי פיתוח מבוססי AI אחרים, שווה לעקוב אחרי פרסומי האבטחה שלהם בשבועות הקרובים. הממצא של GLM-5.3 ב-Cursor ממחיש שגם כלי הפיתוח עצמם הם משטח תקיפה.

מה הלאה

השאלה המיידית היא איך יגיבו אנתרופיק ו-OpenAI, ששני המודלים המובילים שלהן, Mythos 5 ו-GPT-5.6 Sol, איבדו את הבכורה בקטגוריה רגישה במיוחד. אם התשובה שלהן תגיע גם היא דרך post-training ולא דרך דור מודלים חדש, נקבל אישור נוסף לכך שמרוץ ה-AI משנה שלב: פחות מרוץ חימוש על גודל, יותר תחרות על מתודולוגיות כוונון.

במקביל, כדאי לעקוב אחרי האופן שבו קהילת הקוד הפתוח תתמודד עם גל הממצאים: 2,436 חולשות ב-269 פרויקטים הן עומס דיווחים שמתחזקי פרויקטים, רבים מהם מתנדבים, יצטרכו לטפל בו. היכולת של AI למצוא חולשות מהר יותר משבני אדם מסוגלים לתקן אותן היא כבר לא תרחיש עתידי, היא המציאות של אוגוסט 2026.

שאלות נפוצות

מה חדש ב-GLM-5.3 לעומת GLM-5.2?

GLM-5.3 משתמש באותו מודל בסיס של GLM-5.2, וכל השיפורים הגיעו מ-post-training בלבד. התוצאה: עלייה מ-77.2% ל-84.5% ב-CyberGym ומ-24.4% ל-54.4% ב-ExploitBench, בנצ'מרקים לגילוי וניצול חולשות אבטחה.

האם GLM-5.3 טוב יותר מהמודלים של OpenAI ואנתרופיק בסייבר?

בבנצ'מרק CyberGym לגילוי חולשות, GLM-5.3 השיג 84.5% ועקף את Mythos 5 של אנתרופיק (83.8%) ואת GPT-5.6 Sol של OpenAI (83.6%). מדובר בהובלה בקטגוריה הזו, לא בהכרח בכל המדדים.

מה זה post-training ולמה הוא חשוב?

post-training הוא שלב הכוונון שאחרי אימון מודל הבסיס, והוא זול ומהיר בסדרי גודל מאימון מאפס. GLM-5.3 מדגים שאפשר להשיג קפיצות ביצועים משמעותיות רק משלב זה, מה שהופך אותו לזירת התחרות המרכזית בין מעבדות ה-AI.

#GLM-5.3#Z.ai#CyberGym#post-training#גילוי חולשות#ExploitBench
מה דעתכם?

דרגו את הכתבה

הדירוג עוזר לנו לדעת מה שווה לכם.

תגובות

התגובה חייבת להיות בעברית ומתפרסמת מיד.
  1. היו הראשונים להגיב.

עוד בנושא