Fable 5 חוזר לאוויר: מסגרת CJS לדירוג Jailbreaks ומה ללמוד ממנה
Fable 5 של Anthropic חזר לזמינות גלובלית עם מסווגי בטיחות, מסגרת CJS לדירוג Jailbreaks ותוכנית HackerOne. ניתוח מעשי לצוותי פיתוח בישראל.

חודש אחרי ההשעיה הזמנית שכפה משרד המסחר האמריקאי, Fable 5 של Anthropic חזר ב-1 ביולי לזמינות גלובלית מלאה. אבל החזרה הזו מגיעה עם חבילה שלמה: מסווגי בטיחות שמחלקים פעילות סייבר לארבע קטגוריות סיכון, מסגרת דירוג חדשה לחומרת Jailbreaks בשם CJS שפותחה עם שותפות Glasswing, ותוכנית Bug Bounty ייעודית ב-HackerOne. לצוותי פיתוח בישראל שבונים על Claude, זו הזדמנות להבין איך נראית אבטחת מודלי שפה כשהיא הופכת מסלוגן למתודולוגיה.
מה קרה: מהשעיה כפויה לפריסה מחודשת
נזכיר את הרקע: Fable 5 ו-Mythos 5 הושקו בתחילת יוני 2026, אך זמן קצר לאחר מכן זיהו חוקרי Amazon פגיעות Jailbreak צרה שאפשרה ניצול מוגבל של חולשות ידועות. התוצאה הייתה חריגה בעוצמתה: השעיה זמנית של הגישה הגלובלית לשני המודלים, מהלך שכבר סיקרנו כאן בהרחבה בהקשר של סיכוני תלות במודל יחיד.
עכשיו Anthropic מספרת איך היא פתרה את הבעיה. החברה פרסה מסווג בטיחות חדש שלטענתה חוסם מעל 99% מניסיונות השחזור של ה-Jailbreak המדווח. המנגנון מעניין במיוחד: בקשות שהמסווג מסמן כחשודות לא נחסמות בהכרח, אלא מנותבות אוטומטית למודל חלש יותר, Claude Opus 4.8. הרעיון הוא שגם אם התוקף עוקף את ההגנה, היכולת שהוא מקבל בפועל מוגבלת.
ארבע קטגוריות סיכון: מה חסום, מה מותר ומה באמצע
הלב של המדיניות החדשה הוא סיווג כל פעילות סייבר לאחת מארבע קטגוריות, כשההחלטה מה המודל מסכים לעשות נגזרת מהקטגוריה ולא משיקול דעת נקודתי:
- שימוש אסור: כופרה, Wipers, פיתוח נוזקות ותשתיות Command and Control חסומים תמיד, בלי תלות בזהות המשתמש.
- שימוש דו-שימושי בסיכון גבוה: בדיקות חדירה, פיתוח Exploits והסלמת הרשאות חסומים כרגע, עד שייבנו בקרות הרשאה שיאפשרו לזהות חוקרי אבטחה לגיטימיים.
- שימוש דו-שימושי בסיכון נמוך: משימות שיכולות לשרת גם תוקף וגם מגן אך עם פוטנציאל נזק מוגבל, מותרות עם ניטור.
- שימוש שפיר: כתיבת קוד רגילה, ניתוח לוגים, לימוד ותיעוד, ללא הגבלה.
החלוקה הזו חשובה למי שבונה מוצרים בתחום האבטחה. חברות ישראליות לא מעטות מפתחות כלי Penetration Testing ופלטפורמות לניהול חולשות, והקטגוריה השנייה אומרת במפורש: כרגע Fable 5 לא ישתף פעולה עם תרחישים כאלה, גם לגיטימיים. מי שתכנן לבנות סוכן אבטחה התקפי על גבי ה-API צריך לתכנן מסלול חלופי או לחכות לבקרות ההרשאה שהובטחו.

מסגרת CJS: סוף סוף שפה משותפת לחומרת פריצות
החידוש המשמעותי ביותר מבחינה מחקרית הוא Cyber Jailbreak Severity, מסגרת דירוג שפותחה בשיתוף שותפות Glasswing ובהשתתפות Amazon, Microsoft ו-Google. עד היום, כשחוקר דיווח על Jailbreak, לא הייתה דרך מוסכמת לומר עד כמה הוא חמור. CJS מנסה לעשות לפריצות מודלים את מה ש-CVSS עשה לחולשות תוכנה.
המסגרת מעריכה כל פריצה על פני ארבעה צירים: רווח היכולת לתוקף (מה הוא מקבל שלא היה לו קודם), רוחב היכולת (האם הפריצה אוניברסלית או נקודתית), קלות ההפיכה לנשק, וגילוי, כלומר עד כמה קל למצוא את הפריצה מלכתחילה. הציונים ממופים לארבע רמות חומרה: CJS-1 נמוך (1 עד 3.5), CJS-2 בינוני (4 עד 6.5), CJS-3 גבוה (7 עד 8.5) ו-CJS-4 קריטי (9 עד 10). פרט מעניין במתודולוגיה: הדירוג הסופי יכול רק לעלות במהלך ההערכה, לא לרדת, כדי למנוע מצב שבו שיקולים עסקיים ממתנים בדיעבד ממצא חמור.
מה שהיה חסר בתחום זה לא עוד מסווג, אלא אוצר מילים משותף. כשלקוח שואל אותי כמה מסוכנת פריצה מסוימת, סוף סוף יש לי סולם להצביע עליו במקום תחושת בטן.
למה זה משנה לצוותים בישראל: מהבטחות לארכיטקטורה
מעבר לכותרות, יש כאן שלוש השלכות מעשיות לארכיטקטים ומובילי פיתוח בארץ. הראשונה נוגעת לניתוב השקט למודל חלש: אם המסווג מסמן בקשה של המשתמש שלכם, היא תרוץ על Opus 4.8 בלי שתדעו בהכרח. משתמשים כבר דיווחו על חסימת-יתר של משימות לגיטימיות ועל ירידה בציוני Benchmark לדיבוג וריפקטורינג בגלל ההורדות האוטומטיות התכופות. אם המוצר שלכם עוסק בקוד שקרוב לעולמות האבטחה, אפילו ניתוח לוגים או סריקת תלויות, כדאי לבנות בדיקות רגרסיה שמזהות מתי התשובות מגיעות ממודל מוחלש.
השנייה היא עלות: התמחור של Fable 5 עומד על 10 דולר למיליון טוקני קלט ו-50 דולר למיליון טוקני פלט. זה מציב אותו בקצה היקר של השוק, ומחייב לוודא שהמשימות שמנותבות אליו באמת מצדיקות את הפער מול Sonnet 5 או מודלים זולים יותר. השלישית היא הזדמנות: תוכנית ה-HackerOne הייעודית פתוחה לחוקרי אבטחה שמגישים Jailbreaks פוטנציאליים, ולקהילת חוקרי הסייבר הישראלית, שכבר מובילה בתוכניות Bug Bounty עולמיות, זה שדה ציד חדש עם מתודולוגיה מסודרת. אפשר גם לפנות ישירות ב-cyber-safeguards@anthropic.com.
בונים על Fable 5? הוסיפו לפייפליין שלכם לוג של מזהה המודל שהחזיר כל תשובה. כך תזהו מוקדם מקרים שבהם בקשות לגיטימיות מנותבות ל-Opus 4.8 ותוכלו לנסח מחדש פרומפטים שמפעילים את המסווג לשווא.
מה הלאה: תקן תעשייתי או פתרון של ספק אחד
השאלה הגדולה היא אם CJS יישאר כלי פנימי של Anthropic ושותפותיה או יהפוך לתקן תעשייתי. העובדה ש-Amazon, Microsoft ו-Google שותפות לפיתוח דרך Glasswing מרמזת על שאיפה לתקן רוחבי, אבל ההיסטוריה של תקני אבטחה מלמדת שהדרך מהצעה לאימוץ גורף ארוכה. בינתיים, מי שרוצה להעמיק יכול לקרוא את מסמך המסגרת המלא שפרסמה Anthropic.
לצוותים בישראל, הלקח המרכזי מהחודש האחרון הוא שאבטחת מודלי שפה כבר אינה בעיה של ספק המודל בלבד. ההשעיה של יוני הוכיחה שרגולציה יכולה לכבות מודל בן-לילה, והחזרה של יולי מוכיחה שההגנות החדשות משנות את התנהגות המודל בדרכים שמורגשות במוצר. מי שמתייחס למודל כתלות תשתיתית לכל דבר, עם ניטור, בדיקות ותוכנית גיבוי, יעבור את הטלטלות הבאות בשלום.
שאלות נפוצות
מה זה מסגרת CJS של Anthropic?
Cyber Jailbreak Severity היא מסגרת לדירוג חומרת פריצות (Jailbreaks) במודלי שפה, שפיתחה Anthropic עם שותפות Glasswing בהשתתפות Amazon, Microsoft ו-Google. היא מעריכה כל פריצה לפי רווח יכולת לתוקף, רוחב היכולת, קלות הפיכה לנשק וקלות גילוי, וממפה את הציון לארבע רמות: CJS-1 עד CJS-4.
למה Fable 5 של Anthropic הושעה ומתי הוא חזר?
ביוני 2026 זיהו חוקרי Amazon פגיעות Jailbreak צרה ב-Fable 5, ומשרד המסחר האמריקאי השעה זמנית את הגישה הגלובלית למודל. ב-1 ביולי 2026 הגישה שוחזרה, לאחר ש-Anthropic פרסה מסווג בטיחות שחוסם מעל 99% מניסיונות שחזור הפריצה ומנתב בקשות חשודות למודל Opus 4.8.
אילו שימושי סייבר Fable 5 חוסם?
המודל חוסם תמיד פיתוח כופרה, Wipers, נוזקות ותשתיות C2. בנוסף, שימושים דו-שימושיים בסיכון גבוה כמו בדיקות חדירה, פיתוח Exploits והסלמת הרשאות חסומים זמנית, עד שייבנו בקרות הרשאה שיאפשרו לזהות חוקרי אבטחה לגיטימיים.
דרגו את הכתבה
הדירוג עוזר לנו לדעת מה שווה לכם.



תגובות