מדד הבטיחות של FLI: אף מעבדת AI לא עוברת את הציון C+
מדד הבטיחות של FLI לקיץ 2026: אנת'רופיק מובילה עם C+ בלבד, xAI ו-DeepSeek נכשלות, וארבע המעבדות הגדולות החלישו את התחייבויות ההשהיה שלהן.

בשבוע שבו מודלים חדשים משוחררים כמעט מדי יום, מכון Future of Life (FLI) פרסם את מדד בטיחות ה-AI שלו לקיץ 2026, והתמונה לא מחמיאה לאף אחד: אף מעבדה מובילה לא קיבלה ציון גבוה מ-C+. אנת'רופיק מובילה את הטבלה בקושי, OpenAI וגוגל DeepMind מסתפקות ב-C, ובתחתית מככבות xAI, DeepSeek ו-Mistral עם ציון נכשל.
מה קובע המדד: תעודת ציונים עגומה
המדד, שפורסם ב-13 באוגוסט בקירוב, מדרג את מעבדות ה-AI הגדולות לפי מכלול קריטריונים של ניהול סיכונים, שקיפות ומחויבות להתחייבויות בטיחות. התוצאות מציירות תעשייה שרצה קדימה בקצב שיא, אבל משאירה את מנגנוני הבלימה מאחור.
- אנת'רופיק: מובילה עם C+ (ציון מספרי של 2.66) — הציון הגבוה ביותר, ועדיין רחוק מ-B
- OpenAI: ציון C
- גוגל DeepMind: ציון C
- מטא: ציון D+
- xAI, DeepSeek ו-Mistral: ציון F, נכשלות
הממצא המטריד ביותר בדוח אינו הציונים עצמם אלא המגמה: ארבע המעבדות המובילות החלישו את התחייבויות ההשהיה שלהן, אותן הבטחות לעצור או להאט פיתוח אם יזוהו יכולות מסוכנות. ב-FLI מכנים את התופעה "moving goalposts": ברגע שההתחייבות מתחילה להכביד, מזיזים את השער.
כשכל מעבדה יודעת שהמתחרה תשחרר מודל חדש בעוד חודש, ההתחייבות לעצור הופכת מסמכות מחייבת להמלצה נחמדה. זה בדיוק מבנה התמריצים שממנו הזהירו כולם
ההקשר: תעודת עניות בעיצומו של מרוץ שחרורים
התזמון של הדוח כמעט אירוני. באותו שבוע ממש השיקה xAI את Grok 4.6, רק 35 ימים אחרי Grok 4.5, ויום לאחר מכן פרסמה גוגל DeepMind מאמר מפת דרכים על המסלולים מ-AGI ל-ASI, כולל תרחישים של שיפור עצמי רקורסיבי שבו AI מאיץ מחקר ופיתוח של AI. כלומר: בדיוק כשהתעשייה מדברת בקול רם על מערכות חזקות מאי פעם, גוף המעקב המרכזי קובע שאף אחד לא מתקרב לרף בטיחות סביר.
הפער הזה בין קצב היכולות לקצב הבקרה הוא לב הסיפור. חברות כמו xAI, שמודל הדגל שלה מתחרה ראש בראש עם GPT-5.6 Sol Max במדדי אינטליגנציה, מקבלות F בבטיחות. גם DeepSeek, ששחררה לאחרונה את V4 Pro וזוכה לאימוץ נרחב בקהילת הקוד הפתוח, נמצאת בתחתית הטבלה. ההצלחה המסחרית והטכנולוגית, מסתבר, לא מתורגמת להשקעה בניהול סיכונים.

למה זה חשוב לארגונים ומפתחים בישראל
למי שבונה מוצרים על גבי מודלים מסחריים, המדד הזה הוא כלי עבודה מעשי ולא רק כותרת. ארגונים ישראליים בתחומי הפיננסים, הבריאות והביטחון נדרשים יותר ויותר להצדיק את בחירת הספק בפני רגולטורים, לקוחות ומחלקות סיכונים פנימיות, ומדד חיצוני ועצמאי כמו של FLI הופך לחלק מהתיעוד הזה.
- בחירת ספק: פער בין F ל-C+ הוא שיקול לגיטימי במכרזים ובסקרי ספקים, לצד מחיר וביצועים
- חוזים ו-SLA: כדאי לדרוש מספקים סעיפי שקיפות על אירועי בטיחות ושינויים במדיניות ההשהיה
- ניהול סיכונים: מדד ה-FLI נותן שפה משותפת לשיחה בין צוותי הפיתוח לצוותי ה-GRC בארגון
- ריבוי ספקים: הדוח מחזק את הטיעון לארכיטקטורה שלא נעולה על מודל יחיד, כך שאפשר להחליף ספק אם הסיכון משתנה
אם אתם בוחרים ספק מודלים לפרויקט ארגוני, אל תסתפקו בבנצ'מרקים של ביצועים. בקשו מהספק את מסמכי ה-Responsible Scaling או מסגרת הבטיחות שלו, ובדקו אם ההתחייבויות שם עודכנו לרעה בשנה האחרונה — בדיוק הנקודה שהמדד מסמן.
הביקורת: האם ציונים בכלל משנים משהו?
בתעשייה יש מי שמפקפק בערך המעשי של המדד. הטענה המרכזית: הציונים משקפים בעיקר שקיפות ותיעוד, לא בהכרח בטיחות בפועל, ומעבדה שמפרסמת הרבה מסמכים תקבל ציון גבוה יותר ממעבדה שמרנית גם אם ההתנהלות הפנימית דומה. מנגד, תומכי המדד עונים שבהיעדר רגולציה מחייבת, לחץ ציבורי ותחרות על מוניטין הם כמעט הכלי היחיד שקיים, וגם C+ של אנת'רופיק הושג בין היתר בזכות מדדים קודמים שדחפו את התעשייה לפרסם מסגרות בטיחות.
חשוב גם לזכור שהמדד מגיע על רקע שאלת מאקרו כבדה: חישוב שהציג דיוויד קאהן מסיקויה באותו שבוע מצביע על פער עצום בין השקעות התשתית בתחום לבין ההכנסות בפועל. כשהלחץ הכלכלי להחזיר השקעות גובר, החשש הוא שהבטיחות תהיה הסעיף הראשון שמתקצץ.
מה הלאה
המדד הבא של FLI צפוי לבחון האם המעבדות מגיבות לביקורת או ממשיכות להזיז שערים. שני דברים שווים מעקב בחודשים הקרובים: האם xAI ו-DeepSeek, שנכשלו, יפרסמו מסגרות בטיחות פורמליות בעקבות הלחץ, והאם רגולטורים באירופה ובארה"ב יתחילו להשתמש במדדים עצמאיים כאלה כתשתית לדרישות מחייבות. עבור השוק הישראלי, שנשען כמעט כולו על מודלים של המעבדות האלה, התשובות לשאלות האלה יקבעו לא מעט מכללי המשחק של 2027.
שאלות נפוצות
מהו מדד בטיחות ה-AI של FLI?
זהו דירוג תקופתי של מכון Future of Life שמעניק ציונים למעבדות ה-AI הגדולות לפי ניהול סיכונים, שקיפות ועמידה בהתחייבויות בטיחות. בגרסת קיץ 2026 אף מעבדה לא עברה את הציון C+.
איזו חברת AI קיבלה את ציון הבטיחות הגבוה ביותר ב-2026?
אנת'רופיק מובילה את מדד FLI לקיץ 2026 עם ציון C+ (2.66). אחריה OpenAI וגוגל DeepMind עם C, מטא עם D+, ואילו xAI, DeepSeek ו-Mistral קיבלו ציון נכשל F.
מה המשמעות של המדד לארגונים שמשתמשים ב-AI?
המדד משמש כלי עצמאי להערכת סיכוני ספקים: הוא רלוונטי לבחירת מודל במכרזים, לניסוח דרישות שקיפות בחוזים ולתיעוד מול רגולטורים. פער בין ציון F ל-C+ הוא שיקול לגיטימי לצד מחיר וביצועים.
דרגו את הכתבה
הדירוג עוזר לנו לדעת מה שווה לכם.



תגובות