מודל שפה · Meta
Llama
תחקיר עומק: Llama של Meta — מודל השפה הפתוח שמנסה לשנות את כללי המשחק

כשמהנדס בכיר בחברת סטארט-אפ ישראלית מעלה את קוד הבסיס של המוצר שלו למודל שפה ומקבל תשובות סתומות או קוד מקולקל, הוא לא חושב על פרמטרים או בנצ'מרקים. הוא רוצה לדעת דבר אחד: האם המודל הזה באמת יכול לעשות את העבודה. במקרה של Llama 4 של Meta — השקת הדגל הפתוחה של אפריל 2025 — התשובה מסובכת הרבה יותר ממה שכותרות הפרסום הבטיחו.
Llama 4 הגיע עם הבטחות גדולות: חלון הקשר של 10 מיליון טוקנים, ארכיטקטורת Mixture-of-Experts חדשנית, ו-400 מיליארד פרמטרים במודל Maverick הגדול. אבל מתחת לפני השטח מתגלה סיפור מורכב של הישגים טכניים מרשימים לצד כשלים מביכים, שערוריות בנצ'מרקים, ומתח פנימי ב-Meta שהוביל להתפטרות של סגנית נשיא המחקר. בשוק שבו GPT-5 מתקרב והסינים מפתיעים עם DeepSeek V3, Meta מנסה להוכיח שקוד פתוח יכול להתחרות בענקיות — אבל המציאות הרבה יותר מורכבת.
מה זה Llama ואיך זה עובד
Llama (Large Language Model Meta AI) הוא משפחת מודלי שפה גדולים שפיתחה Meta, עם גישה שונה בתכלית מהמתחרים: קוד פתוח מלא. בניגוד ל-GPT או Claude שמציעים רק גישה דרך API, Meta משחררת את המשקולות (weights) של המודל להורדה חופשית. כל מפתח או חברה יכולים להוריד את Llama, להריץ אותו על השרתים שלהם, ולהתאים אותו לצרכים ספציפיים — ללא תשלום רישוי ובלי לשתף נתונים עם Meta.
Llama 4, שהושק באפריל 2025, מסמן קפיצת מדרגה טכנולוגית. הוא בנוי על ארכיטקטורת Mixture-of-Experts (MoE) — במקום להפעיל את כל הפרמטרים לכל טוקן, המודל מפעיל רק חלק מה"מומחים" הרלוונטיים. Maverick, למשל, מכיל 128 "מומחים" אבל מפעיל רק 17 מיליארד פרמטרים פעילים בכל רגע. זה כמו להחזיק צוות ענק של מומחים אבל לשלוח רק את המתאימים ביותר לכל משימה — חסכון חישובי עצום בלי לפגוע בביצועים.
השינוי המרכזי השני הוא מולטימודאליות מובנית דרך "early fusion" — המודל מעבד טקסט ותמונות מהתחלה, לא כתוספות חיצוניות. הוא אומן על 30 טריליון טוקנים (פי שניים מ-Llama 3) ב-12 שפות, כולל ערבית והינדי. בניגוד לדורות קודמים שהיו בעיקר מודלי טקסט טהור, Llama 4 מתכנן מראש להבין הקשרים ויזואליים ולשלב אותם עם טקסט באופן טבעי.
היכולות המרכזיות — והפערים בפועל
הנייר הטכני מבטיח מודל שמכה את GPT-4o ו-Gemini 2.0 Flash בבנצ'מרקים רבים. Maverick אכן הגיע לציונים מרשימים: 80.5% ב-MMLU Pro (הבנת שפה מתקדמת) ו-69.8% ב-GPQA Diamond (שאלות מדעיות ברמת דוקטורט). Scout, המודל הקטן יותר, מתמקד במשימה אחרת: עיבוד הקשרים אדירים עד 10 מיליון טוקנים — די כדי לעבד כ-15 ספרים מלאים בבת אחת.
- חלון הקשר ענק: Scout מציע 10 מיליון טוקנים לעומת מיליון של Gemini 2.5 Pro — פי 10. במהדורה זו היה אמור להיות פריצת דרך לניתוח מסמכים מסיביים
- יעילות MoE: Maverick עם 400 מיליארד פרמטרים כולל רץ על 4 כרטיסי H100 (במקום 32 שדרושים למודל צפוף דומה) — הפחתה דרמטית בעלויות חומרה
- מולטימודאליות אמיתית: המודל מבין טקסט ותמונות ביחד, מתוכנן לתמוך בוידאו בעתיד — לא רק OCR פשוט אלא הבנה הקשרית משולבת
- 12 שפות מובנות: תמיכה בערבית, הינדי, ספרדית ועוד — רלוונטי במיוחד לחברות ישראליות שפועלות בשווקים רב-לשוניים
הבעיה: רוב היכולות האלה לא עובדות כמפורסם. חלון ההקשר של 10M נכשל במבחנים מעל 256K טוקנים (המודל לא אומן על יותר מזה), ביצועי הקידוד של Maverick נחותים משמעותית מ-Claude 3.7 Sonnet ו-DeepSeek V3 — דירוג של 16% בלבד ב-Aider Polyglot לעומת עשרות אחוזים אצל המתחרים.
הבעיה עם Llama 4 היא לא הטכנולוגיה — היא מרשימה. הבעיה היא שמטא מכרה לנו חלון של 10 מיליון טוקנים שקורס אחרי 256 אלף, ומודל שאמור להתחרות ב-GPT אבל נכשל בקידוד בסיסי. זה תסכול כפול: יש לך את החומרה, את הידע, אבל לא את הביצוע.
Llama מול המתחרים — איפה הוא באמת עומד
על הנייר, Llama 4 נראה כמתחרה אמיתי. במציאות, המרחק מהמובילים גדל. GPT-5.4 של OpenAI מגיע ל-84% ב-GPQA (לעומת 69.8% של Maverick), Claude Opus 4.6 של Anthropic דומיננטי בקידוד עם 70.4% ב-LiveCodeBench, ואפילו DeepSeek V3 הסיני מנצח בקידוד ובהיגיון — עם פחות פרמטרים ועלויות אימון נמוכות בהרבה.
שימושים בפועל — מי באמת משתמש ב-Llama
למרות החסרונות, בין 7,074 ל-10,868 חברות משתמשות ב-Llama — בעיקר כי הוא פתוח וללא עלויות רישוי. בישראל, סטארט-אפים רבים בתחום ה-B2B מריצים את Llama על שרתים פרטיים כדי לשמור על פרטיות נתונים. חברה ישראלית בתחום ה-LegalTech, למשל, משתמשת ב-Scout לניתוח חוזים ארוכים (למרות מגבלת ה-256K האפקטיבית), כי הקוד הפתוח מאפשר לה להריץ הכל בענן פרטי ולעמוד בתקני GDPR.
- אירוח עצמי לפרטיות: חברות בריאות ופיננסים בישראל מריצות Llama על שרתים מקומיים במקום לשלוח נתונים רגישים ל-API חיצוני — חיסכון של אלפי דולרים בחודש
- התאמה אישית לדומיינים ספציפיים: Llama מאפשר fine-tuning על קורפוסים ספציפיים — למשל, חברת אבטחת סייבר ישראלית מאמנת אותו על דוחות איומים ומקבלת ביצועים טובים יותר מ-GPT גנרי
- עיבוד מסמכים ארוכים (במגבלות): למרות הבעיות בחלון הארוך, Scout עדיין מאפשר עיבוד של עשרות מסמכים בו-זמנית — יותר מ-GPT-4 Turbo הישן
- פרוטוטייפים מהירים בעלות נמוכה: Llama 3.3 70B ב-Groq ($0.59-$0.79/M) פופולרי בקרב מפתחים ישראליים לבניית MVP של צ'אטבוטים וכלי אוטומציה
זווית ישראלית: הקהילה המקומית של מפתחי Llama פעילה במיוחד ב-Meetup "AI Israel" ובקבוצות Slack/Discord ייעודיות. מפתחים ישראליים תורמים לפרויקטים כמו llama.cpp (הרצה מהירה על CPU) ו-Ollama (ממשק ידידותי למפתחים). בניגוד ל-GPT, השימוש בקוד פתוח מאפשר לחברות ישראליות להתחרות בשוק הגלובלי בלי תלות בספקי ענן אמריקאים.
תמחור וגישה — מה באמת עולה להריץ Llama
הבלבול הגדול: Llama עצמו חופשי, אבל "להריץ" אותו זה כבר לא. יש שלוש דרכים עיקריות לעבוד עם המודל, כל אחת עם מבנה עלויות שונה לחלוטין. השאלה היא לא "כמה עולה Llama" אלא "כמה עולה להפעיל אותו בסקלה שאני צריך".
- API דרך ספקים: Vercel מציעה Maverick ב-$0.20 input / $0.60 output למיליון טוקנים; AWS Bedrock גובה $0.50 input; Together AI ו-Groq מציעים מחירים דומים. זול ממתחרים סגורים אבל עדיין יקר לשימוש אינטנסיבי
- אירוח עצמי על GPU משלך: H100 80GB עולה $25,000-$35,000; Scout צריך GPU אחד, Maverick צריך 4 (כ-$120,000-$140,000 סה"כ). חשמל: Scout על RTX 4090 ביתי עולה ~$46 בחודש. מתאים לארגונים עם נפח גבוה ודרישות פרטיות
- השכרת GPU בענן: H100 עולה $2-4 לשעה; Maverick על 4x H100 = $8-16 לשעה. זול לניסויים, יקר לשימוש 24/7 (עד $11,500 בחודש)
- רישוי מגביל: שימוש מסחרי חופשי עד 700 מיליון משתמשים חודשיים — בפועל ללא מגבלה לרוב החברות. אבל המודל חסום רשמית באיחוד האירופי בגלל AI Act
טיפ חיסכון: לשימוש בינוני (עד כ-100M tokens בחודש), API של Vercel או Together AI זול יותר מאירוח עצמי. מעבר לנפח הזה, אירוח עצמי על H100 משתלם — התשואה מגיעה אחרי כ-6-8 חודשים. סטארט-אפים ישראליים לעיתים משכירים H100 משותף או משתמשים ב-Groq לפרוטוטייפ ועוברים לאירוח עצמי רק בייצור.
למי זה מתאים — ומי צריך להימנע
Llama 4 הוא בחירה מצוינת לחברות שדורשות שליטה מלאה בנתונים ובתשתית, מוכנות להשקיע בלמידת ההרצה, ולא תלויות בקידוד אינטנסיבי. סטארט-אפים ישראליים בתחומי LegalTech, HealthTech, וFinTech שצריכים לעמוד בתקנות פרטיות מחמירות יכולים להפיק ערך אמיתי מהגמישות והפתיחות. חברות שמעבדות מסמכים ארוכים (עד 256K tokens בפועל) או צריכות התאמה אישית דרך fine-tuning ימצאו ב-Llama יתרון אמיתי על פני מתחרים סגורים.
מי צריך להימנע: מפתחים שתלויים בקידוד מורכב ידרשו ממאיר Claude 3.7 Sonnet או DeepSeek V3. חברות שצריכות אמינות מוחלטת ותמיכה ארגונית חזקה ימצאו את GPT-5 או Gemini 2.5 Pro יציבים יותר. ארגונים קטנים ללא מומחיות DevOps לניהול GPU ומודלים יתקשו עם האירוח העצמי. ומי שפועל באיחוד האירופי — Llama פשוט לא אופציה חוקית כרגע.
שאלות נפוצות
האם Llama 4 באמת חינמי או שיש עלויות נסתרות?
המשקולות (weights) של Llama 4 חינמיות לחלוטין להורדה ושימוש, אפילו מסחרי, עד 700 מיליון משתמשים חודשיים. אבל "להריץ" אותו עולה כסף: צריך GPU (H100 עולה $25,000-$35,000 או השכרה ב-$2-4 לשעה), או שימוש ב-API של ספקים כמו Vercel ($0.20-$0.60 למיליון טוקנים). אין עלות רישוי, אבל יש עלות תשתית משמעותית.
למה Llama 4 נחות ב-coding אם הוא כל כך גדול?
למרות 400 מיליארד פרמטרים, Llama 4 Maverick קיבל רק 16% ב-Aider Polyglot benchmark (לעומת עשרות אחוזים של Claude 3.7 ו-DeepSeek V3). הבעיה היא לא הגודל אלא נתוני האימון והכיוונון — Meta התמקדה בידע כללי ובחלון הקשר ארוך, לא בקידוד ספציפי. בנוסף, ארכיטקטורת MoE לפעמים מקשה על משימות שדורשות עקביות קפדנית בפורמט.
האם חלון ההקשר של 10 מיליון טוקנים באמת עובד?
לא בפועל. למרות הפרסום, Llama 4 לא אומן על מעל 256K טוקנים, והאיכות קורסת מעבר לזה. במבחן Fiction.LiveBench, Scout קיבל רק 15.6% ב-128K טוקנים (Gemini 2.5 Pro: 90.6%). בקוונטיזציה 4-bit, החלון האפקטיבי הוא בסביבות 5M לא 10M. זה שיווק מטעה, והמודל לא מתאים למסמכים ארוכים מעבר ל-256K בפועל.
האם כדאי לחברה ישראלית להשקיע באירוח עצמי של Llama או להשתמש ב-API?
תלוי בנפח ובפרטיות. עד ~100 מיליון טוקנים בחודש, API של Vercel/Together AI זול יותר ($20-$60). מעבר לזה, אירוח עצמי על H100 משתלם — ההשקעה ($25K-$140K לחומרה) מחזירה את עצמה אחרי 6-8 חודשים. אם יש דרישות פרטיות (GDPR, נתונים רגישים), אירוח עצמי הכרחי מהיום הראשון למרות העלות. חברות רבות בישראל מתחילות ב-API למשוב מהיר ועוברות לאירוח עצמי רק בייצור.
עודכן לאחרונה: 20 ביולי 2026