מודל שפה · Meta
Llama
המודל הפתוח שמאיים על OpenAI, אך גם מגלה סדקים
בשבוע השני של אפריל 2025, כששני מיליון מפתחים מסביב לעולם הורידו את Llama 4 של Meta תוך 48 שעות מהשקתו, היה נראה שהמלחמה על העתיד של בינה מלאכותית פתוחה הוכרעה. Meta הציגה ארכיטקטורת Mixture-of-Experts מתקדמת, יכולות מולטימודליות מובנות, וחלון הקשר של 10 מיליון טוקנים – כל אלה במחיר של אפס דולר. אבל כשבועיים מאוחר יותר, כשמפתחים התחילו לבדוק את המודל בעומק, התחילו לצוף טענות על שיווק מטעה, ביצועים גרועים בקוד, וגרסה "ניסיונית" שהשתמשה בה Meta לבנצ'מרקים מבלי להבהיר זאת. הסיפור של Llama הוא הסיפור של הבטחה גדולה שנתקלת במציאות קשה.
עד יולי 2026, Llama היא עדיין המודל הפתוח הנפוץ ביותר בעולם, עם נתח שוק של 11.3% בקטגוריית Language Models ו-9% בשוק הארגוני. אבל החרכים ברצפה מתרחבים: המודל המתקדם ביותר, Behemoth, לא שוחרר מעולם אחרי דחיות חוזרות; ביצועי הקוד של Maverick עומדים על 16% בלבד בבנצ'מרק aider polyglot, הרחק מ-Claude ו-DeepSeek; ובאפריל 2026 Meta עצמה השיקה את Muse Spark – מודל closed-weight, הראשון בתולדות החברה. השאלה היא אם Llama עדיין אלופת הפתיחות, או שהשקיעה כבר מתחילה.
מה זה Llama ואיך זה עובד
Llama (Large Language Model Meta AI) היא משפחת מודלי שפה גדולים שMeta פיתחה החל מ-2023 במטרה מוצהרת: לאתגר את ההגמוניה של OpenAI ולהוכיח שבינה מלאכותית פתוחה יכולה להתחרות במודלים קנייניים. בניגוד ל-GPT או Claude, שהם שירותים סגורים שדורשים מנוי ו-API, Llama זמינה להורדה חופשית (תחת רישיון Llama Community License) – כל מפתח, חברה או מעבדת מחקר יכולים להוריד את המשקולות, להריץ את המודל על התשתית שלהם, ולהתאים אותו לצרכים ספציפיים. זו הסיבה שסטארטאפים ישראליים בנו על Llama מודלים מותאמים לעברית כמו DictaLM 2.0, שאומן על 50 מיליארד מילים בעברית.
הדור האחרון, Llama 4, מסמן קפיצת מדרגה טכנולוגית. במקום ארכיטקטורה מונוליטית שמעבירה כל טוקן דרך כל הפרמטרים, Llama 4 משתמשת ב-Mixture-of-Experts (MoE) – שיטה שבה מיליארדי פרמטרים מחולקים ל"מומחים" קטנים, וכל טוקן מופנה רק לזוג מומחים רלוונטיים. Llama 4 Scout, למשל, מחזיקה 109 מיליארד פרמטרים כוללים אך מפעילה רק 17 מיליארד בכל רגע נתון – מה שמאפשר לה לרוץ על GPU יחיד H100 בעלות של 25,000-35,000 דולר, במקום לדרוש חוות שרתים שלמה. Maverick מגדילה את מספר המומחים ל-128 ומחזיקה 400 מיליארד פרמטרים, ואילו Behemoth – שלא שוחרר מעולם – תוכנן להגיע ל-288 מיליארד פרמטרים פעילים.
הייחוד של Llama 4 הוא שהיא אומנה באופן טבעי על טקסט ותמונות יחד. במקום לקחת מודל טקסט ולהוסיף לו שכבת ראייה בדיעבד, Meta אימנה את כל המשפחה על 30 טריליון טוקנים מעורבים – קוד, שפה טבעית ב-12 שפות (כולל ערבית, הינדי וספרדית, אך לא עברית), ותמונות. התוצאה היא מודל שמבין הקשר בין טקסט לתמונה באופן מובנה, לא כתוספת. אבל כפי שנגלה אחר כך, ההבטחות הטכניות לא תמיד התממשו בפועל.
היכולות המרכזיות – הבטחות וסדקים
לפי הבנצ'מרקים הרשמיים של Meta, Llama 4 Maverick מנצח את GPT-4o ו-Gemini 2.0 Flash במגוון משימות, ו-Behemoth (שלא שוחרר) מתעלה על GPT-4.5 ו-Claude Sonnet 3.7 במבחני STEM. Scout משיג תוצאות טובות יותר מ-Gemini 2.0 Flash-Lite ו-Gemma 3, ועולה פי 16-25 פחות מהמתחרים. בתיאוריה, Llama 4 מציעה את השילוב הטוב ביותר בין ביצועים לעלות. בפועל, התמונה מורכבת יותר.
- **אריכות הקשר וירטואלית**: Scout מתהדר בחלון הקשר של 10 מיליון טוקנים, אבל המודל אומן רק עד 256,000 טוקנים. מעבר לכך, הפלט יורד באיכות באופן דרמטי – בבנצ'מרק Fiction.LiveBench ב-128K טוקנים, Scout משיג 15.6% מול 90.6% של Gemini 2.5 Pro.
- **ביצועי קוד גרועים**: Maverick הגיע לציון של 16% בבנצ'מרק aider polyglot, הרחק מ-DeepSeek V3 ו-Claude 3.7 Sonnet. Code Llama 70B (דור קודם) השיג 67.8% ב-HumanEval, אבל הדורות החדשים לא הראו שיפור מהותי.
- **רגישות להוראות**: Maverick רגיש מאוד לתבניות ההוראות (prompt templates) – אותה שאילתה יכולה להניב תוצאות שונות לחלוטין בין ספקים שונים (Together AI, Groq, Deepinfra), כי כל ספק משתמש בפורמט מעט שונה.
- **מניפולציה בבנצ'מרקים**: Meta השתמשה בגרסה "ניסיונית" של Maverick לבנצ'מרקים – גרסה שאופטמזה ל"שיחתיות" ולא זמינה לציבור. LMArena, הפלטפורמה הרשמית להשוואת מודלים, עדכנה את מדיניותה אחרי שMeta לא הבהירה את ההבדל.
הורדנו את Maverick עם ציפיות גבוהות אחרי הבנצ'מרקים של Meta. בפועל, בכל בדיקת קוד שעשינו המודל נכשל בדברים בסיסיים – לולאות, ניהול שגיאות, אפילו סינטקס. זה עובד נהדר לטקסט טבעי, אבל לפיתוח תוכנה זה לא בשל.
Llama מול המתחרים
המאבק על המודלים הפתוחים מתנהל על שני צירים: ביצועים טכניים ותמחור. Llama 4 מנסה לכבוש את שני החזיתות, אך המתחרים לא עומדים מנגד. DeepSeek V3 מסין מציע ביצועי קוד מעולים במחיר דומה; Gemini 2.0 Flash של Google מהיר יותר וזול באותה מידה; ו-Claude 3.7 Sonnet של Anthropic עולה פי כמה אך מוביל בבנצ'מרקים של הנמקה וקוד. הטבלה הבאה משווה את המרכזיים.
שימושים בפועל – מהסטארטאפ הישראלי ועד הענקית הבינלאומית
Llama משמש בשלושה תרחישים עיקריים. הראשון הוא **פיתוח מוצר בסטארטאפים**: חברות ישראליות קטנות משתמשות ב-Scout או Maverick להוסיף יכולות AI בעלות נמוכה – צ'אטבוטים, סיכום מסמכים, תרגום. התמחור של $0.18 למיליון טוקנים קלט הוא הפרש קריטי בהשוואה ל-$3 של Claude. השני הוא **מחקר אקדמי**: אוניברסיטאות ומעבדות מחקר בארץ מורידות את Scout ומריצות אותו על GPU יחיד H100, במקום לשלם מנויים ל-OpenAI. זה מאפשר ניסויים ב-fine-tuning ובהתאמה לעברית – כמו DictaLM 2.0, שאומן על 50 מיליארד מילים בעברית ומשמש כבסיס למודל לאומי.
התרחיש השלישי הוא **ארגונים גדולים עם צרכי פרטיות**: חברות פיננסיות, בתי חולים וגופי ממשל לא יכולים להעביר נתונים ל-OpenAI או Google בגלל רגולציות. הם מורידים את Llama, מריצים אותו על שרתים מקומיים, ומבצעים fine-tuning על נתונים פנימיים. למשל, בנק ישראלי יכול להשתמש ב-Llama 3.3 70B לניתוח מסמכי הלוואות מבלי לחשוף נתונים חיצונית. הבעיה היא ש-Behemoth, שהיה אמור להתחרות ב-GPT-4.5 ברמת הביצועים, לא שוחרר מעולם – מה שמשאיר ארגונים עם Maverick שחלש בקוד, או עם הדור הקודם Llama 3.1 405B.
תמחור וגישה – ספקים, רבדים ואפשרויות
Meta לא מפעילה API ישירה ל-Llama – במקום זאת, המודל זמין דרך שלושה ערוצים. הראשון הוא **הורדה ישירה**: מפתחים מורידים את המשקולות מ-Hugging Face או Meta AI, ומריצים על תשתית מקומית. GPU יחיד H100 עולה 25,000-35,000 דולר, ו-DGX H100 מלא (למודלים גדולים כמו Maverick) עולה 300,000 דולר ומעלה. זה מתאים לארגונים גדולים או מעבדות מחקר. השני הוא **API צד שלישי**: ספקים כמו Together AI, Groq, Deepinfra ו-Vercel מספקים גישה ל-Llama דרך API בתשלום לפי שימוש. השלישי הוא **פלטפורמות ענן**: AWS, Google Cloud ו-Azure מציעים Llama כחלק מקטלוג המודלים שלהם.
- **Llama 4 Maverick**: $0.20 למיליון טוקני קלט, $0.60 למיליון טוקני פלט (Vercel הזול ביותר ב-$0.20)
- **Llama 3.3 70B**: $0.23/$0.40 למיליון טוקנים ב-Deepinfra (הזול ביותר נכון למאי 2026); $0.59/$0.79 ב-Groq (מהיר פי 10)
- **Llama 3.2 1B Instruct**: $0.02 למיליון טוקני קלט – המודל הזול ביותר במשפחה, מתאים לאפליקציות קלות
- **Self-hosting**: GPU יחיד H100 80GB עולה 25,000-35,000 דולר; DGX H100 מלא 300,000+ דולר למודלים גדולים
למי זה מתאים
Llama מתאים למפתחים וארגונים שמחפשים שילוב של פתיחות, תמחור תחרותי ויכולת התאמה – אבל לא למי שצריך את הביצועים הטובים ביותר בקוד או באריכות הקשר. סטארטאפים ישראליים קטנים עם תקציב מוגבל ימצאו ב-Scout או Maverick אלטרנטיבה זולה פי 16-25 מ-Claude, והפתיחות מאפשרת fine-tuning ועיבוד מקומי. מעבדות מחקר ואוניברסיטאות יכולים להוריד את Scout ולהריץ אותו על GPU יחיד H100 בלי לשלם מנויים. ארגונים גדולים עם צרכי פרטיות – בנקים, בתי חולים, גופי ממשל – יכולים להריץ את Llama על שרתים מקומיים ולהבטיח שנתונים לא עוזבים את הארגון. אבל מי שצריך את הביצועים הטובים ביותר בקוד – 92% ב-HumanEval, 68% ב-aider polyglot – עדיף עם Claude 3.7 Sonnet או DeepSeek V3. ומי שצריך חלון הקשר ארוך אמיתי – 2 מיליון טוקנים בביצועים יציבים – עדיף עם Gemini 2.0 Pro.
שאלות נפוצות
כמה עולה להשתמש ב-Llama 4 בישראל?
Llama 4 Scout עולה $0.18 למיליון טוקני קלט ו-$0.59 למיליון טוקני פלט ב-Together AI – פי 16 זול יותר מ-Claude Sonnet 4.6 ($3/$15). Maverick עולה $0.20/$0.60. אפשר גם להוריד את המודל בחינם ולהריץ על תשתית מקומית – GPU יחיד H100 עולה 25,000-35,000 דולר.
האם Llama תומך בעברית?
Llama 4 אומן על 12 שפות, אבל עברית לא ביניהן (ערבית, אנגלית, צרפתית, גרמנית, הינדי ועוד). עם זאת, מפתחים ישראלים בנו על Llama מודלים מותאמים לעברית כמו DictaLM 2.0, שאומן על 50 מיליארד מילים בעברית. אפשר גם לבצע fine-tuning של Llama 3.1 405B על טקסט עברי עם משאבי חישוב נאותים.
מה ההבדל בין Llama 4 Scout, Maverick ו-Behemoth?
Scout הוא המודל הקל – 109 מיליארד פרמטרים כוללים, 17 מיליארד פעילים, רץ על GPU יחיד H100. Maverick גדול יותר – 400 מיליארד פרמטרים כוללים, 128 מומחים, מנצח את GPT-4o בבנצ'מרקים אך חלש בקוד. Behemoth – 288 מיליארד פרמטרים פעילים – לא שוחרר מעולם אחרי דחיות חוזרות מקיץ 2025.
האם Llama באמת פתוח לחלוטין?
כן ולא. Llama זמין להורדה חופשית, אבל תחת רישיון Llama Community License – לא רישיון קוד פתוח אמיתי (open source). החברה יכולה להשתמש בו בחינם, אבל יש מגבלות על שימוש מסחרי לחברות גדולות. באפריל 2026 Meta השיקה את Muse Spark – מודל closed-weight לחלוטין, מה שמעלה סימני שאלה על עתיד הפתיחות של Llama.
עודכן לאחרונה: 19 ביולי 2026