דילוג לתוכן הראשי

Groq 3 LPX בייצור מלא: אנבידיה שמה את הכסף על מהירות הסקה

אנבידיה הכריזה ב-Hot Chips שמאיץ ההסקה Groq 3 LPX בייצור מלא: 3,400 טוקנים בשנייה על Gemma 4 31B, שילוב ב-Vera Rubin ולקוחה ראשונה בדרך.

יעל ברנעיעל ברנעעורכת ראשית
·4 דק׳ קריאה·1 צפיות
0:00 / 6:15
טכנאי מתקין מגש שרתים עם מאיצי הסקה במעמד בחוות שרתים מודרנית

אנבידיה הודיעה בכנס Hot Chips ב-24 באוגוסט שמאיץ ההסקה Groq 3 LPX נמצא בייצור מלא. זהו הפרי הראשון של רכישת-הטאלנט של Groq בסכום של 20 מיליארד דולר, והוא מגיע עם מספר שקשה להתעלם ממנו: 3,400 טוקנים בשנייה על מודל פתוח עם הקשר של 100 אלף טוקנים. בשוק שבו סוכני AI מחכים לטוקנים כמו לרמזור ירוק, זו הצהרת כוונות.

מה הוכרז ב-Hot Chips

Groq 3 LPX הוא מאיץ ייעודי להסקה אינטראקטיבית (interactive inference), כלומר תרחישים שבהם משתמש או סוכן ממתין לתשובה בזמן אמת. בניגוד למאיצי האימון הכבדים של אנבידיה, כאן המשחק הוא latency ותפוקת טוקנים לשיחה בודדת. השבב משתלב בפלטפורמת Vera Rubin ותומך בקונפיגורציות של עד 256 מאיצים במעמד שרתים יחיד.

בבדיקות של Artificial Analysis הפיק השבב 3,400 טוקנים בשנייה על המודל הפתוח Gemma 4 31B עם context של 100,000 טוקנים, התוצאה המהירה ביותר שנרשמה אי פעם למודל הזה. ספקית הענן Nebius כבר חתמה כלקוחה הראשונה שתפרוס את השבב.

  • ייצור מלא הוכרז ב-24 באוגוסט 2026 בכנס Hot Chips
  • 3,400 טוקנים בשנייה על Gemma 4 31B עם הקשר של 100 אלף טוקנים
  • עד 256 מאיצים במעמד שרתים אחד במסגרת פלטפורמת Vera Rubin
  • Nebius היא ספקית הענן הראשונה שאישרה פריסה של השבב

למה מהירות טוקנים הפכה לצוואר הבקבוק

בשנתיים האחרונות מרכז הכובד של עומסי ה-AI זז מאימון להסקה, ובתוך ההסקה, מזרימת טקסט לצ'אט אנושי אל שרשראות ארוכות של סוכנים. סוכן שמבצע עשרים קריאות מודל ברצף, כל אחת עם context ארוך, הופך כל מילישנייה של המתנה לעיכוב מצטבר שהמשתמש מרגיש. זו בדיוק הבעיה ש-Groq בנתה סביבה את הארכיטקטורה שלה עוד כחברה עצמאית, ואנבידיה למעשה קנתה את הפתרון במקום לפתח אותו מאפס.

האימון קובע כמה חכם המודל, אבל ההסקה קובעת כמה שימושי המוצר. מי ששולט במהירות הטוקנים שולט בחוויית הסוכנים כולה.
גורם בתעשיית השבבים

ההכרזה גם משתלבת בנרטיב הרחב שאנבידיה בנתה באותו כנס: באותו יום היא חשפה את הארכיטקטורה הפנימית של מעבד Vera, עם 88 ליבות Olympus בעיצוב עצמי, וטענה להאצה של פי 1.8 בעומסי עבודה סוכניים לעומת הדור הקודם. המסר עקבי: הפלטפורמה כולה מכוונת מחדש לעידן הסוכנים, לא רק לאימון מודלים גדולים.

מהנדסת בוחנת לוח מאיץ חשוף על שולחן עבודה במעבדת פיתוח שבבים
מאיצי הסקה ייעודיים הופכים לזירת התחרות המרכזית של תשתיות ה-AI

מה זה אומר למפתחים ולעסקים בישראל

עבור סטארטאפים ישראלים שבונים מוצרי סוכנים, המשמעות המעשית היא שתקרת המהירות של מודלים פתוחים עומדת לזוז. אם היום ריצת סוכן מורכבת על מודל פתוח בסדר הגודל של Gemma 4 31B נמשכת דקות, חומרה שמייצרת אלפי טוקנים בשנייה מכווצת אותה לשניות, ופותחת תרחישים שנחשבו לא ריאליים: סוכני תמיכה שמגיבים בזמן שיחה חיה, עיבוד מסמכים ארוכים בזמן אמת מול לקוח, או לולאות תכנון-ביצוע צפופות בכלי פיתוח.

העובדה ש-Nebius היא הלקוחה הראשונה מעניינת במיוחד, כי ספקיות ענן מתמחות כאלה הן בדיוק המקום שבו צוותים ישראליים קטנים שוכרים כוח חישוב בלי התחייבויות ענק. אם השבב יגיע לזמינות מסחרית רחבה דרך ספקיות מהסוג הזה, היתרון של מהירות הסקה קיצונית יפסיק להיות נחלתן של ענקיות בלבד.

צוותים שבונים סוכנים על מודלים פתוחים: כדאי לתכנן כבר עכשיו ארכיטקטורה שמפרידה בין לוגיקת הסוכן לשכבת ההסקה, כך שמעבר לחומרה מהירה יותר יהיה החלפת endpoint ולא שכתוב.

התמונה הגדולה: אנבידיה סוגרת את הדלת למתחרות

Groq נתפסה במשך שנים כאחד האיומים הבודדים והאמינים על הדומיננטיות של אנבידיה בהסקה, בזכות גישת ה-LPU שהקריבה גמישות לטובת מהירות. רכישת הטאלנט ב-20 מיליארד דולר, שנראתה למבקרים כמחיר מופרז, מתחילה להיראות אחרת כשהמוצר המשולב מגיע לייצור מלא בתוך פרק זמן קצר ועם שיאי ביצועים מתועדים.

מהצד השני, ריכוז כזה של כוח מעלה שאלות מוכרות: מתחרות כמו ספקיות מאיצי הסקה עצמאיות נותרו עם שוק שהצטמצם, והלקוחות תלויים עוד יותר במפת הדרכים של חברה אחת. בטווח הקרוב, מי שירוויח הם המשתמשים, שיקבלו סוכנים מהירים משמעותית. בטווח הארוך, השאלה היא אם יישאר מישהו שיאתגר את התמחור.

מה הלאה

הצעד הבא לעקוב אחריו הוא זמינות מסחרית: מתי ספקיות ענן נוספות מעבר ל-Nebius יציעו את Groq 3 LPX, ובאילו מחירים לשעת חישוב. חשוב גם לראות אילו מודלים פתוחים נוספים יקבלו אופטימיזציה לשבב, ואם היתרון של 3,400 טוקנים בשנייה יישמר גם על מודלים גדולים יותר מ-31 מיליארד פרמטרים. עבור השוק הישראלי, שבו רוב חברות הסוכנים רצות על תשתית שכורה, אלה הנתונים שיקבעו אם ההכרזה הזו תישאר כותרת או תהפוך לשינוי מורגש בחוויית המוצר.

שאלות נפוצות

מה זה Groq 3 LPX של אנבידיה?

Groq 3 LPX הוא מאיץ ייעודי להסקה אינטראקטיבית שנולד מרכישת הטאלנט של Groq על ידי אנבידיה ב-20 מיליארד דולר. הוא משתלב בפלטפורמת Vera Rubin עם עד 256 מאיצים למעמד שרתים, ונכנס לייצור מלא באוגוסט 2026.

כמה מהיר Groq 3 LPX בפועל?

בבדיקות Artificial Analysis הפיק השבב 3,400 טוקנים בשנייה על המודל הפתוח Gemma 4 31B עם הקשר של 100,000 טוקנים. זו התוצאה המהירה ביותר שנרשמה אי פעם למודל הזה.

מתי אפשר יהיה להשתמש ב-Groq 3 LPX בענן?

ספקית הענן Nebius היא הלקוחה הראשונה שאישרה פריסה של השבב. זמינות רחבה יותר אצל ספקיות נוספות ותמחור לשעת חישוב טרם פורסמו, וזה הנתון המרכזי שכדאי לעקוב אחריו בחודשים הקרובים.

#Groq 3 LPX#אנבידיה#Vera Rubin#Hot Chips 2026#הסקת AI#Nebius
מה דעתכם?

דרגו את הכתבה

הדירוג עוזר לנו לדעת מה שווה לכם.

תגובות

התגובה חייבת להיות בעברית ומתפרסמת מיד.
  1. היו הראשונים להגיב.

עוד בנושא