דילוג לתוכן הראשי

Nemotron 3.5 Lightning: המודל הפתוח של NVIDIA שרץ על GPU אחד

NVIDIA שחררה את Nemotron 3.5 Lightning, מודל MoE פתוח עם 30 מיליארד פרמטרים שרץ על GPU יחיד. מה זה אומר למפתחים ולעסקים בישראל.

נועה שגבנועה שגבכתבת מחקר
·4 דק׳ קריאה·1 צפיות
0:00 / 6:13
תחנת עבודה שולחנית עם כרטיס מסך יחיד חשוף לצד מסך רחב במשרד הייטק בשעת ערב

NVIDIA שחררה השבוע את Nemotron 3.5 Lightning, מודל שפה בקוד פתוח שמסוגל לרוץ על GPU יחיד במחשב נייד או שולחני. זהו המודל הפתוח הראשון של החברה מאז שהמנכ"ל ג'נסן הואנג יצא בפומבי לטובת הגישה הפתוחה בתחילת השבוע, והוא מגיע יחד עם ספריית NeMo Switchyard שמנתבת משימות בין מודלים. עבור מפתחים ועסקים בישראל, מדובר באחת ההשקות המעניינות של הקיץ.

מה בדיוק שוחרר: MoE של 30 מיליארד פרמטרים שמתנהג כמו מודל קטן

Nemotron 3.5 Lightning בנוי בארכיטקטורת Mixture of Experts עם 30 מיליארד פרמטרים בסך הכול, אבל רק 3 מיליארד מהם פעילים בכל רגע נתון. זה הטריק שמאפשר לו לספק יכולות של מודל בינוני תוך צריכת משאבים של מודל קטן, כזו שמתאימה ל-GPU בודד. לפי NVIDIA, המודל מספק מהירות פלט גבוהה עד פי 4 והשלמת משימות סוכן מהירה ב-30% לעומת מודלים אחרים בקטגוריה שלו.

מתחת למכסה המנוע מסתתרת ארכיטקטורה היברידית של Mamba2-Transformer, שילוב שנועד לשבור את צוואר הבקבוק של מנגנון ה-attention הקלאסי בהקשרים ארוכים. התוצאה: חלון הקשר של מיליון טוקנים, נתון חריג למודל שאמור לרוץ מקומית. בפועל זה אומר שאפשר להזין למודל מסמכים שלמים, מאגרי קוד או תמלולים ארוכים בלי לבנות סביבו תשתית חיתוך ואחזור מסובכת.

ההקשר: הואנג מצטרף למחנה הקוד הפתוח

ההשקה לא מגיעה בחלל ריק. ימים ספורים לפניה יצא ג'נסן הואנג בהצהרה פומבית לטובת מודלים פתוחים, ובמקביל פרסם מארק צוקרברג מניפסט ארוך בזכות AI בקוד פתוח לצד שחרור מודל הקוד Muse Spark של Meta. המרוץ בין ענקיות ארה"ב לסין על ההובלה בעולם המודלים הפתוחים מתחמם, ו-NVIDIA, שעד כה נתפסה בעיקר כספקית החומרה של כולם, מציבה את עצמה גם כשחקנית מודלים רצינית.

המהלך של NVIDIA מסמן שינוי תפיסה: החברה כבר לא מסתפקת במכירת השבבים, אלא רוצה להגדיר איך נראית מערכת AI שלמה, מהמודל ועד שכבת הניתוב.
גורם בתעשיית השבבים הישראלית

החלק המעניין לא פחות בהשקה הוא ספריית NVIDIA NeMo Switchyard, ששוחררה לצד המודל. הספרייה מנתבת בחוכמה כל משימה למודל המתאים ביותר: שאילתה פשוטה תלך למודל הקל והמהיר, ומשימה מורכבת תופנה למודל כבד יותר. זו הצהרה ארכיטקטונית ברורה: העתיד הוא לא מודל אחד ענק לכל דבר, אלא מערכת מודלים שעובדים יחד.

מהנדסת מקלידה במחשב נייד באזור ישיבה משותף בחברת סטארטאפ תל אביבית, לצדה מסך שמציג גרפים של ביצועי מודל
הרצה מקומית על מחשב נייד: הנתונים לא עוזבים את הארגון

למה זה חשוב דווקא לעסקים ולמפתחים בישראל

ל-NVIDIA מרכז פיתוח ענק בישראל, כך שכל השקה של החברה מהדהדת חזק בהייטק המקומי. אבל מעבר לגאווה המקומית, יש כאן ערך מעשי מיידי: המודל זמין כבר להרצה דרך Ollama, ורץ כולו על המכשיר של המשתמש. עבור ארגונים ישראליים שמתמודדים עם דרישות פרטיות ורגולציה, זו נקודה קריטית.

  • פרטיות מלאה: הנתונים לא עוזבים את המחשב או השרת המקומי, מה שרלוונטי במיוחד לגופים פיננסיים, משרדי עורכי דין וקופות חולים
  • עלות אפס לטוקן: אחרי הורדת המודל אין חיוב לפי שימוש, יתרון משמעותי לסטארטאפים בשלב הפיתוח והניסויים
  • חלון הקשר של מיליון טוקנים: אפשר לעבד חוזים, פרוטוקולים ומאגרי קוד שלמים בלי לפצל אותם
  • מהירות במשימות סוכן: השיפור של 30% בהשלמת משימות agentic הופך אותו למועמד טבעי לסוכנים מקומיים
  • עבודה בלי תלות בענן: רלוונטי לסביבות מנותקות ולתרחישי המשכיות עסקית

מי שכבר בנה בסיס ידע RAG בעברית או סוכן מקומי יכול לנסות להחליף את מודל הבסיס ב-Nemotron 3.5 Lightning דרך Ollama ולבדוק אם חלון ההקשר הענק מייתר חלק משכבת האחזור.

מערכת מודלים במקום מודל-על: הפרדיגמה שמתגבשת

השילוב של מודל קל משקל עם שכבת ניתוב כמו NeMo Switchyard משקף מגמה רחבה יותר במחקר: במקום לדחוף מודל אחד ענק לכל משימה, בונים היררכיה של מודלים מתמחים ומנתב שמחליט בזמן אמת מי מטפל במה. הגישה הזו חוסכת כסף ואנרגיה, מקצרת זמני תגובה, ומאפשרת לשלב מודלים מקומיים קטנים עם מודלי ענן חזקים באותה מערכת.

עבור צוותי פיתוח ישראליים שבונים מוצרי AI, זו נקודה ששווה לתכנן סביבה כבר עכשיו: ארכיטקטורה שמפרידה בין לוגיקת המוצר לבין המודל הספציפי תאפשר להחליף ולשלב מודלים בקלות, במקום להינעל על ספק אחד.

מה הלאה

השאלה הגדולה היא האם NVIDIA תמשיך לשחרר מודלים פתוחים בקצב, ואיך יגיבו OpenAI ו-Anthropic, שמודל העסקים שלהן בנוי על API סגור. בינתיים, למי שרוצה להתרשם בעצמו, נקודת הכניסה פשוטה במיוחד: הורדה דרך Ollama, הרצה על ה-GPU הקיים, ובדיקה מול המשימות האמיתיות של הארגון. אם ההבטחות של NVIDIA יעמדו במבחן המציאות, ייתכן שחלק ניכר מעומסי העבודה שהיום רצים בענן יחזרו הביתה, אל המחשב המקומי.

שאלות נפוצות

מה זה Nemotron 3.5 Lightning של NVIDIA?

מודל שפה בקוד פתוח ששחררה NVIDIA באוגוסט 2026. מדובר במודל MoE של 30 מיליארד פרמטרים עם 3 מיליארד פרמטרים פעילים, ארכיטקטורת Mamba2-Transformer היברידית וחלון הקשר של מיליון טוקנים, והוא מסוגל לרוץ על GPU יחיד.

האם אפשר להריץ את Nemotron 3.5 Lightning על מחשב ביתי?

כן. המודל תוכנן לרוץ על GPU בודד במחשב נייד או שולחני, והוא זמין להורדה והרצה מקומית דרך Ollama. ההרצה המקומית משמעה שהנתונים נשארים אצלכם ואין עלות לפי טוקן.

מה זו ספריית NeMo Switchyard?

ספרייה של NVIDIA ששוחררה לצד Nemotron 3.5 Lightning, ותפקידה לנתב כל משימה למודל המתאים ביותר במערכת. היא מבססת גישה של מערכת מודלים משולבת במקום מודל אחד שמטפל בכל המשימות.

#NVIDIA#Nemotron 3.5 Lightning#מודלים בקוד פתוח#Mamba2#NeMo Switchyard#הרצה מקומית
מה דעתכם?

דרגו את הכתבה

הדירוג עוזר לנו לדעת מה שווה לכם.

תגובות

התגובה חייבת להיות בעברית ומתפרסמת מיד.
  1. היו הראשונים להגיב.

עוד בנושא