דילוג לתוכן הראשי
מחקרחדש

Olmo-core 3: תשתית האימון הפתוחה של Ai2 למודלי MoE

Ai2 שחרר את Olmo-core 3, תשתית פתוחה לאימון מודלי תערובת מומחים, ולא מודל חדש. לפי המכון, בניסוי ראשוני נמדדה תפוקה פי כ־2.7 מהיישום הקודם.

נועה שגבנועה שגבכתבת מחקר
·5 דק׳ קריאה
0:00 / 7:23
חוקרת וטכנאי בוחנים שרת GPU פתוח בחדר מחשוב אוניברסיטאי

לא כל התקדמות במחקר AI מגיעה בדמות מודל חדש. ב־1 באוקטובר 2026 שחרר Ai2 את Olmo-core 3, תשתית אימון פתוחה למודלי תערובת מומחים, MoE, ולפי דיווח המכון היא השיגה בניסוי ראשוני תפוקת אימון גבוהה פי כ־2.7 מהיישום הקודם שלו. עבור צוותי מחקר וחברות בישראל שמממנים זמן GPU, זו התפתחות שכדאי לבדוק, אבל לא הבטחה לחשבון מחשוב קטן באותו יחס.

מה שוחרר: תשתית אימון, לא מודל ענק

ההבחנה החשובה ביותר בהכרזה היא בין המודל לבין המערכת שמאמנת אותו. Olmo-core 3 היא תשתית: היא מטפלת באופן שבו העבודה מתבצעת על המעבדים הגרפיים. השחרור אינו של מודל חדש בעל טריליון פרמטרים, ואי אפשר להסיק ממנו לבדו דבר על איכות תשובות של צ'אטבוט, יכולת כתיבת קוד או הבנת עברית.

מודלי MoE מחלקים חלק מהעיבוד בין רכיבים המכונים ״מומחים״. השם אינו מעיד בהכרח על מומחה לרפואה או מומחה למשפטים, אלא על רכיבים נלמדים בתוך הרשת. מנגנון ניתוב קובע אילו מהם יעבדו את הנתונים, ולכן לא רק פעולות החישוב חשובות: גם הדרך שבה הנתונים והמשקלים מגיעים למקום הנכון משפיעה על יעילות האימון.

כאן נכנס השינוי שמציג Ai2. לפי ההכרזה, התשתית משאירה את המומחים על המעבדים הגרפיים ומנתבת אליהם נתונים, במקום לאסוף שוב ושוב את משקלי המודל. הרעיון הוא לשנות את תנועת המידע סביב החישוב, ולא להסתפק בשיפור פעולת חישוב בודדת. זו התקדמות בתחום מערכות האימון, גם בלי להציג יכולת חדשה למשתמש הקצה.

למה מיקום המומחים משפיע על מהירות האימון

באימון מבוזר, כמה מעבדים גרפיים צריכים לעבוד יחד. גם מעבד חזק אינו מועיל במיוחד בזמן שהוא ממתין למידע, ולכן תקשורת, חלוקת עבודה וזיכרון הם חלק מהבעיה המחקרית. צמצום של פעולה חוזרת סביב משקלי המודל עשוי לאפשר לתשתית להשלים יותר עבודת אימון באותו פרק זמן. זה ההיגיון שמאחורי הגישה המתוארת, לא מדידה נוספת מעבר לזו שפורסמה.

עם זאת, העברת הנתונים אל המומחים אינה מבטלת את הצורך בתקשורת. חשוב לבדוק אם העבודה מתחלקת באופן מאוזן, כמה זמן מושקע בהעברה, והאם נוצרים מצבים שבהם חלק מהמעבדים ממתינים לאחרים. אלה שאלות לבחינה בכל הטמעה, ולא טענה שבניסוי של Ai2 התגלתה בעיה כזו.

״יותר עבודת אימון באותו זמן היא הישג תשתיתי; מודל טוב יותר באותו תקציב הוא מבחן נוסף.״
סיכום מערכתי של ההבחנה המחקרית

לפתיחות התשתית יש כאן ערך מחקרי: היא מאפשרת לבחון את היישום ולא להסתפק במספר המופיע בהכרזה. עבור מי שחוקר אימון מבוזר, השאלה המעניינת היא אילו החלטות תכנון יוצרות את השיפור ובאילו תנאים הוא נשמר. אין בכך הבטחה שהמעבר יהיה פשוט, או שכל צוות יוכל לשחזר מיד את התוצאה בסביבתו.

לוח מחיק בחדר צוות מחקר עם תרשים של נתיבי נתונים בין קבוצות מעבדים, לצד מגש שרת מפורק
באימון מבוזר, תכנון תנועת הנתונים חשוב לצד כוח החישוב. צילום המחשה.

פי כ־2.7: מה הניסוי מראה ומה עדיין לא

הנתון שפרסם Ai2 מגיע מניסוי ראשוני במודל של 47 מיליארד פרמטרים, על שמונה מעבדי NVIDIA B300. נקודת ההשוואה הייתה היישום הקודם של המכון. הניסוח הזה חשוב: זו אינה השוואה לכל תשתיות האימון הקיימות, ואינה ראיה לכך שכל מודל MoE יקבל את אותה האצה.

תפוקת אימון גבוהה פי כ־2.7 אינה שקולה אוטומטית להוזלה באותו יחס. כדי להעריך חיסכון צריך למדוד גם זמן ריצה כולל, עלות החומרה, עבודת ההטמעה ואיכות המודל בסיום.

תפוקה מתארת את קצב העבודה; היא אינה מודדת לבדה את ערכו של התוצר. גם אם מערכת מבצעת את צעדי האימון מהר יותר, צריך לבדוק שהריצה מגיעה ליעד האיכות המבוקש. צוות שמחליף תשתית צריך להשוות תנאים שקולים, ולוודא שהשיפור אינו נובע משינוי אחר בהגדרת הניסוי.

  • נקודת ההשוואה: לתעד את התשתית הקיימת, הגדרות האימון והחומרה לפני בדיקת החלופה.
  • ביצועים בפועל: למדוד את הריצה כולה, ולא רק מקטע שנבחר בזכות תפוקה גבוהה.
  • איכות התוצר: להשוות את המודלים לאחר האימון באמצעות אותן משימות הערכה.
  • התאמה לסביבה: לבדוק תקשורת בין המעבדים, צריכת זיכרון ויציבות בתצורה שבה יעבוד הצוות.
  • עלות כוללת: לכלול זמן מהנדסים, בדיקות והפעלה, ולא רק זמן GPU.

גם גודל הניסוי מציב גבול לפרשנות. התוצאה שנמסרה מתייחסת למודל ולמערך חומרה מוגדרים; היא אינה מוכיחה כשלעצמה כיצד תתנהג התשתית במערך גדול יותר. שאלת ההרחבה היא בדיוק מסוג השאלות ששחרור תשתית פתוחה מאפשר לחוקרים נוספים לבחון באופן עצמאי.

מה זה אומר לצוותי AI בישראל

עבור מעבדה באוניברסיטה או חברת AI ישראלית שמאמנת מודלי MoE, נקודת הפתיחה אינה רכישת חומרה חדשה בעקבות הכותרת. הצעד הסביר הוא ניסוי השוואתי מוגבל על משימה קיימת, עם יעד איכות ותקציב מוגדרים מראש. אם הביצועים משתפרים בתנאים המקומיים, אפשר לשקול הרחבה; אם לא, הנתון מההכרזה אינו תחליף למדידה.

הזווית המקומית מתחדדת כשמטרת האימון כוללת עברית. האצת התשתית לא מבטיחה כשלעצמה שיפור בשפה, ולכן כדאי להפריד בין שאלת היעילות לבין מבחני איכות בעברית. למשל, צוות שמפתח מערכת למסמכים עסקיים צריך לבדוק את משימות המסמכים שלו לאחר האימון, ולא להסתפק בכך שהריצה הסתיימה מוקדם יותר.

לעומת זאת, עסק ישראלי שמשתמש במודל דרך API אינו מקבל כאן כלי חדש שאפשר פשוט להפעיל במוצר. ההשפעה האפשרית עליו עקיפה ותלויה בהחלטות של ספקי המודלים, לא בעצם פרסום התשתית. אין בהכרזה בסיס להבטיח ירידת מחירים או זמינות של שירות חדש.

השלב הבא שכדאי לעקוב אחריו הוא שחזור התוצאה בתצורות נוספות ובדיקה של העלות עד להשגת איכות נתונה. התרומה האפשרית של Olmo-core 3 אינה רק לקצר ריצה אחת, אלא לאפשר לצוותים לבצע יותר ניסויים במסגרת המשאבים שלהם. בינתיים, ההישג המדווח ממוקד וברור: שיפור בתפוקת אימון בתצורה שנבדקה, עם תשתית פתוחה שמאפשרת להעמיד אותו למבחן.

שאלות נפוצות

מה זה Olmo-core 3, והאם מדובר במודל AI חדש?

Olmo-core 3 היא תשתית אימון פתוחה של Ai2 למודלי תערובת מומחים, MoE, ששוחררה ב־1 באוקטובר 2026. זה אינו שחרור של מודל חדש בעל טריליון פרמטרים, אלא של תשתית שנועדה לייעל את האימון.

כמה מהר יותר Olmo-core 3 מאמנת מודלים?

Ai2 דיווח על תפוקת אימון גבוהה פי כ־2.7 מהיישום הקודם שלו בניסוי ראשוני במודל של 47 מיליארד פרמטרים על שמונה מעבדי NVIDIA B300. התוצאה מתייחסת לתצורה שנבדקה, ואינה מבטיחה שיפור זהה בחומרה אחרת או חיסכון מקביל בעלות הכוללת.

איך Olmo-core 3 משנה את האימון של מודלי MoE?

התשתית משאירה את רכיבי המודל המכונים מומחים על המעבדים הגרפיים ומנתבת אליהם נתונים, במקום לאסוף שוב ושוב את משקלי המודל. עבור צוותי מחקר בישראל, כדאי לבחון אם השיטה משפרת ביצועים על החומרה, הרשת והמודל שבשימושם לפני מעבר מלא.

#Olmo-core 3#Ai2#MoE#אימון מודלים#אימון מבוזר
מה דעתכם?

דרגו את הכתבה

הדירוג עוזר לנו לדעת מה שווה לכם.

תגובות

התגובה חייבת להיות בעברית ומתפרסמת מיד.
  1. היו הראשונים להגיב.

עוד בנושא