אימון AI על טקסט סינתטי: ניסוי קצר עשוי לחזות אובדן גיוון
מחקר קדם־פרסום שבחן 13 גרסאות מודלים מצא הבדלים בפגיעות לאובדן גיוון באימון חוזר על טקסט סינתטי, ומציע ניסוי קצר לזיהוי מודלים רגישים.

מה קורה כשה־AI לומד מטקסט שיצר AI אחר, ואז הדור הבא לומד שוב מתוצרים סינתטיים? מחקר קדם־פרסום חדש מצא שהפגיעוּת לאובדן גיוון שונה במידה ניכרת בין גרסאות מודלים, ושגודל המודל לבדו אינו מסביר את ההבדלים. לצד האזהרה, החוקרים מציעים כיוון מעשי: ניסוי קצר שעשוי לעזור לזהות מראש מודלים רגישים לאימון חוזר.
מה נבדק: חמישה דורות של אימון על תוצרי מודלים
ב־10 בספטמבר 2026 הגישו Yangze Liu ו־Zhongyi Han ל־arXiv את המאמר A Fragility Spectrum for Recursive Language-Model Training. לפי התחקיר, הם בחנו 13 גרסאות מודלים לאורך חמישה דורות של אימון חוזר ומצאו הבדלים של בערך פי חמישה במדד גיוון הטקסט. אלה ממצאי החוקרים במאמר קדם־פרסום, לא תוצאה שכבר אושרה בשחזור עצמאי.
המונח אימון רקורסיבי מתאר כאן שרשרת שבה תוצרים של מודל משמשים חומר לימוד לסבב אימון נוסף. בשונה משימוש במודל כדי לענות על שאלה או לסכם מסמך, הפלט חוזר לתהליך שמעדכן את המודל. השאלה המחקרית היא לא רק אם הטקסט שנוצר נראה טוב, אלא מה נשאר ממגוון הביטויים והאפשרויות אחרי שהשרשרת הזאת חוזרת על עצמה.
חשוב לדייק במשמעות המספר: פער של בערך פי חמישה במדד הגיוון אינו אומר שמודל אחד חכם פי חמישה מאחר, או שהדיוק שלו במשימה עסקית גבוה באותו יחס. זהו מדד לתכונה מסוימת של הטקסט. החידוש הרלוונטי הוא עצם השונות בפגיעוּת, והעובדה שלא ניתן להסביר אותה באמצעות גודל המודל בלבד.
אפשר לעיין במקור כאן: [המאמר ב־arXiv](https://arxiv.org/abs/2609.11149). התאריך מתייחס להגשת הגרסה הראשונה. לצוות ששוקל ליישם את הממצאים, קריאת מערך הניסוי וההגדרות המדויקות של המדדים חשובה לא פחות מקריאת התוצאה המרכזית.
למה אובדן גיוון עלול לחמוק מבדיקת איכות רגילה
קריסת מודלים, בהקשר של הסיפור הזה, אינה בהכרח מצב שבו המערכת מפסיקה לכתוב משפטים תקינים. הבעיה הנבחנת היא הצטמצמות הגיוון לאורך דורות של אימון. אפשר להמחיש את הסיכון באמצעות מערכת שירות היפותטית: היא עשויה להפיק תשובות רהוטות, אבל להציע שוב ושוב אותם ניסוחים ולהתקשות לייצג את מגוון המצבים שעבורם נועדה.
זו גם הסיבה שבדיקה של כמה תשובות מוצלחות אינה מספיקה כדי להעריך תהליך כזה. איכות של דוגמה בודדת וגיוון של אוסף דוגמאות הן שתי שאלות שונות. תשובה יכולה להיות ברורה ושימושית בפני עצמה, ובכל זאת להשתייך למאגר שחוזר על מעט תבניות. ההשלכות על משימת היעד דורשות בדיקה נפרדת; המחקר המתואר אינו מוכיח שכל ירידה בגיוון גורמת בהכרח לירידה זהה בכל יכולת.
טקסט שנראה טוב כדוגמה בודדת אינו בהכרח מאגר אימון טוב לאורך דורות.
מכאן נובעת הבחנה חשובה: המאמר אינו פסק דין נגד נתונים סינתטיים. הוא מצביע על צורך לבדוק את השילוב המסוים של מודל, נתונים ותהליך יצירה. גם בחירה במודל גדול יותר אינה תחליף לבדיקה הזאת, משום שלפי החוקרים הגודל לבדו לא הסביר את טווח הפגיעוּת שנמצא.

הכיוון המעשי: ניסוי קצר ובחינה של top-p
החוקרים מדווחים שניסוי עצמי קצר של שניים עד שלושה דורות יכול לנבא פגיעוּת. המשמעות האפשרית היא שאפשר לחפש סימני אזהרה לפני שמתחייבים לתהליך אימון ממושך. עם זאת, אין כאן בסיס להניח שאותו ניסוי ינבא באותה רמת הצלחה התנהגות בכל שפה, תחום תוכן או שיטת אימון.
ממצא נוסף נוגע ל־top-p, פרמטר דגימה שמגביל את קבוצת האפשרויות שמהן המודל בוחר את הטוקן הבא לפי ההסתברות המצטברת שלהן. לפי החוקרים, צמצום טווח הדגימה באמצעותו כמעט עצר את הקריסה בתנאים שנבדקו. הפרמטר פועל בשלב יצירת הטקסט, ולכן שינויו יכול להשפיע על החומר שייכנס בהמשך לאימון.
התוצאה עשויה להישמע מפתיעה: כיצד צמצום אפשרויות בזמן היצירה מסייע לשמור על גיוון לאורך דורות? צריך להבחין בין רוחב הבחירה בצעד יצירה בודד לבין התפתחות אוכלוסיית הטקסטים אחרי אימונים חוזרים. התחקיר אינו מספק בסיס לקבוע מנגנון סיבתי מלא, ולכן עדיף לראות בממצא השערה מעשית לבדיקה, ולא מתכון שאפשר להעתיק בלי הערכה.
אין כאן ערך top-p מומלץ לכל המודלים. כמעט עצירת הקריסה היא תוצאה בתנאי ניסוי מסוימים, ואינה מוכיחה שהגדרה דומה תשמור גם על דיוק, כיסוי תחומים או ביצועים בעברית.
מה כדאי לצוותים בישראל לבדוק לפני האימון הבא
לחברה ישראלית שמייצרת דוגמאות לצורך fine-tuning של מערכת שירות בעברית, הממצא מציע לשנות את שאלת הבקרה: לא רק כמה דוגמאות נוצרו, אלא מה הן מכסות ומה נעלם מסבב לסבב. שילוב של עברית, ערבית ואנגלית מקצועית, קיצורים ושגיאות כתיב הוא תרחיש בדיקה מקומי רלוונטי. אין בתחקיר תוצאה ייעודית לעברית, ולכן אין להציג את המלצות היישום כהוכחה לביצועים בשוק הישראלי.
- שמרו אוסף הערכה של פניות אמיתיות, לאחר הסרת מידע אישי ובהתאם להרשאות, שאינו נוצר מחדש בכל סבב.
- עקבו אחרי סוגי פניות, נושאים וניסוחים, לצד הצלחה במשימה. בדיקת גיוון אינה מחליפה בדיקת נכונות.
- בחנו ניסוי עצמי קצר בהשראת הצעת החוקרים, תוך תיעוד מקור הנתונים והגדרות היצירה בכל דור.
- השוו הגדרות top-p בתנאים עקביים, ובדקו אם שיפור במדד אחד בא על חשבון כיסוי או איכות בתחום אחר.
אלה צעדי הערכה מוצעים, לא פרוטוקול שהוכח במחקר עבור כל עסק. הם רלוונטיים במיוחד כשצוות מתכנן להזין תוצרים סינתטיים בחזרה לאימון. לעומת זאת, עסק שמשתמש במודל קיים לניסוח הודעות בלבד אינו מבצע בכך אימון רקורסיבי, ואין להסיק מהמאמר שהמודל שלו נשחק מעצם השימוש היומיומי.
השלב הבא הוא לבדוק עד כמה הממצאים מחזיקים במערכי נתונים, שפות ותהליכי אימון נוספים. בינתיים, המסר למפתחים ממוקד: אל תבחרו מודל לייצור נתוני אימון רק לפי גודלו או לפי הרושם מתשובה בודדת. בדקו כיצד מאגר התוצרים משתנה לאורך סבבים, והאם הוא עדיין מייצג את המשתמשים שהמערכת אמורה לשרת.
שאלות נפוצות
מה קורה כשמודל AI מתאמן על טקסט שיצר AI?
באימון חוזר על תוצרים סינתטיים עלול להצטמצם גיוון הטקסט שהמודל מייצר. מחקר קדם־פרסום מספטמבר 2026 מצא שהפגיעוּת לכך שונה בין גרסאות מודלים, ולכן אין להסיק שכל שימוש בנתונים סינתטיים מוביל לקריסה.
איך אפשר לבדוק אם מודל רגיש לקריסה באימון חוזר?
החוקרים מדווחים שניסוי עצמי קצר של שניים עד שלושה דורות יכול לנבא פגיעוּת בתנאים שבדקו. ביישום מעשי כדאי לעקוב גם אחר גיוון הפלט וגם אחר הצלחה במשימות היעד, ולא להתייחס לניסוי כאל אישור גורף לבטיחות האימון.
האם שינוי top-p יכול למנוע קריסת מודלים?
במחקר המתואר, צמצום טווח הדגימה באמצעות top-p כמעט עצר את הקריסה בתנאי הניסוי. זה אינו פתרון מוכח לכל מודל או מאגר נתונים, ולא הוצג בתחקיר ערך אחיד שאפשר להמליץ עליו לכל שימוש.
דרגו את הכתבה
הדירוג עוזר לנו לדעת מה שווה לכם.



תגובות