מחקר על Qwen3-VL-4B: פורמט התשובה עשוי להשפיע על ציוני הראייה
מחקר שבחן את Qwen3-VL-4B על 200 תמונות ממאגר COCO מציע שחלק מהמגבלות החזותיות לכאורה קשורות לפורמט התשובה, ולא בהכרח להבנת התמונה.

כשמודל טועה בשאלה על תמונה, קל להסיק שהוא לא הבין מה ראה. מאמר שהוגש ל־arXiv ב־23 בספטמבר מציע הסבר נוסף: לפעמים אופן מסירת התשובה, למשל אות, שם צבע או קואורדינטה, משפיע על הציון שמיוחס ליכולת החזותית. עבור צוות שבוחר מודל לניתוח מסמכים או תמונות, זו הבחנה שיכולה לשנות את תכנון הבדיקה, לא רק את ניסוח השאלה.
מה המחקר בוחן, ומה הוא עדיין לא מוכיח
המאמר נקרא What Looks Like a Capability Limit in Vision-Language Models Is a Readout Limit. הוא בוחן כיצד פורמט התשובה משפיע על הערכת מודלי ראייה ושפה, ובין היתר מתאר ניסוי עם Qwen3-VL-4B על 200 תמונות ממאגר COCO. הטענה המרכזית היא שחלק מהמגבלות שנראות כמו חוסר יכולת עשויות להיות קשורות דווקא לדרך שבה מחלצים מהמודל את התשובה.
ההבחנה חשובה: מודל ראייה ושפה מקבל מידע חזותי והוראות טקסטואליות, אבל הבודק בדרך כלל אינו ניגש ישירות לכל המידע שהמודל עיבד. הוא בוחן פלט. בין התמונה לבין הציון נמצאים גם ניסוח המשימה, שיטת הקידוד של התשובה וכללי ההערכה. המחקר מפנה את תשומת הלב לשלב הזה, במקום לייחס אוטומטית כל כישלון לחוסר יכולת חזותית.
עם זאת, נכון ל־28 בספטמבר מדובר במאמר מחקר חדש, ולא במסקנה שצריך להחיל על כל מודל או יישום. התחקיר אינו מספק שיעור שיפור שאפשר לצטט, וגם לא בסיס לקביעה שכל תשובה שגויה מסתירה הבנה נכונה. הניסוי המתואר הוא סיבה לבחון מחדש את שיטת המדידה, לא אישור להתעלם מטעויות.
איך פורמט תשובה הופך לחלק מהמבחן
להמחשה בלבד, נניח שבתמונה מופיעים כוס אדומה וקערה ירוקה, והמשימה היא לזהות את צבע הכוס. אפשר לבקש את שם הצבע, או להציג רשימת אפשרויות ולבקש את האות המתאימה. בשני המקרים השאלה החזותית דומה, אך במקרה השני נדרש גם מיפוי בין הצבע לבין סימון שרירותי. בקשת קואורדינטה כבר מוסיפה דרישה למיקום ולייצוג מרחבי, ולכן ההשוואה מחייבת זהירות נוספת.
אם מתקבלות תשובות שונות, הפער הוא מידע אבחוני, אך לא הסבר מלא. ייתכן שהמודל מתקשה לזהות את האובייקט; ייתכן שההוראה עמומה; וייתכן שהבעיה נמצאת במיפוי לפורמט המבוקש. כדי להפריד בין האפשרויות צריך לשמור ככל האפשר על אותה משימה ועל אותו מידע, ולא להשוות שתי שאלות שמשנות גם את רמת הקושי.
תשובה שגויה היא תוצאה שצריך להסביר, לא אבחנה מספקת של מקור הכשל.
זו גם הסיבה שציון יחיד דורש הקשר. ציון יכול לתאר היטב ביצועים תחת פרוטוקול מסוים, בלי להכריע מהו גבול היכולת בכל דרך תשאול אפשרית. מנגד, אם מוצר דורש פורמט קשיח והמודל אינו עומד בו, זהו כשל אמיתי של המוצר. ההבחנה המחקרית אינה פוטרת את המערכת מהצורך למסור תשובה שימושית.

למה זה משנה למפתחים ולעסקים בישראל
חשבו על צוות ישראלי שבונה מערכת לבדיקת תצלומי מדפים, או שירות שמחלץ פרטים מטפסים סרוקים. בבדיקת הקבלה שלו, תשובה יכולה להיפסל משום שהפרט זוהה באופן שגוי, אך גם משום שהוא הוחזר בשדה הלא נכון או בפורמט שתוכנת ההמשך אינה יודעת לקרוא. מבחינת הלקוח התוצאה עלולה להיות זהה; מבחינת תיקון המערכת, אלה בעיות שונות.
בעבודה עם עברית כדאי להוסיף לבדיקה גם את השפעת שפת ההוראה וכיווניות הטקסט. אין בתחקיר ממצא על ביצועי המודל בעברית, ולכן אין להסיק שהמחקר כבר פתר קושי מקומי כלשהו. ההמלצה המעשית היא לבנות דוגמאות שמייצגות את המוצר הישראלי בפועל, ולהפריד בין בדיקת השפה לבין בדיקת פורמט התשובה, במקום לשנות את שניהם יחד.
להבחנה הזאת יש משמעות בהחלטות רכש ופיתוח. לפני החלפת מודל או השקעה ב־fine-tuning, כדאי לבדוק אם חלק מהכשל נובע מהוראות, מהגדרת השדות או ממנגנון הערכת התשובות. זו אינה הבטחה לחיסכון, אלא דרך להימנע מטיפול בבעיה הלא נכונה. במערכת שמשפיעה על החלטות רגישות, הצלחה בפורמט אחד גם אינה תחליף לבדיקת אמינות בתנאי השימוש.
איך לתרגם את הממצא לפרוטוקול בדיקה
אפשר להשתמש בשאלת המחקר כדי לשפר בדיקה פנימית, בלי להציג זאת כשחזור של המאמר. המטרה היא לראות אילו טעויות נשארות כאשר משנים את דרך התשובה, ואילו מופיעות בעיקר בגלל חוזה הפלט של המוצר. פרוטוקול מועיל צריך לכלול מראש את כללי ההשוואה ואת ההגדרה של תשובה נכונה.
- בחרו דוגמאות שמייצגות את השימוש האמיתי, עם תשובות ייחוס שנבדקו בידי אדם.
- השוו פורמטים חלופיים תוך שמירה על אותה תמונה, אותו יעד ואותם תנאי הרצה ככל האפשר.
- תעדו בנפרד את נכונות התוכן, את העמידה בפורמט ואת הצלחת העיבוד בתוכנה שמקבלת את התשובה.
- בדקו אם החלופה מוסיפה רמזים או משנה את המשימה. רשימת אפשרויות אינה בהכרח שקולה לתשובה פתוחה.
- לאחר בחירת שיטת התשאול, בחנו אותה על דוגמאות שלא שימשו לפיתוחה, ודווחו גם על סוגי הכשל שנותרו.
אל תבחרו בדיעבד את התשובה המוצלחת מכל פורמט ותציגו את התוצאה כביצועי המוצר. אם המערכת אמורה לבחור בין כמה תשובות, גם מנגנון הבחירה צריך לעמוד למבחן בלי גישה לתשובת הייחוס.
מה נדרש כדי שהמסקנה תהיה רחבה יותר
השלב הבא מבחינה מחקרית הוא לבדוק עד כמה התופעה חוזרת במודלים, במאגרים ובמשימות נוספים, והאם אפשר להבחין באופן עקבי בין כשל חזותי לבין כשל בחילוץ התשובה. חשוב גם לבחון מצבים שבהם אין רשימת אפשרויות נוחה, והמערכת נדרשת להחזיר פלט שמיש בתנאים פחות מבוקרים.
עד אז, הערך של המאמר הוא באזהרה המתודולוגית: אין לזהות אוטומטית בין ציון במבחן לבין גבול היכולת. עבור צוותים בישראל, השאלה המועילה אינה רק איזה מודל קיבל יותר נקודות, אלא מה בדיוק דרש ממנו המבחן לעשות, ואילו מהדרישות האלה קיימות גם במוצר. בדיקה שמפרידה בין הבנת התמונה לבין מסירת התשובה מספקת בסיס טוב יותר להחלטה הבאה.
שאלות נפוצות
מהו readout במודלי ראייה ושפה?
בהקשר של המחקר, readout הוא האופן שבו מחלצים מהמודל תשובה שניתן להעריך, למשל אות של אפשרות, שם צבע או קואורדינטה. בחירת הפורמט עשויה להשפיע על הציון, ולכן שגיאה בתשובה אינה מספיקה לבדה כדי לקבוע מה מקור הכשל.
האם המחקר מוכיח ש-Qwen3-VL-4B מבין תמונות טוב יותר מהציון שלו?
המחקר טוען שחלק ממגבלות הביצועים עשויות לנבוע מאופן חילוץ התשובה, ובוחן זאת בין היתר בניסוי עם Qwen3-VL-4B על 200 תמונות COCO. אין בכך הוכחה שכל טעות היא בעיית פורמט או שהמסקנה תקפה לכל משימה חזותית.
איך בודקים אם פורמט התשובה משפיע על ביצועי מודל חזותי?
משווים כמה פורמטים על אותן תמונות ובאותה משימה, תוך שמירה על תנאי בדיקה דומים. כדאי להפריד בין נכונות התוכן לבין עמידה בפורמט, ולבחון את שיטת התשאול שנבחרה גם על דוגמאות שלא שימשו לפיתוחה.
דרגו את הכתבה
הדירוג עוזר לנו לדעת מה שווה לכם.



תגובות