דילוג לתוכן הראשי

איך להריץ Qwen3.5-4B מקומית על Mac ולבדוק את צריכת הזיכרון

מדריך להרצת Qwen3.5-4B בפורמט GGUF דרך Transformers על Mac: הכנת הסביבה, בדיקת האצה וצריכת זיכרון, פתרון תקלות וחיבור לממשק שיחה.

איתי רוזןאיתי רוזןכתב מודלים וכלים
·6 דק׳ קריאה
0:00 / 8:46
מחשב שולחני קומפקטי בעמדת פיתוח בתל אביב, לצד מסך עם תרשימי שימוש בזיכרון

כדי להריץ Qwen מקומית על Mac, לא מספיק להוריד קובץ GGUF ולראות תשובה: צריך לוודא שהטעינה אכן משתמשת במסלול המואץ ושצריכת הזיכרון לא מתנפחת. ב־22 בספטמבר 2026 פרסמה Hugging Face מדריך להרצה יעילה של GGUF דרך Transformers, כולל Qwen3.5-4B ושרת עם API תואם OpenAI. הנה סדר עבודה מעשי למחשב מתאים, מהכנת סביבת Python ועד בדיקת עברית וחיבור לממשק שיחה.

1. בדקו התאמה והקימו סביבת ניסוי נקייה

GGUF הוא פורמט להפצת מודלים, בין השאר בייצוג מכווץ באמצעות quantization. קובץ קטן יותר על הדיסק אינו הוכחה לכך שהמודל יישאר מכווץ גם בזמן החישוב: אופן הטעינה ורכיבי ההרצה קובעים מה יקרה בזיכרון. החידוש כאן הוא האפשרות לעבוד במסלול יעיל בתוך סביבת Transformers המוכרת, ולא עצם היכולת לשמור מודל בקובץ GGUF.

נכון ל־28 בספטמבר 2026, המסלול המואץ במדריך מתמקד ב־Apple Silicon ובארכיטקטורות נתמכות. בדקו תחילה את סוג המעבד דרך פרטי המחשב, ואז את דרישות התאימות במקור הרשמי המקושר. אין להסיק שההוראות יעבדו ללא שינוי על Mac מבוסס Intel או על כל קובץ GGUF שתמצאו. התחילו במודל שבדוגמה, ורק לאחר הרצה תקינה נסו חלופות.

  1. תעדו את דגם המחשב, מערכת ההפעלה וכמות הזיכרון הזמינה לפני ההתקנה.
  2. צרו תיקיית ניסוי נפרדת מפרויקט העבודה, כדי לא לשנות לו תלויות.
  3. ודאו שגרסת Python שלכם עומדת בדרישות המדריך הרשמי.
  4. סגרו יישומים כבדים לפני המדידה, ורשמו אילו יישומים נשארו פתוחים.
mkdir qwen-gguf-test
cd qwen-gguf-test
python3 -m venv .venv
source .venv/bin/activate
python -m pip --version

הפקודות האלה מכינות סביבה בלבד; הן עדיין לא מתקינות את מסלול ההאצה. ההפרדה חשובה במיוחד במחשב של סטודנט או בצוות פיתוח ישראלי שבו אותו Mac משמש גם לפרויקטים עם תלויות אחרות. אם הניסוי נכשל, אפשר ליצור סביבה חדשה בלי לפרק סביבת עבודה קיימת.

2. התקינו לפי המקור והריצו את דוגמת Qwen

פתחו את מדריך Hugging Face והעתיקו ממנו את פקודות ההתקנה העדכניות, כולל רכיבי ההאצה. ההתקנה המתועדת בתחקיר היא מענף הפיתוח main, לא מגרסה יציבה ממוספרת. לכן התקנה רגילה של Transformers אינה בהכרח שחזור של הסביבה המתוארת, וגם הוראות שנשמרו לפני שינוי בענף עלולות להוביל לתוצאה אחרת.

main הוא ענף פיתוח משתנה. לאחר ההתקנה שמרו את פלט pip freeze, את פקודות ההתקנה ואת מזהה ה־commit שהותקן, אם הוא זמין. אל תעדכנו במקביל את סביבת העבודה הראשית רק כדי לבדוק את החידוש.

כעת העתיקו מהמקור את דוגמת הטעינה של Qwen3.5-4B, לרבות מזהה המאגר, שם קובץ ה־GGUF והגדרות הטעינה המדויקות. אלה פרטים שלא כדאי לנחש או להחליף בשמות שנראים דומים. בהרצה הראשונה השאירו את הדוגמה ללא שינויים: המטרה היא לוודא שההורדה, הטעינה ויצירת התשובה מצליחות לפני שמוסיפים ממשק, מסמכים או לוגיקה משלכם.

שמרו את פלט המסוף מתחילת הטעינה ועד סוף התשובה. לאחר הצלחת הדוגמה, החליפו רק את הקלט בבקשה קצרה בעברית, למשל: ״נסח הודעה ללקוח על שינוי מועד משלוח, בלי להמציא תאריך חדש״. כך אפשר להפריד בין בעיית התקנה לבין בעיית איכות בתשובה, במקום לנסות לאבחן את שתיהן יחד.

מחברת בדיקות פתוחה לצד מחשב נייד, עם עמודות בכתב יד למדידות זיכרון וזמן בהרצות חוזרות
השוו הרצות באותם תנאים ותעדו את ההבדלים, במקום להסתמך על התרשמות מתשובה אחת.

3. ודאו שהמודל לא נפרס מחדש בזיכרון

במהלך הטעינה חפשו אזהרות על dequantization. בבדיקה שפרסם XBSTACK ב־26 בספטמבר תואר מצב שבו חוסר התאמה בין PyTorch לרכיבי ההאצה לווה באזהרה הבאה:

Dequantizing the whole model
הודעת אבחון מתהליך הטעינה, כפי שתועדה בבדיקה

אם ההודעה מופיעה, עצרו לפני שאתם מסיקים שהרצה מכווצת פועלת כמצופה. משמעותה שהמודל כולו עובר dequantization, ולכן גודל הקובץ אינו מדד מספיק לצריכת הזיכרון בפועל. פתחו את Activity Monitor ובחנו את הזיכרון של התהליך, את לחץ הזיכרון ואת השימוש ב־swap לפני הטעינה, אחריה ובזמן יצירת התשובה.

  1. שמרו את האזהרה המלאה ואת גרסאות PyTorch ורכיבי ההאצה שהותקנו בפועל.
  2. השוו את הסביבה לדרישות ולפקודות במדריך הרשמי, ולא רק לשם Transformers.
  3. שחזרו בסביבה נקייה ושנו רכיב אחד בכל פעם, כדי לזהות מה משפיע.
  4. הריצו שוב את אותו קלט עם אותו קובץ ואותן הגדרות יצירה, ובדקו גם זיכרון וגם מהירות.

בבדיקת XBSTACK, מעבר מ־PyTorch 2.14.0 ל־2.13.0 העלה את חציון המהירות מ־29.24 ל־80.55 טוקנים בשנייה. זהו ממצא של המחבר בסביבה מסוימת, לא יעד ביצועים למחשב שלכם ולא המלצה גורפת לשנמוך. הלקח המעשי הוא לבדוק תאימות לפני שמאשימים את המודל, ולדרוש שיפור שניתן לשחזר אצלכם.

4. מדדו ביצועים ובדקו עברית במשימות אמיתיות

הפרידו בין זמן הורדת הקבצים, זמן טעינת המודל והזמן הדרוש ליצירת תשובה. בצעו הרצת חימום, ואז כמה הרצות חוזרות באותם תנאים. שמרו קלט קבוע, מגבלת פלט קבועה ואותן הגדרות דגימה; אם התשובות שונות באורכן, זמן כולל לבדו אינו השוואה הוגנת. אל תשוו מדידה שכוללת טעינה למדידה שמתחילה כשהמודל כבר בזיכרון.

לעסק בארץ כדאי לבנות אוסף בדיקות קטן ממשימות יומיומיות, עם מידע פיקטיבי: סיכום פנייה לשירות, חילוץ פרטים מהזמנה וניסוח הודעה שמשלבת עברית ושמות מוצרים באנגלית. בדקו בנפרד דיוק, היצמדות להוראות, שמירת מספרים והתמודדות עם מידע חסר. תשובה עברית שוטפת אינה בהכרח תשובה נכונה, והתחקיר אינו מספק בסיס להבטחה על איכות העברית של המודל.

5. חברו ממשק שיחה רק אחרי שהבסיס עובד

המדריך הרשמי כולל גם הפעלת שרת עם API תואם OpenAI. השתמשו בפקודת השרת ובפרטי הבקשה שמופיעים בו, ואז הגדירו בלקוח תואם את כתובת השרת המקומי ואת מזהה המודל בהתאם לדוגמה. תאימות API אינה מבטיחה שכל תכונה של כל לקוח תעבוד; התחילו בהודעת טקסט אחת ורק אחר כך בדקו היסטוריית שיחה.

השאירו את השרת נגיש למחשב המקומי בלבד בתחילת הניסוי. לפני חיבור מחשבים נוספים, בדקו הגבלת גישה, הגדרות רשת ומדיניות שמירת לוגים. הרצה מקומית יכולה לצמצם העברת תוכן לשירות חיצוני, אבל צריך לבדוק גם את ממשק השיחה והתוספים: שרת מקומי לבדו אינו מבטיח שכל שרשרת העבודה נשארת על המחשב.

מבחן הסיום פשוט: טעינה במסלול המצופה, צריכת זיכרון שנמדדה, ביצועים שחוזרים על עצמם ותשובות עבריות שעומדות בבדיקות שלכם. רק אז שמרו את הסביבה המוצלחת וחברו אותה לפרויקט. למפתח או לעסק בישראל, זו דרך להחליט אם ההרצה המקומית שימושית בפועל, בלי להסתמך על הבטחת מהירות או איכות שלא נבדקה אצלם.

שאלות נפוצות

האם אפשר להריץ Qwen3.5-4B מקומית על Mac עם Transformers?

כן, המדריך שפרסמה Hugging Face מדגים טעינה של Qwen3.5-4B בפורמט GGUF ויצירת תשובות. המסלול המואץ מתמקד כרגע ב־Apple Silicon ובארכיטקטורות נתמכות, וההתקנה המתועדת היא מענף הפיתוח main.

מה המשמעות של Dequantizing the whole model בטעינת GGUF?

ההודעה מציינת שהמודל כולו עובר dequantization, ולכן אין להניח שחיסכון הזיכרון של הייצוג המכווץ נשמר בהרצה. צריך לבדוק תאימות בין PyTorch לרכיבי ההאצה ולמדוד זיכרון ומהירות לפני שמשנים גרסאות.

האם צריך לשנמך את PyTorch כדי להריץ GGUF מהר יותר?

לא באופן גורף. בדיקה שצורפה לתחקיר מצאה שיפור בעקבות החלפת גרסה בסביבה מסוימת, אך ההחלטה אצלכם צריכה להתבסס על תאימות מתועדת וניסוי מבוקר בסביבה נפרדת.

#Qwen3.5-4B#GGUF#Transformers#Apple Silicon#PyTorch
מה דעתכם?

דרגו את הכתבה

הדירוג עוזר לנו לדעת מה שווה לכם.

תגובות

התגובה חייבת להיות בעברית ומתפרסמת מיד.
  1. היו הראשונים להגיב.

עוד בנושא