כמה VRAM צריך ל-LLM מקומי? איזה כרטיס מומלץ לעסק ב-2026
מדריך הנדסי לחישוב זיכרון GPU לפי גודל מודל, קוונטיזציה, אורך הקשר ושפה, עם מדידה עצמית של עברית מול אנגלית ועלות חשמל בישראל.
מאת Powercon | פורסם | עודכן | זמן קריאה: 13 דקות
- הבעיה: קונים כרטיס לפי גודל קובץ המודל
- הפתרון: מחשבים משקולות, ועוד מטמון הקשר, ועוד 0.5 עד 2GB תקורה. מודל של 32 מיליארד פרמטרים ב-4 ביט עם הקשר של 32 אלף טוקנים דורש כ-25.5GB, לא 16GB.
- הבעיה: עברית "אוכלת" יותר זיכרון
- הפתרון: לבחור מודל שמקודד עברית ביעילות. במדידה שלנו אותו טקסט בעברית דרש פי 3.46 טוקנים ב-Llama 3, ורק פי 1.42 ב-Qwen.
- הבעיה: המודל לא נכנס והמחשב "מסתדר"
- הפתרון: לא לסמוך על העברת שכבות לזיכרון המערכת. לפי Spheron, אפיק PCIe Gen5 מעביר כ-64 GB/s, איטי בערך פי 28 מזיכרון ה-RTX 5090 ופי 7 מזה של RTX 5060 Ti.
- השורה התחתונה
- 16GB לעובד בודד, 32GB לצוות קטן, 48GB לעד 10 משתמשים במקביל, 96GB למודל 70B. מעבר לכך, שרת.
אם אתם מחפשים כרטיס מסך מומלץ להרצת LLM מקומי בעסק, השאלה הראשונה אינה כמה הכרטיס מהיר, אלא האם המודל, ההקשר והמשתמשים נכנסים לזיכרון שלו. והתשובה בעברית שונה מהתשובה באנגלית.
הרצה מקומית של מודלי שפה שומרת קוד, חוזים ונתוני לקוחות בתוך המשרד ומבטלת עלויות API חוזרות. אבל ההחלטה היקרה ביותר בפרויקט היא כמות ה-VRAM, והיא גם זו שהכי קל לטעות בה. המדריך נותן נוסחה אחת, שש טבלאות, מדידה שערכנו על שלושה טוקנייזרים, והמלצה לפי גודל הארגון.
הטעות שהופכת תשובה של שניות לדקות: למה VRAM קודם לכל
כדי לייצר כל טוקן, המודל קורא את כל המשקולות שלו מהזיכרון, ולכן העבודה נופלת על ה-GPU ולא על המעבד (הסברנו את ההבדל במה זה CPU ו-GPU). לכן שני מספרים קובעים הכל: כמה זיכרון יש לכרטיס, שקובע אם המודל בכלל נטען, ומה רוחב הפס, שקובע כמה מהר הוא כותב.
כשהמודל גדול מה-VRAM, תוכנות כמו Ollama ו-llama.cpp מעבירות חלק מהשכבות לזיכרון המערכת. לפי מדריך דרישות הזיכרון של Spheron (עודכן בספטמבר 2026), אפיק PCIe Gen5 x16 מעביר כ-64 GB/s. זה איטי בערך פי 28 מזיכרון ה-RTX 5090 (1.79 TB/s) ובערך פי 7 מזה של RTX 5060 Ti (כ-448 GB/s). המודל ירוץ, אבל בקצב שלא מתאים לעבודה אינטראקטיבית.
התקרה התיאורטית של קצב הכתיבה למשתמש בודד היא בערך רוחב הפס חלקי גודל המודל בזיכרון. כרטיס עם 1,792 GB/s ומודל של 16GB נותן תקרה של כ-112 טוקנים לשנייה. בפועל מגיעים לחלק ממנה, אבל היחס בין כרטיסים נשמר. פירטנו מדידות אמיתיות במאמר DGX Spark מול תחנת עבודה עם RTX PRO.
הנוסחה שמונעת קנייה שגויה: איך מחשבים VRAM
דרישת הזיכרון בנויה משלושה רכיבים: משקולות המודל, מטמון ההקשר (KV cache), ותקורה של הדרייבר ותוכנת ההרצה, שלפי Spheron נעה בין 0.5 ל-2GB.
| רמת דיוק | בתים לפרמטר | מודל 8B | מודל 32B | מודל 70B | השפעה על איכות |
|---|---|---|---|---|---|
| FP16 / BF16 | 2 | 16GB | 64GB | 140GB | מלאה |
| INT8 (8 ביט) | 1 | 8GB | 32GB | 70GB | זניחה |
| INT4 (4 ביט, Q4_K_M) | 0.5 | 4GB | 16GB | 35GB | עלייה של 1 עד 3 אחוז ב-perplexity |
| 2 עד 3 ביט | 0.25 עד 0.4 | 2 עד 3GB | 8 עד 13GB | 18 עד 28GB | פגיעה מורגשת, לא מומלץ לייצור |
לפי Spheron, פורמט GGUF Q4_K_M הוא הנפוץ ביותר להרצה מקומית. הוא חוסך 75 אחוז מהזיכרון לעומת FP16 עם פגיעה קטנה באיכות. התחילו ממנו, ועלו ל-8 ביט רק אם יש מרווח זיכרון ומשימה רגישה במיוחד לדיוק.
כמה VRAM צריך כל מודל פופולרי? טבלה מוכנה
הטבלה כוללת משקולות ועוד תקורה בסיסית של 15 עד 20 אחוז, כלומר הקשר קצר ומשתמש בודד. זו נקודת מינימום, לא יעד. הנתונים לקוחים מ-Spheron, למעט gpt-oss-20b שלקוח מ-ModelFit.
| מודל | פרמטרים | FP16 | 8 ביט | 4 ביט | כרטיס מינימלי ב-4 ביט |
|---|---|---|---|---|---|
| Llama 3.1 8B | 8B | כ-20GB | כ-11GB | כ-7GB | 8GB, עדיף 16GB |
| Phi-4 | 14B | כ-34GB | כ-18GB | כ-10GB | 16GB |
| gpt-oss-20b (MoE) | 21B, 3.6B פעילים | לא רלוונטי | לא רלוונטי | כ-14GB (MXFP4 מקורי) | 16GB |
| Qwen 3 32B | 32B | כ-76GB | כ-40GB | כ-22GB | 32GB |
| Llama 3.3 70B | 70B | כ-168GB | כ-84GB | כ-46GB | 48GB ומעלה |
| Llama 4 Scout (MoE) | 109B, 17B פעילים | כ-262GB | כ-131GB | כ-66GB | 96GB או זיכרון מאוחד |
במודלי Mixture of Experts רק חלק מהפרמטרים פעילים בכל טוקן, ולכן הם מהירים. אבל כל הפרמטרים חייבים לשבת בזיכרון. gpt-oss-20b מפעיל 3.6 מיליארד פרמטרים לטוקן, ועדיין טוען את כל 21 המיליארד. הזיכרון נקבע לפי המספר הכולל, המהירות לפי המספר הפעיל.
חלון ההקשר: הזיכרון שאף אחד לא סופר
בזמן יצירת טקסט המודל שומר וקטורי מפתח וערך לכל טוקן שכבר עבר, בכל שכבה. המטמון גדל ליניארית עם אורך ההקשר ועם מספר המשתמשים במקביל. בעסק שמריץ RAG על חוזים או על מאגר קוד, הוא מתקרב לגודל המשקולות עצמן.
הנוסחה של Spheron היא 2 × מספר שכבות × ראשי KV × ממד ראש × בתים לערך. מבנה המודלים הציבורי נותן את המספרים הבאים, כולם ב-FP16:
| מודל | לכל טוקן | 8K טוקנים | 32K טוקנים | 128K טוקנים |
|---|---|---|---|---|
| Llama 3.1 8B (32 שכבות, 8 ראשי KV) | כ-0.125MB | כ-1GB | כ-4GB | כ-16GB |
| Qwen 3 32B (64 שכבות, 8 ראשי KV) | כ-0.25MB | כ-2GB | כ-8GB | כ-32GB |
| Llama 3.3 70B (80 שכבות, 8 ראשי KV) | כ-0.31MB | כ-2.5GB | כ-10GB | כ-40GB |
משקולות ב-4 ביט, מטמון הקשר של 32 אלף טוקנים ב-FP16 ותקורה של כ-1.5GB. מודל 32B חוצה את גבול ה-16GB בקלות, ומודל 70B חוצה את ה-32GB. חישוב לפי נוסחת Spheron ומבנה המודלים.
ב-Ollama ובכלים דומים אפשר לקבוע את אורך ההקשר המרבי. אם המשתמשים שואלים שאלות קצרות, הגבלה ל-8 אלף טוקנים חוסכת עשרות GB. לפי Spheron, vLLM תומך גם בדחיסת המטמון ל-FP8, שחוצה את הזיכרון שלו בחצי עם פגיעה מינימלית באיכות.
הזווית שאף מדריך באנגלית לא יספר לכם: עברית עולה יותר זיכרון
מטמון ההקשר נמדד בטוקנים, לא במילים. מודל מחלק טקסט לטוקנים לפי מילון שנבנה בעיקר על טקסט באנגלית, ולכן אותו תוכן בעברית עלול להתפרק להרבה יותר חתיכות. כדי לבדוק כמה, מדדנו בעצמנו.
שיטת המדידה: לקחנו את ההכרזה לכל באי עולם בדבר זכויות האדם בעברית ובאנגלית, מהמבוא ועד סעיף 24 (1,322 מילים באנגלית, 1,004 בעברית), והעברנו אותה דרך שלושה טוקנייזרים. את Llama 3 ואת Qwen בנינו מקובצי המילון של llama.cpp, והם עברו 46 מתוך 46 וקטורי הבדיקה הרשמיים של הפרויקט. את Gemma 3 מדדנו עם קובץ ה-SentencePiece הרשמי של Google.
| טוקנייזר | טוקנים באנגלית | טוקנים בעברית | יחס עברית לאנגלית | משמעות למטמון ההקשר |
|---|---|---|---|---|
| Llama 3 (גם 3.1 ו-3.3) | 1,580 | 5,469 | פי 3.46 | שיחה של 8K באנגלית הופכת לכ-28K בעברית |
| Qwen 2.5 / Qwen 3 | 1,595 | 2,259 | פי 1.42 | תוספת מתונה |
| Gemma 3 | 1,645 | 2,739 | פי 1.67 | תוספת בינונית |
מדידה עצמית של Powercon, ספטמבר 2026: ההכרזה לכל באי עולם, מהמבוא ועד סעיף 24.
המשמעות המעשית: עסק שעובד בעיקר בעברית ובוחר ב-Llama 3 משלם פי 3.5 בערך על כל טוקן של הקשר, גם בזיכרון וגם במהירות. במודל 70B, שיחה עברית שמקבילה ל-8 אלף טוקנים באנגלית תצרוך כ-8.7GB מטמון במקום 2.5GB. לכן בעברית כדאי להתחיל מ-Qwen או מ-Gemma, ולבדוק את האיכות על המסמכים שלכם.
איזה כרטיס מתאים לאיזה עומס? מפת VRAM ורוחב פס
הטבלה ממפה את הפתרונות לפי זיכרון ורוחב פס. בכל שורה יש קישור לדגם זמין, שם תמצאו מחיר ומלאי עדכניים.
| פתרון | זיכרון למודל | רוחב פס | מה רץ בנוחות (4 ביט) | לבדיקת מחיר ומלאי |
|---|---|---|---|---|
| RTX 5060 Ti 16GB | 16GB GDDR7 | כ-448 GB/s | עד 14B, gpt-oss-20b | לדגם |
| RTX PRO 4000 | 24GB GDDR7 | 672 GB/s | עד 14B עם הקשר ארוך | לדגם |
| RTX PRO 4500 | 32GB GDDR7 ECC | 896 GB/s | עד 32B | לדגם |
| RTX 5090 | 32GB GDDR7 | 1.79 TB/s | עד 32B, מהיר במיוחד | לדגם |
| RTX PRO 5000 | 48GB GDDR7 | 1,344 GB/s | 32B עם עד 10 משתמשים | לדגם |
| DGX Spark (GB10) | 128GB מאוחד | 273 GB/s | עד כ-200B, איטי | להצעת מחיר |
| RTX PRO 6000 Max-Q | 96GB GDDR7 ECC | 1,792 GB/s | 70B עם הקשר ארוך | לדגם |
| DGX Station GB300 | 748GB קוהרנטי | 7.1 TB/s (HBM3e) | מודלים ענקיים, צוות שלם | להצעת מחיר |
RTX 5090 או RTX PRO 4500? אותו זיכרון, החלטה שונה
לשני הכרטיסים 32GB. ה-RTX 5090 מהיר פי 2 ברוחב פס ולכן כותב מהר יותר. ה-RTX PRO 4500 צורך 200W לעומת 575W, כולל זיכרון ECC ודרייברים מוסמכים לתוכנות הנדסיות. לתחנה שרצה כל היום במשרד, או שמשמשת גם ל-CAD ורינדור, ה-PRO הוא לרוב הבחירה הנכונה. לבניית התחנה כולה, כולל RAM ואחסון, ראו את מדריך רכש תחנות העבודה ל-AI.
לפי Tom's Hardware, המחיר של RTX PRO 6000 ב-NVIDIA Marketplace בארה"ב עלה באוגוסט 2026 ל-16,000 דולר, לעומת פחות מ-8,000 דולר בהזמנות המוקדמות במרץ 2025. NVIDIA לא אישרה רשמית את ההעלאות, והרקע הוא משבר ברכיבי הזיכרון, שמשפיע במיוחד על כרטיס עם 96GB של GDDR7. המסקנה לעסק: זיכרון GPU הוא הרכיב היקר בתחנה, ולכן חישוב מדויק לפני הרכישה חוסך כסף. קונים את מה שהעומס צריך, עם מרווח סביר, ולא "ליתר ביטחון".
ומה עם Mac?
ב-Mac עם Apple Silicon המעבד וה-GPU חולקים זיכרון אחד, ולכן Mac עם 128GB טוען מודלים שאף כרטיס צרכני לא יטען. שני סייגים: לפי דיוני llama.cpp, macOS מקצה ל-GPU כברירת מחדל כ-75 אחוז מהזיכרון, כלומר כ-48GB במכונת 64GB. ורוחב הפס נמוך מכרטיס עליון, למשל 546 GB/s ב-M4 Max. Mac מתאים כשחשובים שקט וחשמל נמוך, פחות כשהצוות עובד עם CUDA ומתכנן לעלות לשרת NVIDIA.
חשבון החשמל שלא מופיע בהצעת המחיר
התעריף הביתי המפוקח עומד על 63.52 אגורות לקוט"ש כולל מע"מ, בתוקף מ-1 ביולי 2026 לפי עדכון רשות החשמל. תעריפים עסקיים שונים, ולכן הטבלה היא נקודת ייחוס. חישבנו שני תרחישים: עבודה של 8 שעות ביום, 5 ימים בשבוע (2,080 שעות בשנה), ותקרה עליונה של עומס מלא 24/7.
| מערכת | הספק | 8 שעות ביום, ימי עבודה | תקרה: עומס מלא 24/7 |
|---|---|---|---|
| RTX PRO 4000 (כרטיס) | 140W | כ-185 שקל | כ-779 שקל |
| RTX PRO 4500 (כרטיס) | 200W | כ-264 שקל | כ-1,113 שקל |
| DGX Spark (מערכת שלמה) | עד 240W | כ-317 שקל | כ-1,335 שקל |
| RTX PRO 5000 (כרטיס) | 300W | כ-396 שקל | כ-1,669 שקל |
| RTX PRO 6000 Max-Q (כרטיס) | 300W | כ-396 שקל | כ-1,669 שקל |
| RTX 5090 (כרטיס) | 575W | כ-760 שקל | כ-3,200 שקל |
קיץ ישראלי ותחנה שרצה בשעות השיא
מי שעבר לתעו"ז משלם בקיץ, בימים ראשון עד חמישי בין 17:00 ל-23:00, כ-172 אגורות לקוט"ש, כמעט פי 2.7 מהתעריף הבסיסי. עומסי אצווה כבדים, כמו אינדוקס מסמכים ל-RAG, כדאי לתזמן לשעות השפל. וכל וואט שהכרטיס צורך הופך לחום בחדר: כרטיס של 575W מכניס לחדר כמעט 600W של חום ברציפות, ובקיץ המזגן צריך לפנות גם אותו.
תחנת AI שרצה ברציפות צריכה גם הגנת חשמל. בחרו אל-פסק לפי הוואטים של התחנה כולה ולא רק לפי ה-VA. פירטנו את השיקולים במדריך UPS לארגונים בישראל.
למה עסקים בישראל מעבירים AI הביתה
תיקון 13 לחוק הגנת הפרטיות נכנס לתוקף ב-14 באוגוסט 2025. לפי סקירת משרד גולדפרב גרוס זליגמן, התיקון הרחיב את סמכויות האכיפה, כולל עיצומים כספיים שיכולים להגיע למיליוני שקלים. התיקון אינו אוסר שימוש ב-AI בענן, אבל שליחת מידע אישי ל-API חיצוני היא זרימת מידע שצריך למפות ולאבטח, והרצה מקומית מצמצמת את החשיפה. להחלטה משפטית פרטנית פנו ליועץ. הרחבנו על ארכיטקטורות ריבוניות והיברידיות במדריך Sovereign AI ו-Hybrid AI לארגונים בישראל, ועל תשתית פרטית בהיקף ארגוני במדריך תשתית AI פרטית עם H100.
5 טעויות רכש נפוצות בזיכרון GPU
1. הטעות שמכפילה את דרישת הזיכרון: לשכוח את ההקשר
קובץ מודל של 16GB לא ירוץ בנוחות על כרטיס 16GB. מטמון ההקשר, הדרייבר ותוכנת ההרצה צורכים עוד כמה GB בהקשר קצר, ועשרות GB בהקשר ארוך.
2. "זה ירוץ, רק קצת יותר לאט"
העברת שכבות לזיכרון המערכת הופכת תשובה של שניות להמתנה. אם המודל לא נכנס, קנו VRAM או הקטינו את המודל.
3. כרטיס 8GB לעבודה עסקית
לפי תיעוד llm-php, על כרטיס 8GB כדאי לכוון למשקולות של 5 עד 6.5GB בלבד. זה מגביל אתכם למודלים של 7 עד 8 מיליארד פרמטרים בהקשר קצר.
4. לקרוא את הפרמטרים הפעילים של MoE כדרישת זיכרון
מודל עם 3.6 מיליארד פרמטרים פעילים מתוך 21 מיליארד צריך זיכרון של 21 מיליארד. רק המהירות נהנית מהמספר הקטן.
5. לבחור מודל לפי מבחנים באנגלית ולהריץ אותו בעברית
במדידה שלנו אותו טקסט בעברית עלה פי 3.46 טוקנים ב-Llama 3. בדקו את יעילות הטוקנייזר בעברית לפני שאתם קובעים גודל כרטיס.
המלצות לפי גודל הארגון
הנחת עבודה: כ-20 אחוז מהעובדים משתמשים במודל באותו רגע, עם הקשר של 8 אלף טוקנים לכל אחד, מטמון ב-FP16 ותקורה של כ-1.5GB. זו הנחה ולא מדידה. אם הארגון עובד בעברית על Llama 3, הכפילו את רכיב המטמון בכ-3.5.
מודל 8B ב-4 ביט: 4GB משקולות, ועוד 1GB מטמון למשתמש אחד, ועוד 1.5GB תקורה, בסך הכל כ-6.5GB. נשאר מרווח לכמה משתמשים נוספים או להקשר ארוך. ה-RTX PRO 4000 נותן 24GB ב-140W בלבד, מרווח למודל 14B עם הקשר ארוך בצריכת חשמל נמוכה.
RTX 5060 Ti: מחיר ומלאי RTX PRO 4000: מחיר ומלאימודל 32B ב-4 ביט: 16GB משקולות, ועוד 4 משתמשים × 2GB מטמון, ועוד 1.5GB, בסך הכל כ-25.5GB. זו נקודת האיזון לרוב העסקים.
RTX PRO 4500: מחיר ומלאי RTX 5090: מחיר ומלאימודל 32B עם 10 משתמשים דורש 16GB משקולות ועוד 20GB מטמון ועוד 1.5GB, בסך הכל כ-37.5GB. זה נכנס ל-48GB עם מרווח, ועם מטמון ב-FP8 יורד לכ-27.5GB. רק מי שצריך מודל 70B צריך לעלות ל-96GB: 35GB משקולות ועוד 25GB מטמון ועוד 1.5GB, בסך הכל כ-61.5GB.
RTX PRO 5000: מחיר ומלאי RTX PRO 6000 Max-Q: מחיר ומלאיDGX Spark טוען מודלים עד כ-200B, אבל רוחב הפס שלו מתאים לפיתוח ולעומסי רקע. לעשרות משתמשים בזמן אמת נדרשת DGX Station או שרת עם כמה כרטיסים, כמו תחנת W773 עם שני כרטיסי RTX 4090 או עם ארבעה H100. ראו גם את מדריך ארכיטקטורת LLM Inference ואת מדריך מערכות DGX B300.
MSI DGX Spark: מחיר ומלאי DGX Station: הצעת מחיר W773 עם 2×RTX 4090 W773 עם 4×H100שאלות נפוצות
מה כמות ה-VRAM המומלצת להרצת LLM מקומי בעסק בישראל?
לרוב העסקים 16GB הם המינימום המעשי ו-32GB הם נקודת האיזון. כרטיס 16GB כמו RTX 5060 Ti מריץ מודלים של 8 עד 14 מיליארד פרמטרים ואת gpt-oss-20b, שתופס כ-14GB. כרטיס 32GB כמו RTX PRO 4500 או RTX 5090 מריץ מודל של 32 מיליארד פרמטרים ב-4 ביט עם עד 4 משתמשים במקביל, בכ-25.5GB. לארגון של 20 עד 50 עובדים, עם עד 10 משתמשים במקביל, מתאים כרטיס 48GB כמו RTX PRO 5000. למודל 70B נדרשים 96GB, כמו RTX PRO 6000. עסק שעובד בעברית צריך לקחת בחשבון שהעברית צורכת יותר טוקנים, ולכן יותר זיכרון הקשר.
כמה VRAM צריך כדי להריץ מודל של 7 או 8 מיליארד פרמטרים?
לפי Spheron, מודל כמו Llama 3.1 8B דורש כ-7GB ב-4 ביט כולל תקורה בסיסית, כ-11GB ב-8 ביט וכ-20GB ב-FP16. מטמון ההקשר מוסיף כ-1GB לכל 8 אלף טוקנים ב-FP16. בפועל כרטיס 16GB נותן מרווח נוח להקשר ארוך ולכמה משתמשים, וכרטיס 8GB מתאים רק להקשר קצר.
כמה VRAM צריך כדי להריץ מודל של 70 מיליארד פרמטרים?
לפי Spheron, Llama 3.3 70B דורש כ-168GB ב-FP16, כ-84GB ב-8 ביט וכ-46GB ב-4 ביט, כולל תקורה בסיסית. מטמון ההקשר מוסיף כ-0.31MB לכל טוקן ב-FP16, כלומר כ-10GB ב-32 אלף טוקנים וכ-40GB ב-128 אלף. לכן בתחנה בודדת המודל מתאים לכרטיס של 96GB כמו RTX PRO 6000, שמשאיר כ-50GB להקשר ולמשתמשים.
האם אפשר להריץ LLM על כרטיס מסך עם 8GB?
כן, אבל רק מודלים קטנים. לפי תיעוד llm-php, על כרטיס 8GB כדאי לכוון למשקולות של 5 עד 6.5GB בלבד, כדי להשאיר מקום להקשר ולדרייברים. זה מתאים למודלים של 3 עד 8 מיליארד פרמטרים ב-4 ביט עם הקשר קצר. לעבודה יומיומית של צוות, לעוזר קוד או ל-RAG על מסמכים, מומלץ 16GB לפחות.
האם מודל שפה בעברית צריך יותר זיכרון GPU מאשר באנגלית?
כן, דרך מטמון ההקשר. במדידה של Powercon, אותו טקסט משפטי רשמי דרש בעברית פי 3.46 טוקנים בטוקנייזר של Llama 3, פי 1.42 בטוקנייזר של Qwen ופי 1.67 ב-Gemma 3. מאחר שמטמון ההקשר נמדד בטוקנים, שיחה בעברית על Llama 3 צורכת בערך פי 3.5 זיכרון הקשר. משקולות המודל עצמן לא משתנות. בשיחה יומיומית היחס יכול להיות שונה.
למה חלון ההקשר צורך כל כך הרבה זיכרון GPU?
המודל שומר וקטורי מפתח וערך לכל טוקן בהקשר ובכל שכבה, והמטמון גדל ליניארית עם אורך ההקשר ועם מספר המשתמשים. ב-FP16 זה כ-0.125MB לטוקן ב-Llama 3.1 8B, כ-0.25MB ב-Qwen 3 32B וכ-0.31MB ב-Llama 3.3 70B. דחיסת המטמון ל-FP8 מקטינה את הערכים בחצי, והגבלת אורך ההקשר חוסכת עוד.
האם Mac עם זיכרון מאוחד מתאים להרצת LLM מקומי?
כן, במיוחד למודלים גדולים, כי המעבד וה-GPU חולקים את אותו זיכרון. לפי דיוני llama.cpp, macOS מקצה ל-GPU כברירת מחדל כ-75 אחוז מהזיכרון, כלומר כ-48GB במכונת 64GB. רוחב הפס נמוך מכרטיס עליון, למשל 546 GB/s ב-M4 Max לעומת 1.79 TB/s ב-RTX 5090, ולכן הכתיבה איטית יותר במודלים שנכנסים לשניהם.
כמה חשמל צורכת תחנת AI מקומית בישראל?
לפי תעריף של 63.52 אגורות לקוט"ש, כרטיס RTX 5090 בהספק 575W עולה כ-760 שקל בשנה ב-8 שעות עבודה ביום, ועד כ-3,200 שקל בעומס מלא 24/7. RTX PRO 4500 בהספק 200W עולה כ-264 שקל בשנה ב-8 שעות ביום. אלה נתוני הכרטיס בלבד, והמחשב כולו צורך יותר. מי שעבר לתעו"ז משלם בשעות השיא של הקיץ כ-172 אגורות לקוט"ש.
שורה תחתונה
כמות ה-VRAM נקבעת בארבעה צעדים: מספר הפרמטרים כפול בתים לפרמטר, ועוד מטמון הקשר לפי מספר המשתמשים, ועוד תקורה, ותיקון לשפה. בחרו 4 ביט כנקודת פתיחה, תכננו הקשר לפי המסמכים שתזינו בפועל, והשאירו מרווח.
לרוב העסקים הקטנים והבינוניים בישראל, 32GB הם נקודת האיזון. 16GB מתאימים להתחלה ולעובד בודד. 48GB מתאימים לארגון של 20 עד 50 עובדים. 96GB נדרשים רק למודל 70B. ואם אתם עובדים בעברית, בחירת המודל חשובה כמעט כמו בחירת הכרטיס.
מקורות: דרישות VRAM, מטמון הקשר, קוונטיזציה והעברת שכבות: מדריך Spheron לדרישות זיכרון GPU (עודכן בספטמבר 2026). gpt-oss-20b: ModelFit. כרטיס 8GB: תיעוד llm-php. Mac: דיוני llama.cpp ו-Wikipedia (Apple M4). תעריף חשמל: shtipser ו-colmobil-energy (יולי 2026). תיקון 13: גולדפרב גרוס זליגמן (אוגוסט 2025). רוחב פס והספק: מפרט NVIDIA, עמודי המוצר של Powercon ומאמר ההשוואה של Powercon. מחיר RTX PRO 6000 בארה"ב: Tom's Hardware (אוגוסט 2026). מדידת הטוקנים: Powercon, ספטמבר 2026. כל המספרים הם הערכות ומשתנים לפי גרסת תוכנה, קוונטיזציה ואורך הקשר.
לא בטוחים כמה VRAM המודל שלכם צריך? הצוות של Powercon כאן לעזור. נעבור יחד על המודל, השפה, אורך ההקשר ומספר המשתמשים, ונמליץ על הכרטיס או התחנה שמתאימים לעומס האמיתי שלכם.
לייעוץ מקצועי ללא עלות


