وقتی میخوای یه مدل ۷ میلیارد پارامتری رو روی لپتاپت اجرا کنی، اولین چیزی که بهش میخوری اینه: چرا این مدل با اون همه پارامتر، روی ۸ گیگ VRAM هم کار میکنه؟
جواب: Quantization.
هر پارامترِ یه مدل یه عدده. اگه این عدد رو با دقتِ کامل ذخیره کنی (float32)، هر پارامتر ۴ بایت میخواد — یعنی یه مدل ۷B کلاً حدود ۲۸ گیگابایت VRAM میخواد. کارتِ گرافیکِ معمولی این رو نداره.
ولی اگه همون اعداد رو با دقتِ کمتر ذخیره کنی — مثلاً ۴ بیت به جای ۳۲ — حجم میشه یههشتمِ قبل. یعنی همون ۷B حالا توی حدود ۴ گیگ VRAM جا میشه. اینو میگن Q4.
وقتی تو Ollama مدل دانلود میکنی و میبینی اسمش Q4_K_M یا Q8_0 هست، دقیقاً همینه — سطحِ فشردهسازیِ وزنهای مدله.
حالا سوالِ عملی: کدوم رو انتخاب کنی؟
سطحِ Q4 سبکتر و سریعتره، ولی کیفیتش یه خرده پایینتره. سطحِ Q8 به مدلِ اصلی نزدیکتره، ولی دو برابر رم میخواد. برای اکثرِ کارهای روزمره — کد نوشتن، خلاصهسازی، سوالوجواب — سطحِ Q4_K_M عملاً همکیفیتِ Q8 هست. فقط برای reasoning پیچیده یا محاسباتِ دقیق، سطحِ Q8 رو بزن.
یه نکتهی مهم: اگه مدل کامل توی VRAM جا نشه، بخشی از وزنها روی CPU لود میشن — که بهش میگن offloading. کار میکنه ولی سرعتش میتونه ۵ تا ۱۰ برابر کمتر بشه.
پس اگه میخوای مدل رو محلی اجرا کنی: اول ببین VRAM کارتِ گرافیکت چند گیگه، بعد سطحِ Q4 یا Q5 انتخاب کن که کامل توش جا بشه. ⚡
جواب: Quantization.
هر پارامترِ یه مدل یه عدده. اگه این عدد رو با دقتِ کامل ذخیره کنی (float32)، هر پارامتر ۴ بایت میخواد — یعنی یه مدل ۷B کلاً حدود ۲۸ گیگابایت VRAM میخواد. کارتِ گرافیکِ معمولی این رو نداره.
ولی اگه همون اعداد رو با دقتِ کمتر ذخیره کنی — مثلاً ۴ بیت به جای ۳۲ — حجم میشه یههشتمِ قبل. یعنی همون ۷B حالا توی حدود ۴ گیگ VRAM جا میشه. اینو میگن Q4.
وقتی تو Ollama مدل دانلود میکنی و میبینی اسمش Q4_K_M یا Q8_0 هست، دقیقاً همینه — سطحِ فشردهسازیِ وزنهای مدله.
حالا سوالِ عملی: کدوم رو انتخاب کنی؟
سطحِ Q4 سبکتر و سریعتره، ولی کیفیتش یه خرده پایینتره. سطحِ Q8 به مدلِ اصلی نزدیکتره، ولی دو برابر رم میخواد. برای اکثرِ کارهای روزمره — کد نوشتن، خلاصهسازی، سوالوجواب — سطحِ Q4_K_M عملاً همکیفیتِ Q8 هست. فقط برای reasoning پیچیده یا محاسباتِ دقیق، سطحِ Q8 رو بزن.
یه نکتهی مهم: اگه مدل کامل توی VRAM جا نشه، بخشی از وزنها روی CPU لود میشن — که بهش میگن offloading. کار میکنه ولی سرعتش میتونه ۵ تا ۱۰ برابر کمتر بشه.
پس اگه میخوای مدل رو محلی اجرا کنی: اول ببین VRAM کارتِ گرافیکت چند گیگه، بعد سطحِ Q4 یا Q5 انتخاب کن که کامل توش جا بشه. ⚡