⚡
مدلهای غولپیکر روی سیستم گیمینگ خودت!محققان دانشگاههای UC Berkeley و MIT سورسکد سیستمی به نام FreeToken رو منتشر کردن که مدلهای بزرگ MoE رو بدون کوانتیزاسیون شدید، روی سختافزار معمولی اجرا میکنه. سیستم بهصورت هوشمند محاسبات رو بین GPU، CPU و RAM توزیع میکنه. 💻
📊 نتایج کلیدی:🔺 مدل Qwen3.6 35B روی لپتاپ با RTX 4060 8GB تا ۳۹ توکن بر ثانیه
🔺 مدل DeepSeek-V4-Flash 284B روی RTX 5090: ۲۲ تا ۲۵ توکن بر ثانیه
🔺 حتی مدل ۷۵۳ میلیاردی GLM-5.2 روی یک GPU ورکاستیشن قابل اجراست
✨
ویژگیهای دیگه:🔺 پشتیبانی از ۲۰+ مدل باز MoE با فرمتهای مختلف کوانتیزاسیون
🔺 یک API سازگار با Anthropic/OpenAI برای اتصال به Claude Code، Codex و ابزارهای مشابه
🔺 نصب یککلیکی با GUI برای ویندوز و لینوکس، بدون نیاز به تبدیل GGUF
🔺 متنباز و رایگان با لایسنس Apache 2.0
🔗
لینک مخزن گیتهاب🔗
لینک وبسایت✈️
@ArchiveTell | #TOOLS