Video is unavailable for watching
Show in Telegram
⚡️🚀 مدلهای زبانی بدون تغییر حتی یک کلمه، تا چند برابر سریعتر میشوند؛ DFlash 2
نسخه جدید DFlash 2 روشی برای افزایش شدید سرعت اجرای مدلهای زبانی معرفی کرده است؛ بدون اینکه لازم باشد خود مدل اصلی کوچکتر شود یا کیفیت پاسخ قربانی سرعت شود.
ایده بر پایه Speculative Decoding است.
در روش معمول، یک مدل بزرگ باید توکنها را تقریباً بهصورت متوالی تولید کند:
توکن ۱ → توکن ۲ → توکن ۳ → توکن ۴...
و هر مرحله نیازمند اجرای مدل بزرگ است.
🔥 در DFlash 2 یک مدل Draft کوچکتر وارد ماجرا میشود.
این مدل بهجای حدسزدن فقط توکن بعدی، یک بلوک از چند توکن را بهصورت موازی پیشنهاد میکند و سپس مدل اصلی آنها را بررسی و تأیید میکند. DFlash 2 برای این کار از یک Block-Diffusion Drafter و مکانیزم انتخاب مسیر میان Candidateها استفاده میکند.
یعنی تقریباً:
🤏 مدل کوچک: «فکر میکنم چند توکن بعدی اینها باشند.»
سپس:
🧠 مدل بزرگ: «درست است؛ ادامه بده.»
در نتیجه تعداد دفعاتی که مدل بزرگ مجبور است برای تولید متن اجرا شود، کاهش پیدا میکند.
📊 نتایج رسمی روی Qwen3.8-27B و یک GPU مدل H200 قابلتوجهاند.
در حالت تکدرخواستی، روی GSM8K سرعت از حدود ۶۹ به ۲۳۶ توکن بر ثانیه رسیده؛ یعنی ۳.۴۳ برابر سریعتر. روی MATH-500 نیز شتاب حدود ۳.۳۴ برابر و روی HumanEval حدود ۳.۱۱ برابر گزارش شده است.
🔥 آزمایشهای مستقل روی سختافزارهای دیگر نیز نتایج جالبی نشان دادهاند.
در یک تست روی ۱۰۰ مسئله واقعی برنامهنویسی، DFlash 2 سرعت را از حدود ۶۸ به ۱۵۴ توکن بر ثانیه رسانده؛ یعنی حدود ۲.۲۶ برابر. ترکیب آن با یک روش n-gram در یک سناریوی Coding خاص حتی به ۴.۶۸ برابر رسیده است.
اما جذابترین قسمت چیست؟
کیفیت قرار نیست فدای سرعت شود.
در Greedy Decoding، خروجی تأییدشده با خروجی مدل اصلی دقیقاً یکسان باقی میماند؛ در Sampling نیز روش برای حفظ توزیع مدل هدف طراحی شده است.
پس DFlash 2 مدل را باهوشتر نمیکند؛ همان هوش را سریعتر تحویل میدهد.
نسخههای GGUF نیز منتشر شدهاند و حتی Draft مدل Q4 حدود ۱.۱ گیگابایت حجم دارد؛ موضوعی که استفاده محلی را جذابتر میکند.
💡 اهمیت این فناوری برای آینده Local AI بسیار زیاد است.
اگر یک مدل ۲۷ میلیارد پارامتری روی کامپیوتر شخصی بهجای مثلاً ۱۵ تا ۲۰ توکن بر ثانیه بتواند در شرایط مناسب چند برابر سریعتر اجرا شود، تجربه کار با مدلهای Local کاملاً تغییر میکند.
و برای Agentهای کدنویسی که دائماً در حال تولید کد، فراخوانی ابزار و ادامه کار هستند، کاهش Latency حتی مهمتر است.
🔥 رقابت AI دیگر فقط درباره این نیست که:
«چه کسی مدل قویتری دارد؟»
یک رقابت دیگر هم در حال شکلگیری است:
«چه کسی میتواند همان مدل را با کمترین انتظار اجرا کند؟» ⚡️🧠
https://huggingface.co/collections/incoai/dflash-2
https://inco.ai/blog/dflash2/
@rss_ai_ir
❤️ حمایت از کانال:
https://daramet.com/Virsun
#هوش_مصنوعی #مدل_زبانی #اجرای_محلی #بهینه_سازی #استنتاج #DFlash2 #SpeculativeDecoding #LLM #Qwen #LocalAI #Inference #Optimization #AI
نسخه جدید DFlash 2 روشی برای افزایش شدید سرعت اجرای مدلهای زبانی معرفی کرده است؛ بدون اینکه لازم باشد خود مدل اصلی کوچکتر شود یا کیفیت پاسخ قربانی سرعت شود.
ایده بر پایه Speculative Decoding است.
در روش معمول، یک مدل بزرگ باید توکنها را تقریباً بهصورت متوالی تولید کند:
توکن ۱ → توکن ۲ → توکن ۳ → توکن ۴...
و هر مرحله نیازمند اجرای مدل بزرگ است.
🔥 در DFlash 2 یک مدل Draft کوچکتر وارد ماجرا میشود.
این مدل بهجای حدسزدن فقط توکن بعدی، یک بلوک از چند توکن را بهصورت موازی پیشنهاد میکند و سپس مدل اصلی آنها را بررسی و تأیید میکند. DFlash 2 برای این کار از یک Block-Diffusion Drafter و مکانیزم انتخاب مسیر میان Candidateها استفاده میکند.
یعنی تقریباً:
🤏 مدل کوچک: «فکر میکنم چند توکن بعدی اینها باشند.»
سپس:
🧠 مدل بزرگ: «درست است؛ ادامه بده.»
در نتیجه تعداد دفعاتی که مدل بزرگ مجبور است برای تولید متن اجرا شود، کاهش پیدا میکند.
📊 نتایج رسمی روی Qwen3.8-27B و یک GPU مدل H200 قابلتوجهاند.
در حالت تکدرخواستی، روی GSM8K سرعت از حدود ۶۹ به ۲۳۶ توکن بر ثانیه رسیده؛ یعنی ۳.۴۳ برابر سریعتر. روی MATH-500 نیز شتاب حدود ۳.۳۴ برابر و روی HumanEval حدود ۳.۱۱ برابر گزارش شده است.
🔥 آزمایشهای مستقل روی سختافزارهای دیگر نیز نتایج جالبی نشان دادهاند.
در یک تست روی ۱۰۰ مسئله واقعی برنامهنویسی، DFlash 2 سرعت را از حدود ۶۸ به ۱۵۴ توکن بر ثانیه رسانده؛ یعنی حدود ۲.۲۶ برابر. ترکیب آن با یک روش n-gram در یک سناریوی Coding خاص حتی به ۴.۶۸ برابر رسیده است.
اما جذابترین قسمت چیست؟
کیفیت قرار نیست فدای سرعت شود.
در Greedy Decoding، خروجی تأییدشده با خروجی مدل اصلی دقیقاً یکسان باقی میماند؛ در Sampling نیز روش برای حفظ توزیع مدل هدف طراحی شده است.
پس DFlash 2 مدل را باهوشتر نمیکند؛ همان هوش را سریعتر تحویل میدهد.
نسخههای GGUF نیز منتشر شدهاند و حتی Draft مدل Q4 حدود ۱.۱ گیگابایت حجم دارد؛ موضوعی که استفاده محلی را جذابتر میکند.
💡 اهمیت این فناوری برای آینده Local AI بسیار زیاد است.
اگر یک مدل ۲۷ میلیارد پارامتری روی کامپیوتر شخصی بهجای مثلاً ۱۵ تا ۲۰ توکن بر ثانیه بتواند در شرایط مناسب چند برابر سریعتر اجرا شود، تجربه کار با مدلهای Local کاملاً تغییر میکند.
و برای Agentهای کدنویسی که دائماً در حال تولید کد، فراخوانی ابزار و ادامه کار هستند، کاهش Latency حتی مهمتر است.
🔥 رقابت AI دیگر فقط درباره این نیست که:
«چه کسی مدل قویتری دارد؟»
یک رقابت دیگر هم در حال شکلگیری است:
«چه کسی میتواند همان مدل را با کمترین انتظار اجرا کند؟» ⚡️🧠
https://huggingface.co/collections/incoai/dflash-2
https://inco.ai/blog/dflash2/
@rss_ai_ir
❤️ حمایت از کانال:
https://daramet.com/Virsun
#هوش_مصنوعی #مدل_زبانی #اجرای_محلی #بهینه_سازی #استنتاج #DFlash2 #SpeculativeDecoding #LLM #Qwen #LocalAI #Inference #Optimization #AI