TGStat
TGStat
Type to search
Advanced channel search
  • flag English
    Site language
    flag Russian flag English flag Uzbek
  • Sign In
  • Catalog
    Channels and groups catalog Search for channels
    Add a channel/group
  • Ratings
    Rating of channels Rating of groups Posts rating
    Ratings of brands and people
  • Analytics
  • Search by posts
  • Telegram monitoring
VIRSUN

23 Aug, 18:19

Open in Telegram Share Report

00:26
Video is unavailable for watching
Show in Telegram
⚡️🚀 مدل‌های زبانی بدون تغییر حتی یک کلمه، تا چند برابر سریع‌تر می‌شوند؛ DFlash 2

نسخه جدید DFlash 2 روشی برای افزایش شدید سرعت اجرای مدل‌های زبانی معرفی کرده است؛ بدون اینکه لازم باشد خود مدل اصلی کوچک‌تر شود یا کیفیت پاسخ قربانی سرعت شود.

ایده بر پایه Speculative Decoding است.

در روش معمول، یک مدل بزرگ باید توکن‌ها را تقریباً به‌صورت متوالی تولید کند:

توکن ۱ → توکن ۲ → توکن ۳ → توکن ۴...

و هر مرحله نیازمند اجرای مدل بزرگ است.

🔥 در DFlash 2 یک مدل Draft کوچک‌تر وارد ماجرا می‌شود.

این مدل به‌جای حدس‌زدن فقط توکن بعدی، یک بلوک از چند توکن را به‌صورت موازی پیشنهاد می‌کند و سپس مدل اصلی آن‌ها را بررسی و تأیید می‌کند. DFlash 2 برای این کار از یک Block-Diffusion Drafter و مکانیزم انتخاب مسیر میان Candidateها استفاده می‌کند.

یعنی تقریباً:

🤏 مدل کوچک: «فکر می‌کنم چند توکن بعدی این‌ها باشند.»

سپس:

🧠 مدل بزرگ: «درست است؛ ادامه بده.»

در نتیجه تعداد دفعاتی که مدل بزرگ مجبور است برای تولید متن اجرا شود، کاهش پیدا می‌کند.

📊 نتایج رسمی روی Qwen3.8-27B و یک GPU مدل H200 قابل‌توجه‌اند.

در حالت تک‌درخواستی، روی GSM8K سرعت از حدود ۶۹ به ۲۳۶ توکن بر ثانیه رسیده؛ یعنی ۳.۴۳ برابر سریع‌تر. روی MATH-500 نیز شتاب حدود ۳.۳۴ برابر و روی HumanEval حدود ۳.۱۱ برابر گزارش شده است.

🔥 آزمایش‌های مستقل روی سخت‌افزارهای دیگر نیز نتایج جالبی نشان داده‌اند.

در یک تست روی ۱۰۰ مسئله واقعی برنامه‌نویسی، DFlash 2 سرعت را از حدود ۶۸ به ۱۵۴ توکن بر ثانیه رسانده؛ یعنی حدود ۲.۲۶ برابر. ترکیب آن با یک روش n-gram در یک سناریوی Coding خاص حتی به ۴.۶۸ برابر رسیده است.

اما جذاب‌ترین قسمت چیست؟

کیفیت قرار نیست فدای سرعت شود.

در Greedy Decoding، خروجی تأییدشده با خروجی مدل اصلی دقیقاً یکسان باقی می‌ماند؛ در Sampling نیز روش برای حفظ توزیع مدل هدف طراحی شده است.

پس DFlash 2 مدل را باهوش‌تر نمی‌کند؛ همان هوش را سریع‌تر تحویل می‌دهد.

نسخه‌های GGUF نیز منتشر شده‌اند و حتی Draft مدل Q4 حدود ۱.۱ گیگابایت حجم دارد؛ موضوعی که استفاده محلی را جذاب‌تر می‌کند.

💡 اهمیت این فناوری برای آینده Local AI بسیار زیاد است.

اگر یک مدل ۲۷ میلیارد پارامتری روی کامپیوتر شخصی به‌جای مثلاً ۱۵ تا ۲۰ توکن بر ثانیه بتواند در شرایط مناسب چند برابر سریع‌تر اجرا شود، تجربه کار با مدل‌های Local کاملاً تغییر می‌کند.

و برای Agentهای کدنویسی که دائماً در حال تولید کد، فراخوانی ابزار و ادامه کار هستند، کاهش Latency حتی مهم‌تر است.

🔥 رقابت AI دیگر فقط درباره این نیست که:

«چه کسی مدل قوی‌تری دارد؟»

یک رقابت دیگر هم در حال شکل‌گیری است:

«چه کسی می‌تواند همان مدل را با کمترین انتظار اجرا کند؟» ⚡️🧠

https://huggingface.co/collections/incoai/dflash-2

https://inco.ai/blog/dflash2/

@rss_ai_ir
❤️ حمایت از کانال:
https://daramet.com/Virsun

#هوش_مصنوعی #مدل_زبانی #اجرای_محلی #بهینه_سازی #استنتاج #DFlash2 #SpeculativeDecoding #LLM #Qwen #LocalAI #Inference #Optimization #AI

401 0 10 31
Catalog
Channels and groups catalog Channels compilations Search for channels Add a channel/group
Ratings
Rating of Telegram channels Rating of Telegram groups Posts rating Ratings of brands and people
API
API statistics Search API of posts API Callback
Our channels
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Read
Академия TGStat Telegram Research 2019 Telegram Research 2021 Telegram Research 2023
Contacts
Справочный центр Support Email Jobs
Miscellaneous
Terms and conditions Privacy policy Public offer
Our bots
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot