Unsloth Dynamic v3.0 نسل بعدی کوانتیزاسیون دینامیک ما و بهبود عمدهای نسبت به Dynamic v2.0 است.
امروز، ما کوانتهای Dynamic v3.0 Qwen3.8-27B را منتشر میکنیم که در مقایسه با سایر ارائهدهندگان، بیش از ۱۰٪ دقت برتر در ۱٪ برتر را در همان اندازه ارائه میدهند. این یک بهروزرسانی از نسخه پیشنمایش اولیه Dynamic v3.0 است که قبلاً به اشتراک گذاشته بودیم. GGUFهای جدید ۳.۰ با اکثر موتورهای استنتاجی از جمله llama.cpp و Unsloth Desktop کار میکنند.
Dynamic v3.0 به طور کلی کیفیت مدل را با حفظ همان اندازه، با نتایج قویتر در معیارهایی مانند Divergence-300 @32 و KL Divergence، بیشتر حفظ میکند.
همچنین از حمایت بیدریغ شما بسیار سپاسگزاریم! ما در تنها ۵ روز بیش از ۵.۱ میلیون دانلود Unsloth Qwen3.8 را شاهد بودیم!
متدولوژی جدید ما از بسیاری ویژگیها و بهبودهای جدید تشکیل شده است. اکنون از یک مجموعه داده کالیبراسیون imatrix با کیفیت بسیار بالاتر از منابع متنوع استفاده میکنیم. این مجموعه داده برای کدنویسی عاملمحور (agentic coding)، چت و عملکرد چندزبانه بهینهسازی شده است. همچنین انتخاب لایه را بهبود بخشیدهایم و تکنیکهای کوانتیزاسیون بیشتری را برای حفظ حداکثر کیفیت مدل معرفی کردهایم.
ما روی مجموعه داده کالیبراسیون imatrix آموزش نمیدهیم و از QAT یا QAD استفاده نمیکنیم. همه چیز از طریق کوانتیزاسیون پس از آموزش (post-training quantization) انجام میشود. فایل imatrix مورد استفاده ما برای آزمایش، ارزیابی و استفاده جامعه در دسترس است. ما محققان و توسعهدهندگان را تشویق میکنیم تا با استفاده از کوانتها/imatrix Unsloth ما، تغییرات و تنظیمات دقیق Qwen3.8 را ایجاد کنند. همچنین میتوانید تحلیل بیشبرازش (overfitting) ما را مطالعه کنید.
- ما همچنین ماژول MTP را از کوانتهای کوچکتر زیر
UD-Q2_K_XL(۸.۳۷ گیگابایت و کمتر) حذف کردیم تا حدود ۵۰۰ مگابایت فضای دیسک را حفظ کنیم – در صورت نیاز میتوانید از ماژول جداگانهQ4_0MTP استفاده کنید. - ما همچنین برخی کوانتهای ۱ بیتی UD کوچکتر را با
UD-IQ1_Sبه حجم ۶.۲ گیگابایت (بدون MTP) ایجاد کردیم که حدود ۷۲٪ دقت ۱٪ برتر را حفظ میکنند، در حالی که ۸۹٪ کوچکتر هستند. UD-Q2_K_XLحدود ۸٪ دقیقتر در ۱٪ برتر نسبت به بهترین مدل بعدی است و ۹.۸۳ گیگابایت حجم دارد و توانست یک برنامه HTML کارآمد با ۱ اشکال کوچک جاوا اسکریپت ایجاد کند – قبلاً این کار باعث خرابی میشد.
?? Divergence-300 @32
ما معمولاً دقت ۱٪ برتر را گزارش میکنیم، همانطور که برای Kimi-K3 «دینامیک ۱ بیتی به ~۷۸.۹٪ دقت ۱٪ برتر میرسد در حالی که ۶۲٪ کوچکتر است.» با این حال، ۱٪ برتر یک آرگمکس (argmax) بر روی ۱ پیشبینی است، بنابراین در سنجش استنتاج واقعی چندان مؤثر نیست.
ما یک مجموعه داده از ۳۰۰ مثال نگهداشته شده (که در مجموعه داده کالیبراسیون نیستند) از Terminal-Bench 2.1 + DeepSWE + Harbor + MathArena 2025-26 + پرامپتهای غیرلاتین/اسناد طولانی ایجاد کردیم و رمزگشایی حریصانه آرگمکس را برای ۳۲ توکن برای BF16 در مقابل همه کوانتها و ارائهدهندگان انجام دادیم. برای جزئیات بیشتر در مورد بیشبرازش، به تحلیل بیشبرازش مراجعه کنید.
این به ما امکان میدهد تا بررسی کنیم که آیا بیشبرازش وجود دارد و آیا خروجیهای کوانت مشابه مسیرهای BF16 در طول چندین توکن هستند یا خیر. این یک معیار بهتر از دقت ۱٪ برتر است، زیرا ما KLD ۱٪ برتر را به KLD ۱٪ برتر در ۳۲ توکن گسترش میدهیم.
? ۱-بیت نباید برای موارد استفاده عاملمحور (agentic) استفاده شود
همانطور که در ?? Divergence-300 @32 مشاهده میشود، افت شدیدی از UD-Q2_K_XL به UD-IQ2_S برای پیشبینی ۳۲ توکن از حدود ۲۵٪ دقت به کمتر از ۸-۱۰٪ وجود دارد. این افت شدید به این معنی است که فراخوانی ابزار (tool calling) و حالتهای بدون تفکر از کار میافتند. برخی از مسائل و راهحلها در صورت استفاده از ۱-بیت:
- حلقههای بیش از حد: هنگام استفاده از کوانتهای زیر UD-Q2_K_XL، حلقههای زیادی را مشاهده خواهید کرد – در همه موارد از
presence_penalty = 1.5(یا بالاتر) استفاده کنید. - پاسخهای خالی: همیشه تفکر را حداقل در استدلال پایین برای کوانتهای ۱-بیتی فعال کنید – حالتهای بدون استدلال باعث میشوند مدل حتی خروجی هم ندهد.
- موارد استفاده عاملمحور و فراخوانی ابزار: از مدل برای فراخوانی ابزار استفاده نکنید – تنها دانش عمومی حفظ میشود وقتی به شدت کوانتیزه شود، و مدل یا در فراخوانی ابزار شکست میخورد، یا به فراخوانی ابزار ادامه میدهد یا حتی آنها را فراخوانی نمیکند.
- دانش عمومی کار میکند: بازیابی ۷۷٪ در ۱٪ برتر جایگزینی برای Divergence-300 @32 با ۸٪ نیست که شاخص بهتری برای بارهای کاری استنتاج واقعی است – میتوانید از مدل برای سؤالات واقعیتمحور دانش عمومی بسیار کوتاه استفاده کنید، اما بهتر است از UD-Q2_K_XL استفاده کنید.
?? معیارهای KL Divergence
ما معیارهای KLD را برای همه ارائهدهندگان نیز اجرا کردیم و میانگین ۱٪ برتر و KLD را گزارش میدهیم. در همه سطوح، به خصوص در اندازههای کوانت کوچکتر، کوانتهای Unsloth UD-3 تا ۱۰٪ دقت ۱٪ برتر اضافی را در همان فضای دیسک به دست میآورند!
همه نمودارها، سر MTP را از محور x هنگام محاسبه فضای دیسک حذف میکنند تا مقایسه عادلانهای با همه ارائه شود.
??? عدم بیشبرازش
هنگام مقایسه با UD-2 قدیمیتر ما در Wikitext و Code دیده نشده، بهبود زیادی در KLD نشان میدهیم – در مدلهای بزرگتر اینقدر زیاد نیست، بنابراین ما همچنان از UD-2 قدیمی خود برای کوانتهای بزرگتر استفاده میکنیم – قصد داریم آنها را نیز آزمایش و بهبود بخشیم!
ما همچنین با استفاده از مجموعه دادههای کاملاً متفاوت برای کالیبراسیون و حذف حداکثر نشتها، بیشبرازش را کنترل میکنیم. ما KLD را روی این مجموعه دادههای دیده نشده آزمایش میکنیم و همچنین QAD / QAT انجام نمیدهیم، فقط PTQ خالص، بنابراین بیشبرازش کمتر از رویکردهای QAD / QAT دیگر نگرانکننده است.
به طور مشابه، ?? Divergence-300 @32 از یک مجموعه داده دیده نشده شامل ۳۰۰ پرامپت از DeepSWE، Terminal Bench و سایر موارد استفاده میکند و به عنوان یک مجموعه داده دیگر برای سنجش بیشبرازش عمل میکند – و نشان میدهد که روشهای جدید UD-3 ما بیشبرازش ندارند.
Dynamic v2.0 (قدیمی)
ما کوانتیزاسیون Dynamic v2.0 Unsloth را معرفی میکنیم – یک ارتقاء عمده برای کوانتهای قبلی ما. این روش جدید از روشهای کوانتیزاسیون پیشرو بهتر عمل میکند و معیارهای جدیدی را برای Aider Polyglot، MMLU 5-شات و KL Divergence تعیین میکند.
این بدان معناست که اکنون میتوانید LLMهای کوانتیزه شده را اجرا و تنظیم دقیق کنید و در عین حال حداکثر دقت را حفظ کنید! میتوانید GGUFهای ۲.۰ را روی اکثر موتورهای استنتاجی مانند llama.cpp، Unsloth Studio و غیره اجرا کنید.
بهروزرسانی ۲۰ آوریل ۲۰۲۶: معیارهای GGUF جدید ما را برای Qwen3.6 و Gemma 4 ببینید.
بهروزرسانی ۲۷ فوریه ۲۰۲۶: Qwen3.5 منتشر شد و ما برخی از مشکلات قالب چت فراخوانی ابزار را برطرف کردیم و هر GGUF را بر اساس سردرگمی (perplexity) و KL Divergence محک زدیم. معیارها را ببینید!
مزیت کلیدی استفاده از بسته Unsloth و کوانتها، نقش فعال ما در رفع اشکالات در مدلهای اصلی است. ما مستقیماً با تیمهای پشت Qwen3، متا (Llama 4)، میسترال (Devstral)، گوگل (Gemma 1–3) و مایکروسافت (Phi-3/4) همکاری کردهایم و به رفع اشکالاتی کمک کردهایم که دقت را افزایش میدهند.
GGUFهای دینامیک Unsloth اکنون میتوانند در Unsloth Studio اجرا شوند ?

بهروزرسانی ۱۰ سپتامبر ۲۰۲۵: شما معیارهای سختتری درخواست کردید، بنابراین نتایج Aider Polyglot در اینجا آمده است! GGUF سه بیتی دینامیک DeepSeek V3.1 ما ۷۵.۶٪ امتیاز کسب میکند که از بسیاری از LLMهای SOTA با دقت کامل پیشی میگیرد. بیشتر بخوانید.


همچنین میتوانید معیارهای کاربردی واقعی را که توسط بنجامین ماری (Benjamin Marie) برای LiveCodeBench v6، MMLU Pro و غیره انجام شده است، مشاهده کنید:
میتوانید ببینید که چگونه GGUFهای Unsloth با وجود اینکه حدود ۸ گیگابایت کوچکتر هستند، بهتر از کوانتهای غیر Unsloth عمل میکنند.
تحلیل دقیق معیارهای ما و ارزیابی در ادامه آمده است.
?? چه چیز جدیدی در Dynamic v2.0 وجود دارد؟
- انتخاب لایه بازنگری شده برای GGUFها + safetensors: Unsloth Dynamic 2.0 اکنون لایهها را به صورت انتخابی بسیار هوشمندانهتر و گستردهتر کوانتیزه میکند. به جای تغییر تنها لایههای منتخب، اکنون نوع کوانتیزاسیون هر لایه ممکن را به صورت دینامیک تنظیم میکنیم و ترکیبها برای هر لایه و مدل متفاوت خواهد بود.
- GGUFهای انتخاب شده فعلی و همه آپلودهای آینده از Dynamic 2.0 و مجموعه داده کالیبراسیون جدید ما استفاده خواهند کرد. این مجموعه داده حاوی بیش از ۱.۵ میلیون توکن (بسته به مدل) است و از دادههای با کیفیت بالا، دستچین شده و تمیز تشکیل شده است – برای افزایش چشمگیر عملکرد چت مکالمهای.
- قبلاً، کوانتیزاسیون دینامیک ما (DeepSeek-R1 1.58-bit GGUF) تنها برای معماریهای MoE مؤثر بود. کوانتیزاسیون Dynamic 2.0 اکنون روی همه مدلها (از جمله MOEها و غیر MoEها) کار میکند.
- کوانتهای خاص مدل: هر مدل اکنون از یک طرح کوانتیزاسیون سفارشی استفاده میکند. به عنوان مثال، لایههای کوانتیزه شده در Gemma 3 به طور قابل توجهی با لایههای Llama 4 متفاوت است.
- برای به حداکثر رساندن کارایی، به ویژه در دستگاههای Apple Silicon و ARM، اکنون فرمتهای Q4_NL، Q5.1، Q5.0، Q4.1 و Q4.0 را نیز اضافه میکنیم.
برای اطمینان از معیارگیری دقیق، ما یک چارچوب ارزیابی داخلی برای مطابقت با امتیازات رسمی MMLU 5-شات گزارش شده Llama 4 و Gemma 3 ساختیم. این امکان مقایسه مستقیم بین دقت کامل در مقابل Dynamic v2.0، QAT و کوانتهای GGUF imatrix استاندارد را فراهم کرد.
همه آپلودهای GGUF آینده از Unsloth Dynamic 2.0 استفاده خواهند کرد و کوانتهای ۴ بیتی دینامیک safe tensor ما نیز در آینده از این مزیت بهرهمند خواهند شد.
?? چرا KL Divergence؟
«دقت تنها چیزی نیست که نیاز دارید» نشان میدهد که چگونه هرس کردن لایهها، حتی با انتخاب لایههای غیرضروری، همچنان تفاوتهای زیادی را از نظر «برگشت» (flips) ایجاد میکند. «برگشت» به عنوان تغییر پاسخها از نادرست به صحیح یا بالعکس تعریف میشود. این مقاله نشان میدهد که چگونه MMLU ممکن است با هرس کردن لایهها یا انجام کوانتیزاسیون کاهش نیابد، اما این به دلیل این است که برخی از پاسخهای نادرست ممکن است «برگشته» و صحیح شده باشند. هدف ما مطابقت با مدل اصلی است، بنابراین اندازهگیری «برگشتها» یک معیار خوب است.
KL Divergence باید یکی از استانداردهای طلایی برای گزارش خطاهای کوانتیزاسیون باشد، همانطور که در مقاله تحقیقاتی «دقت تنها چیزی نیست که نیاز دارید» آمده است. استفاده از سردرگمی (perplexity) نادرست است زیرا مقادیر توکن خروجی میتوانند یکدیگر را خنثی کنند، بنابراین ما باید از KLD یا معیارهای سختتری مانند Aider استفاده کنیم.
این مقاله همچنین نشان میدهد که به طور جالب توجهی KL Divergence با برگشتها (flips) همبستگی بالایی دارد، و بنابراین هدف ما کاهش میانگین KL Divergence در حالی است که فضای دیسک کوانتیزاسیون را تا حد امکان کمتر افزایش دهیم.
?? بیشبرازش مجموعه داده کالیبراسیون
اکثر چارچوبها سردرگمی (perplexity) و KL Divergence را با استفاده از یک مجموعه آزمایشی از مقالات ویکیپدیا گزارش میدهند. با این حال، ما متوجه شدیم که استفاده از مجموعه داده کالیبراسیون که مربوط به ویکیپدیا نیز هست، باعث بیشبرازش کوانتها و دستیابی به امتیازات سردرگمی پایینتر میشود. ما از Calibration_v3 و Calibration_v5 برای آزمایش عادلانه استفاده میکنیم که شامل برخی دادههای wikitext در میان سایر دادهها است. همچنین مدلهای دستورالعمل (instruct models) دارای قالبهای چت منحصر به فردی هستند و استفاده از مجموعه دادههای کالیبراسیون فقط متنی برای مدلهای دستورالعمل مؤثر نیست (برای مدلهای پایه بله). در واقع، اکثر GGUFهای imatrix معمولاً با این مسائل کالیبره میشوند. در نتیجه، آنها به طور طبیعی در معیارهای KL Divergence که از دادههای ویکیپدیا نیز استفاده میکنند، عملکرد بهتری دارند، زیرا مدل اساساً برای آن دامنه بهینهسازی شده است.
برای اطمینان از ارزیابی عادلانه و کنترل شده، ما از مجموعه داده کالیبراسیون خود (که برای عملکرد چت بهینهسازی شده است) هنگام معیارگیری KL Divergence استفاده نمیکنیم. در عوض، ما آزمایشها را با استفاده از همان مجموعه دادههای استاندارد ویکیپدیا انجام دادیم، که به ما امکان میدهد عملکرد روش Dynamic 2.0 خود را مستقیماً با رویکرد پایه imatrix مقایسه کنیم.
?? ماجرای تکرار MMLU
- تکرار MMLU 5-شات کابوسوار بود. ما نتوانستیم نتایج MMLU را برای بسیاری از مدلها از جمله Llama 3.1 (8B) Instruct، Gemma 3 (12B) و دیگران به دلیل مسائل ظریف پیادهسازی تکرار کنیم. به عنوان مثال، Llama 3.1 (8B) باید حدود ۶۸.۲٪ به دست آورد، در حالی که با استفاده از پیادهسازیهای نادرست میتواند ۳۵٪ دقت به دست آورد.
- Llama 3.1 (8B) Instruct با استفاده از یک پیادهسازی ساده MMLU، دقت MMLU 5-شات ۶۷.۸٪ دارد. با این حال، ما متوجه شدیم که Llama