انتقل إلى المحتوى الرئيسي

مصطلحًا

التكميم (Quantization)

الفئة
Training, Adaptation & Inference
الصعوبة
متوسط

التعريف

التكميم هو عملية تعيين قيم رقمية مستمرة وعالية الدقة (عادةً 32-بت فاصلة عائمة) إلى مجموعة أصغر من القيم المنفصلة ومنخفضة الدقة (مثل 8-بت أعداد صحيحة).

آلية العمل والسياق

في التعلم العميق الحديث، يتم تدريب النماذج عادةً باستخدام دقة 32-بت فاصلة عائمة (FP32). على الرغم من أن هذا يوفر دقة عالية، إلا أنه يتطلب ذاكرة وقوة حسابية كبيرة. يعمل التكميم على تحسين هذه النماذج عن طريق تقليل عرض البت للأوزان والتنشيطات - على سبيل المثال، من FP32 إلى 16-بت (FP16)، أو 8-بت (INT8)، أو حتى 4-بت (INT4). يقلل هذا الاختزال بشكل كبير من حجم النموذج ويسرع سرعة الاستدلال، حيث أن الحسابات منخفضة الدقة أسرع وأكثر كفاءة في استهلاك الطاقة على الأجهزة الحديثة. ومع ذلك، تقدم هذه العملية مقايضة: فقدان الدقة الرقمية يمكن أن يؤدي إلى تدهور طفيف في دقة النموذج. غالبًا ما يتعين على الممارسين استخدام تقنيات مثل التدريب الواعي بالتكميم (QAT) أو التكميم بعد التدريب (PTQ) لتخفيف انخفاضات الدقة هذه، مما يضمن بقاء النموذج فعالًا مع الاستفادة من مكاسب الأداء.

لماذا هو مهم

يعد التكميم ضروريًا لنشر نماذج الذكاء الاصطناعي الكبيرة في بيئات العالم الحقيقي. من خلال تقليص حجم النموذج وزيادة الإنتاجية، فإنه يسمح للذكاء الاصطناعي المتطور بالعمل على أجهزة الحافة مثل الهواتف الذكية، ومستشعرات إنترنت الأشياء، وأجهزة الكمبيوتر المحمولة دون الاعتماد على بنية تحتية سحابية ضخمة. وهذا يقلل من زمن الوصول، ويخفض التكاليف التشغيلية، ويحسن الخصوصية من خلال تمكين التنفيذ المحلي وغير المتصل بالإنترنت لنماذج توليدية قوية.

مثال واقعي

يريد مطور يبني تطبيقًا للهاتف المحمول دمج نموذج لغوي كبير. النموذج الأصلي بحجم 10 جيجابايت، وهو كبير جدًا بالنسبة لذاكرة الهاتف. من خلال تطبيق تكميم 4-بت، يقلل المطور حجم النموذج إلى حوالي 2.5 جيجابايت. وهذا يسمح للنموذج بالتناسب مع ذاكرة الوصول العشوائي (RAM) للجهاز والعمل محليًا، مما يوفر استجابات فورية للمستخدم دون الحاجة إلى اتصال بالإنترنت.

أخطاء شائعة

  • افتراض أن التكميم يؤدي دائمًا إلى فقدان كبير في الدقة؛ غالبًا ما تحافظ التقنيات الحديثة على أداء قريب من الأصلي.
  • تطبيق التكميم على جميع طبقات النموذج دون تمييز، مما قد يسبب انخفاضات كارثية في الأداء في الطبقات الحساسة.
  • الخلط بين التكميم والتقليم (Pruning)؛ فبينما يقلل كلاهما من حجم النموذج، يزيل التقليم الأوزان تمامًا، بينما يقلل التكميم من دقة الأوزان الموجودة.
  • إهمال معايرة النموذج باستخدام بيانات تمثيلية أثناء التكميم بعد التدريب، مما يؤدي إلى نتائج استدلال ضعيفة.

الأسئلة الشائعة

كيف يختلف التكميم عن تقطير النموذج (Model Distillation)؟

يتضمن التقطير تدريب نموذج 'طالب' أصغر لمحاكاة سلوك نموذج 'معلم' أكبر. في المقابل، يحتفظ التكميم بهيكل النموذج الأصلي ومعلماته ولكنه يغير التمثيل الرقمي لتلك المعلمات لتكون أكثر كفاءة.

هل التكميم مفيد فقط للاستدلال؟

على الرغم من استخدامه بشكل أساسي للاستدلال، يمكن أيضًا تطبيق التكميم أثناء التدريب (التدريب الواعي بالتكميم) لمساعدة النموذج على تعلم أن يكون قويًا ضد فقدان الدقة، مما يؤدي غالبًا إلى دقة نهائية أفضل من طرق ما بعد التدريب.

هل يجعل التكميم النموذج أسرع دائمًا؟

ليس بالضرورة. يعتمد التسريع على قدرة الأجهزة على إجراء حسابات منخفضة الدقة. إذا كانت الأجهزة تفتقر إلى تعليمات محددة لعمليات INT8 أو INT4، فقد لا يشهد النموذج مكاسب كبيرة في الأداء.