انتقل إلى المحتوى الرئيسي

مصطلحًا

الضبط الدقيق الفعال للمعاملات (PEFT)

الفئة
Training, Adaptation & Inference
الصعوبة
متوسط

التعريف

مجموعة من التقنيات التي تكيف نموذجاً مدرباً مسبقاً لمهمة جديدة عن طريق تحديث مجموعة فرعية صغيرة فقط من معاملاته أو إضافة عدد صغير من المعاملات الجديدة، بدلاً من تحديث مصفوفة أوزان النموذج بالكامل.

آلية العمل والسياق

يعالج الضبط الدقيق الفعال للمعاملات (PEFT) المتطلبات الحسابية وتخزين البيانات الهائلة للضبط الدقيق الكامل، حيث يتم تحديث كل معامل في النموذج. في سير عمل النماذج اللغوية الكبيرة الحديثة، غالباً ما يكون الضبط الدقيق الكامل غير عملي بسبب مليارات المعاملات المعنية. تقوم تقنيات PEFT، مثل التكيف منخفض الرتبة (LoRA) أو طبقات المحول (Adapter)، بتجميد غالبية أوزان النموذج المدرب مسبقاً وتدريب مجموعة صغيرة فقط من المعاملات الخاصة بالمهمة. يقلل هذا النهج بشكل كبير من بصمة ذاكرة وحدة معالجة الرسومات (GPU) واحتياجات التخزين، مما يسمح للمطورين بتشغيل إصدارات متعددة خاصة بمهام معينة من نموذج أساسي واحد في وقت واحد. على الرغم من أن PEFT فعال للغاية، إلا أنه قد ينتج أحياناً أداءً أقل قليلاً من الضبط الدقيق الكامل في المهام المتخصصة للغاية، مما يمثل مقايضة كلاسيكية بين كفاءة الموارد ودقة النموذج المطلقة.

لماذا هو مهم

يعد PEFT ضرورياً لإضفاء الطابع الديمقراطي على تطوير الذكاء الاصطناعي. فهو يمكّن الباحثين والفرق الصغيرة من تخصيص نماذج أساسية قوية على أجهزة من فئة المستهلكين. من خلال تقليل الحاجة إلى مجموعات حوسبة ضخمة، يسهل PEFT دورات تكرار أسرع، ويقلل من التكاليف التشغيلية، ويسمح بنشر إصدارات متعددة متخصصة من النماذج دون عبء تخزين نسخ كاملة الحجم لكل حالة استخدام فردية.

مثال واقعي

ترغب شركة ناشئة في مجال الرعاية الصحية في إجراء ضبط دقيق لنموذج لغوي كبير لتحليل السجلات الطبية. بدلاً من إجراء ضبط دقيق كامل، والذي يتطلب مجموعات GPU باهظة الثمن على مستوى المؤسسات، يستخدمون LoRA (تقنية PEFT). من خلال تدريب 0.1% فقط من معاملات النموذج، نجحوا في تكييف النموذج مع المصطلحات الطبية باستخدام وحدة معالجة رسومات واحدة متطورة للمستهلكين، مما وفر آلاف الدولارات في تكاليف الحوسبة السحابية مع الحفاظ على دقة عالية.

أخطاء شائعة

  • افتراض أن PEFT يحقق دائماً أداءً مطابقاً للضبط الدقيق الكامل بغض النظر عن تعقيد المهمة.
  • إهمال إدارة أوزان النموذج 'الأساسي' بشكل صحيح عند نشر إصدارات متعددة معدلة بـ PEFT.
  • الإفراط في ضبط المجموعة الصغيرة من المعاملات، مما قد يؤدي إلى نسيان كارثي للمعرفة العامة للنموذج الأساسي.
  • الخلط بين PEFT وتكميم النموذج (Quantization)؛ PEFT يتعلق بكفاءة التدريب، بينما التكميم يتعلق بتقليل الدقة لسرعة الاستدلال.

الأسئلة الشائعة

كيف يختلف PEFT عن الضبط الدقيق الكامل؟

يقوم الضبط الدقيق الكامل بتحديث كل معامل في النموذج، مما يتطلب ذاكرة وحوسبة هائلة. يقوم PEFT بتجميد النموذج الأساسي وتحديث جزء صغير فقط من المعاملات، مما يجعله أسرع وأرخص بكثير.

هل PEFT مناسب لجميع أنواع نماذج الذكاء الاصطناعي؟

تم تصميم PEFT بشكل أساسي للنماذج الكبيرة القائمة على المحولات (Transformer) مثل النماذج اللغوية الكبيرة. على الرغم من إمكانية تطبيق المبادئ في أماكن أخرى، إلا أن فعاليتها تكون أكثر وضوحاً في النماذج التي تحتوي على مليارات المعاملات حيث تكون إعادة التدريب الكاملة باهظة.

هل يمكنني دمج محولات PEFT متعددة على نموذج واحد؟

نعم، إحدى المزايا الأساسية لـ PEFT هي القدرة على تبديل أو دمج محولات مختلفة فوق نموذج أساسي مجمد واحد، مما يسمح بنشر ذكاء اصطناعي معياري ومرن.