انتقل إلى المحتوى الرئيسي

مصطلحًا

الضبط الدقيق الخاضع للإشراف (SFT)

الفئة
Training, Adaptation & Inference
الصعوبة
متوسط

التعريف

عملية تعلم آلي يتم فيها تدريب نموذج مدرب مسبقاً بشكل إضافي على مجموعة بيانات مصنفة ومنسقة لتخصيص أدائه لمهام أو مجالات محددة.

آلية العمل والسياق

يعمل الضبط الدقيق الخاضع للإشراف (SFT) كجسر بين المعرفة الواسعة والعامة لنموذج الأساس والمتطلبات المحددة لتطبيق الإنتاج. خلال هذه المرحلة، يتعرض النموذج لمجموعة بيانات تتكون من أمثلة صريحة - مثل التعليمات المقترنة بالاستجابات المطلوبة - مما يسمح له بتعديل أوزانه الداخلية لتتوافق بشكل أفضل مع المهمة المستهدفة. على عكس التدريب المسبق، الذي يتطلب موارد حوسبة هائلة وكميات هائلة من البيانات الخام، فإن SFT فعال من حيث الحوسبة ويعتمد على بيانات عالية الجودة ومنسقة بشرياً. هذه العملية ضرورية لتعليم النماذج اتباع تنسيق معين، أو تبني نبرة معينة، أو الالتزام بقيود خاصة بالمجال. ومع ذلك، يحمل SFT خطر 'النسيان الكارثي'، حيث يفقد النموذج بعض قدراته العامة أثناء التركيز على المهمة الجديدة والضيقة، مما يستلزم توازناً دقيقاً بين التخصص والمنفعة العامة.

لماذا هو مهم

يعد SFT الآلية الأساسية لتحويل نماذج الأساس الخام إلى مساعدين ذكاء اصطناعي وظيفيين وموثوقين. وبدونه، غالباً ما تكافح النماذج لاتباع التعليمات أو الحفاظ على تنسيقات مخرجات متسقة. باستخدام SFT، يمكن للمطورين ضمان أن الذكاء الاصطناعي يتصرف بشكل متوقع، ويلتزم بإرشادات السلامة، ويقدم استجابات عالية الجودة مصممة خصيصاً لاحتياجات مؤسسة أو قاعدة مستخدمين معينة، مما يزيد بشكل كبير من فائدة النموذج في بيئات البرمجيات الواقعية.

مثال واقعي

ترغب شركة رعاية صحية في بناء مساعد ذكاء اصطناعي لتلخيص سجلات المرضى. يبدأون بنموذج لغوي كبير للأغراض العامة لكنهم يجدون أنه يفتقر إلى المصطلحات الطبية والتنسيق السريري المطلوب. من خلال إجراء SFT على مجموعة بيانات مكونة من 5000 ملخص مريض مجهول الهوية ومراجع من قبل خبراء، يتعلم النموذج استخراج البيانات السريرية ذات الصلة بدقة وتنسيقها وفقاً لمعايير المستشفى، مما يؤدي إلى أداة متخصصة أكثر فعالية بكثير من النموذج الأساسي.

أخطاء شائعة

  • استخدام بيانات منخفضة الجودة أو مشوشة، مما قد يؤدي إلى تدهور أداء النموذج بدلاً من تحسينه.
  • الإفراط في ملاءمة النموذج لمجموعة التدريب، مما يجعله يفقد قدرته على التعميم على مدخلات جديدة وغير مرئية.
  • افتراض أن SFT يمكنه إصلاح العيوب الأساسية في قدرات الاستدلال للنموذج الأساسي.
  • إهمال تقييم النموذج على مجموعة اختبار محتجزة، مما يؤدي إلى تقييم غير دقيق لأدائه في العالم الحقيقي.

الأسئلة الشائعة

كيف يختلف SFT عن التعلم التعزيزي من التغذية الراجعة البشرية (RLHF)؟

يستخدم SFT أمثلة مباشرة للمدخلات والمخرجات لتعليم النموذج سلوكيات محددة، بينما يستخدم RLHF نموذج مكافأة يعتمد على التفضيلات البشرية لتوجيه النموذج نحو مخرجات أكثر رغبة ودقة.

هل يمكن استخدام SFT لإضافة معرفة جديدة إلى النموذج؟

بينما يمكن أن يساعد SFT النموذج على تعلم مصطلحات أو تنسيقات جديدة، فإنه غير فعال بشكل عام لتعليم النموذج معرفة واقعية جديدة تماماً؛ وعادة ما يفضل استخدام التوليد المعزز بالاسترجاع (RAG) لهذا الغرض.

ما مقدار البيانات المطلوبة عادةً لـ SFT فعال؟

يختلف المقدار بشكل كبير بناءً على تعقيد المهمة، ولكن غالباً ما يحقق SFT عالي الجودة تحسينات كبيرة مع ما لا يقل عن 500 إلى 5000 مثال منسق بعناية.