انتقل إلى المحتوى الرئيسي

مصطلحًا

التعلم التعزيزي من التغذية الراجعة البشرية (RLHF)

الفئة
Training, Adaptation & Inference
الصعوبة
متوسط

التعريف

طريقة تدريب للتعلم الآلي حيث يتم ضبط النموذج بدقة باستخدام إشارة مكافأة مستمدة من التفضيلات البشرية لمواءمة مخرجاته بشكل أفضل مع القيم والتعليمات البشرية.

آلية العمل والسياق

تتبع عملية التعلم التعزيزي من التغذية الراجعة البشرية (RLHF) عادةً عملية متعددة المراحل. أولاً، يتم تدريب نموذج أساسي على مجموعة بيانات ضخمة. بعد ذلك، يقوم المقيمون البشريون بترتيب ردود متعددة تم إنشاؤها بواسطة النموذج لنفس المطالبة، مما يؤدي إلى إنشاء مجموعة بيانات تفضيلية. تُستخدم هذه البيانات لتدريب 'نموذج مكافأة' منفصل يتعلم التنبؤ بالتفضيلات البشرية. أخيرًا، يتم ضبط النموذج اللغوي الأصلي بدقة باستخدام التعلم التعزيزي (غالبًا عبر تحسين السياسة القريب - PPO) لتعظيم النتيجة التي يحددها نموذج المكافأة هذا. تُعد هذه العملية ضرورية لتحويل النماذج اللغوية الخام وغير المتوقعة إلى مساعدين مفيدين ومتحاورين. ومع ذلك، تقدم RLHF مقايضات: يمكن أن تؤدي إلى 'اختراق المكافأة'، حيث يقوم النموذج بالتحسين للحصول على ردود ترضي البشر بدلاً من الدقة الواقعية، وقد تؤدي عن غير قصد إلى إدخال تحيزات موجودة في مجموعة المقيمين البشريين.

لماذا هو مهم

تُعد RLHF الآلية الأساسية لمواءمة الذكاء الاصطناعي، حيث تسد الفجوة بين القدرات الإحصائية الخام للنموذج والمتطلبات الدقيقة للتفاعل البشري. بدونها، غالبًا ما تنتج النماذج محتوى سامًا أو غير ذي صلة أو غير مفيد. من خلال دمج الحكم البشري، يمكن للمطورين توجيه النماذج نحو سلوك أكثر أمانًا وموثوقية وملاءمة للسياق، وهو شرط أساسي لنشر الذكاء الاصطناعي في التطبيقات المهنية والتعليمية والموجهة للمستهلكين.

مثال واقعي

تخيل روبوت محادثة طُلب منه شرح حدث تاريخي مثير للجدل. بدون RLHF، قد ينشئ النموذج ردًا متحيزًا أو تحريضيًا بناءً على بيانات الإنترنت الخام. مع RLHF، يقوم المقيمون البشريون بترتيب الردود المحايدة والقائمة على الحقائق والمتوازنة في مرتبة أعلى من تلك التي تعبر عن آراء. يتعلم النموذج إعطاء الأولوية لهذه الردود عالية الجودة والموضوعية، مما يضمن أن المخرجات النهائية مفيدة وآمنة لجمهور عام.

أخطاء شائعة

  • افتراض أن RLHF يغني عن الحاجة إلى بيانات تدريب مسبق عالية الجودة.
  • الاعتقاد بأن RLHF يضمن الدقة الواقعية؛ فهو يحسن بشكل أساسي التفضيل البشري، والذي قد يفضل أحيانًا إجابات تبدو واثقة ولكنها غير صحيحة.
  • التغاضي عن احتمالية ترسيخ تحيز المقيمين في شخصية النموذج.
  • التعامل مع RLHF كعملية 'ضبط ونسيان' بدلاً من دورة تكرارية من التقييم والتحسين.

الأسئلة الشائعة

كيف يختلف RLHF عن الضبط الدقيق الخاضع للإشراف (SFT)؟

يتضمن SFT تدريب النموذج على أمثلة محددة لأزواج المدخلات والمخرجات المطلوبة. في المقابل، يستخدم RLHF نموذج مكافأة لتوجيه الذكاء الاصطناعي نحو السلوكيات المفضلة، مما يسمح له بالتعلم من الترتيبات النسبية بدلاً من مجرد أمثلة ثابتة.

هل يمكن استخدام RLHF لإصلاح الهلوسة؟

على الرغم من أن RLHF يمكن أن يثبط النموذج عن اختلاق الحقائق من خلال معاقبة الإجابات غير الصحيحة، إلا أنه ليس حلاً مثاليًا. يكون أكثر فعالية عند دمجه مع التوليد المعزز بالاسترجاع (RAG) أو تقنيات التأصيل الأخرى.

ما هو دور نموذج المكافأة؟

يعمل نموذج المكافأة كوكيل للحكم البشري. يتم تدريبه على بيانات التفضيل البشري لتعيين درجة رقمية لأي مخرج معين للنموذج، والتي يحاول النموذج الأساسي بعد ذلك تعظيمها خلال مرحلة التعلم التعزيزي.