انتقل إلى المحتوى الرئيسي

مصطلحًا

التعلم التعزيزي (Reinforcement Learning)

الفئة
AI & Machine Learning Fundamentals
الصعوبة
متوسط

التعريف

نموذج للتعلم الآلي حيث يتعلم وكيل مستقل اتخاذ تسلسلات مثالية من القرارات من خلال تنفيذ إجراءات داخل بيئة وتلقي ملاحظات في شكل مكافآت أو عقوبات.

آلية العمل والسياق

يختلف التعلم التعزيزي (RL) عن التعلم الخاضع للإشراف لأنه لا يعتمد على مجموعة بيانات ثابتة من الأمثلة المصنفة. بدلاً من ذلك، يعمل الوكيل في بيئة ديناميكية، ويراقب حالته الحالية ويختار الإجراءات بناءً على سياسة معينة. يؤدي كل إجراء إلى الانتقال إلى حالة جديدة ويولد إشارة مكافأة عددية. هدف الوكيل هو تعلم سياسة تزيد من المكافأة التراكمية بمرور الوقت. تتضمن هذه العملية مقايضة أساسية بين الاستكشاف (تجربة إجراءات جديدة قد تكون أفضل) والاستغلال (اختيار الإجراءات المعروفة التي تحقق مكافآت عالية). التعلم التعزيزي مكثف حسابياً وغالباً ما يتطلب ملايين التفاعلات للتقارب، مما يجعله حساساً لتصميم دالة المكافأة، والتي يمكن أن تؤدي إلى سلوكيات غير مقصودة إذا لم يتم مواءمتها بعناية مع النتيجة المرجوة.

لماذا هو مهم

يعد التعلم التعزيزي ضرورياً للأنظمة التي يجب أن تعمل بشكل مستقل في بيئات معقدة وغير متوقعة حيث يستحيل تقديم تعليمات صريحة. إنه يدعم الاختراقات في الروبوتات، ولعب الألعاب، وأنظمة اتخاذ القرار الاستراتيجي. ومن خلال تمكين الوكلاء من التعلم من التجربة بدلاً من القواعد المبرمجة مسبقاً، يسمح التعلم التعزيزي بتطوير ذكاء اصطناعي تكيفي قادر على حل المشكلات التي تتطلب تخطيطاً طويل المدى وتفكيراً متسلسلاً، وهي أمور بالغة الأهمية لمهام الأتمتة والتحسين في العالم الحقيقي.

مثال واقعي

في روبوتات المستودعات المستقلة، يتم تكليف وكيل تعلم تعزيزي بتحسين مسار الروبوتات المتنقلة لاسترجاع المخزون. يتلقى الوكيل مكافأة إيجابية لتسليم العناصر بنجاح إلى محطة التعبئة وعقوبة للاصطدامات أو الاستخدام غير الفعال للبطارية. ومن خلال ملايين التجارب المحاكية، يتعلم الوكيل التنقل في أرضية المستودع، وتجنب العقبات، وتحديد أولويات المهام لزيادة الإنتاجية دون تدخل بشري.

أخطاء شائعة

  • افتراض أن التعلم التعزيزي مناسب لجميع مهام التعلم الآلي؛ فهو غالباً ما يكون مبالغاً فيه لمشاكل التصنيف أو الانحدار البسيطة.
  • تصميم دوال مكافأة تشجع على "اختراق المكافأة"، حيث يجد الوكيل ثغرة للحصول على نقاط دون أداء المهمة المقصودة.
  • إهمال التكلفة الحسابية العالية والوقت المطلوب للتدريب، والتي يمكن أن تكون باهظة بالنسبة للعديد من المؤسسات.
  • الفشل في مراعاة "عدم كفاءة العينة" في التعلم التعزيزي، حيث يتطلب الوكيل كميات هائلة من البيانات لتعلم السلوكيات الأساسية.

الأسئلة الشائعة

كيف يختلف التعلم التعزيزي عن التعلم الخاضع للإشراف؟

يعتمد التعلم الخاضع للإشراف على مجموعة بيانات ثابتة من أزواج المدخلات والمخرجات المقدمة من قبل البشر، بينما يتضمن التعلم التعزيزي وكيلاً يتعلم من خلال التفاعل النشط وتغذية راجعة بالتجربة والخطأ داخل بيئة ما.

ما هي معضلة "الاستكشاف مقابل الاستغلال"؟

إنها التحدي المتمثل في موازنة الحاجة إلى تجربة إجراءات جديدة وغير مختبرة لاكتشاف مكافآت قد تكون أفضل (الاستكشاف) مقابل الحاجة إلى اختيار إجراءات معروفة أثبتت فعاليتها بالفعل (الاستغلال).

هل يمكن استخدام التعلم التعزيزي لتحليل البيانات الثابتة؟

بشكل عام، لا. صُمم التعلم التعزيزي لاتخاذ القرارات المتسلسلة في البيئات الديناميكية. وعادة ما يكون استخدامه لتحليل البيانات الثابتة غير فعال مقارنة بطرق التعلم التقليدية الخاضعة للإشراف أو غير الخاضعة للإشراف.