انتقل إلى المحتوى الرئيسي

مصطلحًا

الانتباه الذاتي (Self-Attention)

الفئة
Neural Networks & Architectures
الصعوبة
متوسط

التعريف

آلية في الشبكات العصبية تسمح للنموذج بحساب أهمية العناصر المختلفة داخل تسلسل ديناميكياً من خلال حساب العلاقات الموزونة بينها.

آلية العمل والسياق

الانتباه الذاتي هو المكون الأساسي لهندسة المحولات (Transformer). على عكس الشبكات العصبية المتكررة (RNNs) القديمة التي تعالج البيانات بشكل تسلسلي، تعالج آلية الانتباه الذاتي تسلسلات كاملة في وقت واحد. وهي تعمل عن طريق إنشاء ثلاثة متجهات لكل رمز إدخال: الاستعلام (Query)، والمفتاح (Key)، والقيمة (Value). يحسب النموذج درجة من خلال أخذ حاصل الضرب النقطي لمتجه الاستعلام مع جميع متجهات المفاتيح، مما يحدد وزن 'الانتباه'—أي مقدار التركيز الذي يجب أن يوليه رمز لآخر. تُستخدم هذه الأوزان بعد ذلك لحساب مجموع مرجح لمتجهات القيم. يسمح هذا للنموذج بالتقاط التبعيات طويلة المدى والعلاقات الدقيقة، مثل فهم أن 'هو' تشير إلى 'البنك' في جملة معقدة. القيد الأساسي هو تعقيدها الحسابي، الذي ينمو بشكل تربيعي مع طول التسلسل، مما يجعلها كثيفة الاستهلاك للذاكرة في المستندات الطويلة جداً.

لماذا هو مهم

الانتباه الذاتي هو السبب في أن النماذج اللغوية الكبيرة (LLMs) الحديثة يمكنها الحفاظ على التماسك عبر مقاطع طويلة من النص. من خلال السماح للنموذج بـ 'النظر' إلى السياق بأكمله في وقت واحد بدلاً من الكلمة السابقة فقط، فإنه يتيح فهماً متفوقاً للنحو، والدلالات، والهياكل المنطقية المعقدة. هذه الآلية ضرورية للمهام التي تتطلب وعياً سياقياً عميقاً، مثل الترجمة، والتلخيص، وتوليد الأكواد، وهي المحرك الرئيسي وراء الثورة الحالية في الذكاء الاصطناعي التوليدي.

مثال واقعي

في جملة 'لم يعبر الحيوان الشارع لأنه كان متعباً جداً'، تسمح آلية الانتباه الذاتي للنموذج بربط كلمة 'لأنه' بقوة بـ 'الحيوان' بدلاً من 'الشارع'. من خلال حساب درجات انتباه عالية بين 'لأنه' و'الحيوان'، يحدد النموذج بشكل صحيح حالة الفاعل، مما يوضح القدرة على حل الضمائر الغامضة بناءً على السياق المحيط المقدم في التسلسل.

أخطاء شائعة

  • الخلط بين الانتباه الذاتي والانتباه المتبادل (cross-attention)؛ الانتباه الذاتي يربط العناصر داخل نفس التسلسل، بينما الانتباه المتبادل يربط العناصر بين تسلسلين مختلفين.
  • افتراض أن الانتباه الذاتي له ذاكرة ثابتة؛ في الواقع هو ديناميكي ويعتمد على طول تسلسل الإدخال.
  • الاعتقاد بأن الانتباه الذاتي هو نفس 'الانتباه' بشكل عام؛ الانتباه الذاتي هو تنفيذ محدد وعالي الكفاءة لمفهوم الانتباه الأوسع.

الأسئلة الشائعة

كيف يختلف الانتباه الذاتي عن الشبكات العصبية المتكررة (RNNs) التقليدية؟

تعالج الشبكات العصبية المتكررة (RNNs) البيانات بشكل تسلسلي، مما يجعلها بطيئة وعرضة لنسيان المعلومات المبكرة في التسلسلات الطويلة. يعالج الانتباه الذاتي جميع الرموز بالتوازي، مما يسمح بتدريب أسرع واحتفاظ أفضل بالتبعيات طويلة المدى.

ما هي متجهات الاستعلام (Query)، والمفتاح (Key)، والقيمة (Value)؟

هذه هي إسقاطات متعلمة لتضمينات الإدخال. يمثل الاستعلام ما يبحث عنه الرمز، ويمثل المفتاح ما يقدمه الرمز للآخرين، وتمثل القيمة محتوى المعلومات الفعلي الذي سيتم تجميعه.

لماذا يعد التعقيد التربيعي للانتباه الذاتي مشكلة؟

لأن كل رمز يجب أن ينتبه لكل رمز آخر، يزداد عدد الحسابات بمربع طول التسلسل. هذا يجعل معالجة النصوص الطويلة جداً مكلفة حسابياً ومكثفة للذاكرة.