انتقل إلى المحتوى الرئيسي

مصطلحًا

المحول

الفئة
Neural Networks & Architectures
الصعوبة
متوسط

التعريف

بنية تعلم عميق تعتمد على آلية الانتباه الذاتي التي تسمح بالمعالجة المتوازية للبيانات المتسلسلة، مما يلتقط التبعيات طويلة المدى بفعالية دون الحاجة إلى التكرار.

آلية العمل والسياق

تم تقديم بنية المحول في ورقة بحثية عام 2017 بعنوان "Attention Is All You Need"، وحلت محل الشبكات العصبية المتكررة (RNNs) وشبكات الذاكرة الطويلة قصيرة المدى (LSTM). ابتكارها الأساسي هو آلية "الانتباه الذاتي"، التي تسمح للنموذج بوزن أهمية الكلمات المختلفة في تسلسل بالنسبة لبعضها البعض، بغض النظر عن مسافتها. من خلال معالجة البيانات بالتوازي بدلاً من التسلسل، يمكن تدريب المحولات على مجموعات بيانات ضخمة بشكل أسرع بكثير من سابقاتها. على الرغم من فعاليتها العالية، إلا أن المحولات مكلفة حسابيًا للتدريب ولديها حد "نافذة السياق"، مما يعني أنها لا تستطيع معالجة سوى كمية محدودة من المعلومات في وقت واحد، مما قد يؤدي إلى قيود في الذاكرة في المستندات الطويلة للغاية.

لماذا هو مهم

تعد بنية المحول هي الاختراق الأساسي الذي مكن من الانفجار الحالي في الذكاء الاصطناعي التوليدي. قدرتها على التعامل مع كميات هائلة من البيانات بالتوازي تسمح بإنشاء نماذج بمليارات المعلمات التي تظهر قدرات استدلال وترجمة وبرمجة شبيهة بالبشر.

مثال واقعي

عندما تطلب من ذكاء اصطناعي تلخيص عقد قانوني من 50 صفحة، فإنه يستخدم بنية المحول للحفاظ على "الانتباه" عبر المستند بأكمله. فهو يحدد أن بندًا معينًا في الصفحة 45 مرتبط مباشرة بتعريف مقدم في الصفحة 2. نظرًا لأن النموذج يعالج هذه العلاقات في وقت واحد بدلاً من القراءة كلمة بكلمة، يمكنه تركيب معنى المستند بأكمله وتقديم ملخص دقيق في ثوانٍ.

أخطاء شائعة

  • افتراض أن المحولات مخصصة للنصوص فقط؛ فهي تُستخدم بشكل متزايد لمعالجة الصور والصوت والفيديو.
  • الخلط بين بنية المحول ونماذج محددة مثل ChatGPT، وهو تطبيق مبني فوق البنية.
  • الاعتقاد بأن المحولات لديها ذاكرة "حقيقية"؛ فهي تمتلك فقط نافذة سياق ثابتة ولا تحتفظ بالمعلومات بين الجلسات المنفصلة ما لم يتم تصميمها خصيصًا للقيام بذلك.

الأسئلة الشائعة

كيف تختلف آلية الانتباه الذاتي عن الشبكات العصبية المتكررة (RNNs) التقليدية؟

تعالج الشبكات العصبية المتكررة البيانات بشكل تسلسلي، مما يعني أنه يجب عليها إنهاء خطوة واحدة قبل الانتقال إلى التالية، مما يجعلها بطيئة وعرضة لـ "نسيان" المعلومات المبكرة. يسمح الانتباه الذاتي للنموذج بالنظر إلى كل كلمة في تسلسل في نفس الوقت، مما يخلق روابط مباشرة بين جميع أجزاء المدخلات.

ما هي القيود الرئيسية لبنية المحول؟

القيد الرئيسي هو التكلفة الحسابية التربيعية بالنسبة لطول التسلسل، مما يجعل معالجة المدخلات الطويلة للغاية مكثفة للذاكرة. بالإضافة إلى ذلك، فهي تتطلب كميات هائلة من البيانات وقوة الحوسبة للوصول إلى ذروة الأداء.

هل تعتمد جميع نماذج الذكاء الاصطناعي الحديثة على المحولات؟

على الرغم من أن المحولات هي البنية المهيمنة للنماذج اللغوية الكبيرة والذكاء الاصطناعي التوليدي، إلا أنه يتم البحث في بنيات أخرى مثل نماذج فضاء الحالة (SSMs) كبدائل محتملة لمعالجة قيود الكفاءة في المحولات.