مصطلحًا
الاسترجاع (Retrieval)
- الفئة
- RAG, Embeddings & Search
- الصعوبة
- متوسط
التعريف
الاسترجاع هو العملية الحسابية لتحديد واستخراج المعلومات الأكثر صلة من قاعدة معرفة خارجية كبيرة لتوفير سياق لاستجابة نموذج الذكاء الاصطناعي. يتضمن عادةً الاستعلام عن قاعدة بيانات باستخدام التشابه الدلالي للعثور على البيانات التي تعالج مطالبة مستخدم محددة.
آلية العمل والسياق
في أنظمة الذكاء الاصطناعي الحديثة، وخاصة تلك التي تستخدم توليد الاسترجاع المعزز (RAG)، يعمل الاسترجاع كجسر بين نموذج ثابت ومعلومات ديناميكية أو خاصة أو محدثة. عندما يرسل المستخدم استعلاماً، يقوم النظام بتحويله إلى تمثيل متجه ويبحث في قاعدة بيانات المتجهات عن مستندات أو مقتطفات متشابهة دلالياً. يتم بعد ذلك حقن هذا السياق المسترجع في المطالبة المرسلة إلى النموذج اللغوي الكبير (LLM). ومع ذلك، تعتمد جودة الاسترجاع بشكل كبير على استراتيجية الفهرسة، وجودة التضمينات، وصلة الأجزاء المسترجعة، مما قد يؤدي إلى زمن انتقال وتعقيد في بنية النظام.
لماذا هو مهم
وبدونه، تقتصر النماذج على بيانات تدريبها، والتي غالباً ما تكون قديمة أو عامة. ومن خلال تمكين الأنظمة من "البحث" عن المعلومات قبل توليد استجابة، يسمح الاسترجاع بتفاعلات ذكاء اصطناعي أكثر واقعية وقابلة للتحقق ومحددة المجال، وهو شرط أساسي للنشر على مستوى المؤسسات.
مثال واقعي
يستخدم ذكاء اصطناعي لدعم العملاء في بنك الاسترجاع للإجابة على الأسئلة الخاصة بالحساب. عندما يسأل مستخدم عن سعر الفائدة الحالي الخاص به، يسترجع النظام أحدث وثيقة سياسة من قاعدة البيانات الداخلية للبنك. يستخدم الذكاء الاصطناعي بعد ذلك هذا النص المحدد والمسترجع لتوليد إجابة دقيقة، مما يضمن أن المعلومات دقيقة ومتوافقة مع الشروط الحالية للبنك، بدلاً من الاعتماد على المعرفة العامة للنموذج.
أخطاء شائعة
- افتراض أن الاسترجاع مثالي؛ يمكن أن تؤدي الأجزاء غير ذات الصلة إلى سيناريوهات "القمامة في الداخل، القمامة في الخارج".
- إهمال تحديث الفهرس، مما يؤدي إلى استرجاع معلومات قديمة أو عفا عليها الزمن.
- تحميل النموذج فوق طاقته بالكثير من السياق المسترجع، مما قد يضعف تركيز النموذج ويزيد التكاليف.
- الفشل في تنفيذ ضوابط الوصول المناسبة، مما قد يؤدي إلى استرجاع بيانات حساسة لا ينبغي للمستخدم رؤيتها.
الأسئلة الشائعة
كيف يختلف الاسترجاع عن البحث التقليدي بالكلمات الرئيسية؟
يعتمد البحث التقليدي بالكلمات الرئيسية على مطابقة الكلمات الدقيقة، بينما يستخدم استرجاع الذكاء الاصطناعي الحديث البحث الدلالي (التضمينات) للعثور على المحتوى بناءً على المعنى والسياق، حتى لو اختلفت الكلمات الدقيقة.
ما هي القيود الرئيسية لأنظمة الاسترجاع؟
تشمل القيود زمن الانتقال الذي تفرضه عملية البحث، وصعوبة الحفاظ على فهارس متجهات عالية الجودة، وخطر استرجاع معلومات غير ذات صلة يمكن أن تربك النموذج اللغوي الكبير.
هل يضمن الاسترجاع أن الذكاء الاصطناعي سيكون دقيقاً بنسبة 100%؟
لا. بينما يحسن الاسترجاع الدقة بشكل كبير من خلال توفير سياق واقعي، لا يزال بإمكان النموذج اللغوي الكبير إساءة تفسير المعلومات المسترجعة أو الفشل في تجميعها بشكل صحيح.