ضبط وكلاء البحث باستخدام التعلم المعزز متعدد الأدوار على SageMaker
توضح AWS كيفية ضبط وكيل بحث Qwen3.6‑27B باستخدام التعلم المعزز متعدد الأدوار من Amazon SageMaker AI، محققًا جودة استرجاع أعلى ومعدلات فشل أقل.
تاريخ نشر المصدر الأصلي: 2 أكتوبر 2026
توضح AWS أن وكلاء البحث المدعومين بنماذج اللغة الكبيرة يمكنهم اتخاذ قرارات مستقلة بشأن ما يجب الاستعلام عنه، واستراتيجية الاسترجاع التي سيستخدمونها، ومتى يتوقفون، لكن تحقيق سلوك متعدد الأدوار موثوق به صعب. يقدم المدونة Amazon SageMaker AI Multi‑turn Reinforcement Learning (MTRL)، الذي يصيغ مهمة الوكيل كسلسلة من القرارات ويُحسّنها باستخدام خوارزميات تدرج السياسة مع الحفاظ على التكامل منخفض الشيفرة والتنفيذ بدون خوادم.
قام المؤلفون بضبط نموذج Qwen3.6‑27B لسيناريو بحث مؤسسي يتيح الوصول إلى أدوات البحث القاموسي BM25 والبحث المتجه. استخدم التدريب عدة مجموعات بيانات عامة وصناعية، ومكافأة تعتمد على nDCG@10، وتغيير طفيف في المعاملات الفائقة (max_epochs = 1، batch = 128، rollout concurrency = 32). إعدادات MTRL الافتراضية تتعامل مع اختيار الخوارزمية، وتقدير الميزة، وحدود خارج السياسة.
أظهرت التقييمات على أربعة معايير احتياطية تحسينات في ثلاثة مجموعات بيانات، مع أكبر الزيادات في BrowseComp‑Plus (+23.7 % nDCG@10) وWixQA (+18.4 %). كما انخفضت معدلات الفشل بشكل كبير، حيث انخفضت BrowseComp‑Plus من 22.89 % إلى 0.68 %، مما يدل على إكمال المهام بشكل أكثر موثوقية.