مصطلحًا
مجموعة البيانات (Dataset)
- الفئة
- AI & Machine Learning Fundamentals
- الصعوبة
- مبتدئ
التعريف
مجموعة منظمة من نقاط البيانات، يتم تنظيمها عادةً في صفوف وأعمدة أو تنسيقات هرمية، تُستخدم لتدريب نماذج التعلم الآلي أو التحقق منها أو اختبارها.
آلية العمل والسياق
في سياق الذكاء الاصطناعي، تعد مجموعة البيانات اللبنة الأساسية لتطوير النماذج. وهي تتكون من مدخلات خام - مثل النصوص أو الصور أو الصوت أو القيم الرقمية - التي تم جمعها وغالباً ما تمت معالجتها مسبقاً لمهمة محددة. يتم تقسيم مجموعات البيانات عادةً إلى ثلاث مجموعات فرعية: بيانات التدريب (لتعليم النموذج)، وبيانات التحقق (لضبط المعلمات الفائقة)، وبيانات الاختبار (لتقييم الأداء النهائي). تحدد جودة وتنوع وحجم مجموعة البيانات بشكل مباشر قدرات وقيود الذكاء الاصطناعي الناتج. أحد التحديات الرئيسية في الذكاء الاصطناعي الحديث هو ضمان أن تكون مجموعات البيانات تمثيلية وخالية من التحيزات الضارة، حيث ستعكس النماذج حتماً الأنماط الموجودة ضمن بيانات تدريبها. علاوة على ذلك، يجب تنظيف مجموعات البيانات وتنسيقها بعناية لضمان تعلم النموذج إشارات ذات مغزى بدلاً من الضوضاء.
لماذا هو مهم
مجموعات البيانات هي "وقود" أنظمة الذكاء الاصطناعي. بدون بيانات عالية الجودة وذات صلة، ستفشل حتى أكثر بنية شبكة عصبية تقدماً في إنتاج نتائج مفيدة. يعد فهم مجموعات البيانات أمراً بالغ الأهمية للمطورين والباحثين لأنه ينقل التركيز من مجرد اختيار خوارزمية إلى تنسيق المعلومات التي تحدد سلوك الذكاء الاصطناعي وعدالته ودقته في التطبيقات الواقعية.
مثال واقعي
تخيل شركة تبني ذكاءً اصطناعياً للكشف عن معاملات بطاقات الائتمان الاحتيالية. ستتضمن مجموعة بياناتهم ملايين سجلات المعاملات التاريخية، حيث يتم تصنيف كل منها على أنها "مشروعة" أو "احتيالية". يحلل النموذج ميزات مثل مبلغ المعاملة والموقع ووقت اليوم ضمن مجموعة البيانات هذه لتعلم الأنماط الدقيقة التي تميز الشراء العادي عن الشراء الضار، ويطبق هذه المعرفة في النهاية على المعاملات الحية الواردة.
أخطاء شائعة
- افتراض أن "المزيد من البيانات أفضل دائماً" دون النظر إلى جودة البيانات أو صلتها.
- الفشل في مراعاة تسرب البيانات، حيث تؤثر المعلومات من مجموعة الاختبار عن طريق الخطأ على عملية التدريب.
- تجاهل التحيزات الديموغرافية أو التاريخية الموجودة في البيانات، مما يؤدي إلى سلوك تمييزي للذكاء الاصطناعي.
- إهمال تنظيف البيانات أو تطبيعها بشكل صحيح، مما يتسبب في معاناة النموذج مع التنسيقات غير المتسقة أو القيم المتطرفة.
الأسئلة الشائعة
كيف تختلف مجموعة البيانات عن قاعدة البيانات؟
قاعدة البيانات هي نظام للأغراض العامة لتخزين وإدارة المعلومات المنظمة للتطبيقات. مجموعة البيانات هي لقطة محددة أو مجموعة فرعية من البيانات المستخرجة من قاعدة بيانات (أو مصادر أخرى) تم إعدادها خصيصاً لغرض تدريب أو تقييم نموذج ذكاء اصطناعي.
ما الفرق بين البيانات المصنفة وغير المصنفة؟
تتضمن البيانات المصنفة إجابات "الحقيقة الأساسية" (على سبيل المثال، صورة لقطة مع علامة تقول 'قطة')، وهو أمر مطلوب للتعلم الخاضع للإشراف. تفتقر البيانات غير المصنفة إلى هذه العلامات وتستخدم عادةً في التعلم غير الخاضع للإشراف للعثور على هياكل مخفية أو في التعلم الذاتي للإشراف للتدريب المسبق.
لماذا يعد تنظيف البيانات ضرورياً قبل التدريب؟
غالباً ما تحتوي البيانات الخام على أخطاء أو تكرارات أو قيم مفقودة أو ضوضاء غير ذات صلة. إذا تم تغذية هذه البيانات "المتسخة" في نموذج، فقد يؤدي ذلك إلى ضعف الأداء أو تنبؤات غير صحيحة أو تعزيز أنماط سيئة، وهي ظاهرة يشار إليها غالباً بـ "القمامة في الداخل، القمامة في الخارج".