EmbeddingGemma 2: نموذج تضمين متعدد الوسائط مفتوح
أصدرت Google DeepMind نموذج EmbeddingGemma 2 المفتوح، الذي يضم 740 مليون معلمة ويُضمّن النص، والشفرة، والصور، والفيديو، والصوت على الجهاز.
تاريخ نشر المصدر الأصلي: 6 أكتوبر 2026
EmbeddingGemma 2 هو أحدث نموذج مفتوح من Google DeepMind، مبني على بنية Gemma 4 ومُصدَر تحت رخصة Apache 2.0. يضم 740 مليون معلمة، ويدعم تضمينات متعددة الوسائط أصلية للنص، والشفرة، والصور، والفيديو، والصوت، ويُعد خيارًا خفيفًا للاستدلال على الجهاز.
تحقق النموذج درجات رائدة بين مُضمّنات متعددة الوسائط تحت 1 مليار معلمة في معايير مثل MTEB Code وMAEB، وتُقارن أو تتفوق على النماذج الأكبر في مهام النص والرؤية والصوت. هو نمطي — يمكن تشغيل أحمال العمل النصية فقط بأقل عدد من المعلمات وهو 270 مليون، بينما تمكّن المشفرات الاختيارية للرؤية (170 مليون) والصوت (300 مليون) من دعم كامل متعدد الوسائط. يتيح Matryoshka Representation Learning للمطورين تقصير المتجهات من 768 إلى 128 بُعدًا، مما يوفر تقليلًا في التخزين يصل إلى 6×. يستخدم الاستدلال المُكمَّن على Google Pixel 11 Pro حوالي 191 ميغابايت من الذاكرة للنص فقط و567 ميغابايت للنموذج الكامل، وتسمح نافذة 8K توكن بمعالجة ما يصل إلى 5.5 دقيقة من الصوت، 29 صورة أو 58 إطار فيديو.
يُقصد من EmbeddingGemma 2 البحث الدلالي، والتوجيه، والاسترجاع على الجهاز، مع الحفاظ على خصوصية البيانات وتقليل الكمون. يمكن دمجه مع Gemma 4 لإنشاء خطوط إنتاج توليد معززة بالاسترجاع على الجهاز. أوزان النموذج متاحة على Hugging Face وKaggle، مع خيارات النشر عبر Google AI Edge MediaPipe وLiteRT وtransformers.js وWebGPU ومكتبات الخدمة المتنوعة.