تجمع متعدد الوسائط
تُشير المجموعة متعددة الوسائط (Multimodal Cluster) إلى تجميع لنقاط بيانات يحددها نظام ذكاء اصطناعي وتُظهر تشابهاً دلالياً عبر وسائط بيانات متعددة ومتميزة. فبدلاً من التجميع بناءً على تضمينات النصوص أو وحدات البكسل للصور فقط، تدمج هذه المجموعات المعلومات من مصادر مختلفة - مثل الأوصاف النصية، والصور المرتبطة، والتسجيلات الصوتية، وبيانات المستشعرات - لتكوين تمثيل شامل للبيانات.
غالباً ما تفشل طرق التجميع التقليدية عندما تكون البيانات معقدة وغير متجانسة بطبيعتها. باستخدام التجميع متعدد الوسائط، يمكن للشركات تحقيق فهم أعمق بكثير لمجموعات بياناتها. يتيح ذلك تحديد أنماط دقيقة قد تكون غير مرئية عند تحليل الوسائط بمعزل عن بعضها البعض، مما يؤدي إلى رؤى أكثر دقة واتخاذ قرارات أفضل.
تتضمن العملية عادةً عدة خطوات متطورة. أولاً، تتم معالجة كل وسيط (مثل النص أو الصورة) بواسطة مُشفِّر متخصص (مثل BERT للنصوص أو ResNet للصور) لتحويله إلى تضمين متجه عالي الأبعاد. ثم يتم محاذاة هذه التضمينات الفردية في مساحة تضمين مشتركة وموحدة. وأخيراً، يتم تطبيق خوارزميات التجميع القياسية (مثل K-Means أو DBSCAN) على هذه المتجهات الموحدة ومتعددة الوسائط لتكوين المجموعات النهائية.