مصنف متعدد الوسائط
المصنِّف متعدد الوسائط (Multimodal Classifier) هو نموذج تعلم آلي متقدم مصمم لمعالجة وتفسير وتصنيف المعلومات الواردة من وسائط بيانات متعددة ومتميزة في وقت واحد. على عكس المصنفات التقليدية التي تتعامل مع أنواع بيانات واحدة (على سبيل المثال، النص فقط أو الصور فقط)، تقوم هذه النماذج بدمج المدخلات من مصادر مختلفة - مثل النصوص والصور والصوت والفيديو أو بيانات المستشعرات - لإنتاج تنبؤ أو تصنيف موحد ودقيق.
في التطبيقات الواقعية، نادرًا ما تكون البيانات معزولة في تنسيق واحد. قد يتضمن استفسار العميل صورة، وقد يتم وصف الإجراء المطلوب في نص مصاحب. تعمل المصنفات متعددة الوسائط على سد هذه الفجوة، مما يسمح لأنظمة الذكاء الاصطناعي بتحقيق فهم أعمق وأكثر سياقية للمدخلات المعقدة. يؤدي هذا إلى دقة ومتانة أعلى بكثير مقارنة بالأساليب أحادية الوسائط.
تتضمن الآلية الأساسية مُشفِّرات متخصصة لكل وسيط. على سبيل المثال، قد تقوم شبكة عصبية تلافيفية (CNN) بمعالجة صورة، بينما يتعامل نموذج المحوِّل (Transformer) مع النص المرتبط بها. يتم بعد ذلك تمرير المخرجات من هذه المُشفِّرات الفردية عبر طبقة دمج (fusion layer). هذه الطبقة مسؤولة عن الجمع بذكاء للتمثيلات المُتعلَّمة من كل مسار في متجه ميزات واحد وشامل، والذي يتم تغذيته أخيرًا إلى رأس التصنيف لتوليد المخرج.
تشمل المفاهيم ذات الصلة الاسترجاع عبر الوسائط (Cross-Modal Retrieval)، ومساحات التضمين المشتركة (Joint Embedding Spaces)، والتعلم بدون إشراف (Zero-Shot Learning)، وكلها تستفيد من مبادئ دمج المعلومات من مصادر بيانات متنوعة.