المسترجع متعدد الوسائط
المسترجع متعدد الوسائط (Multimodal Retriever) هو نظام متقدم لاسترجاع المعلومات مصمم لمعالجة وفهرسة والبحث عبر أنواع متعددة من البيانات في وقت واحد. على عكس المسترجعات التقليدية التي تتعامل مع النص فقط أو الصور فقط، يمكن للمسترجع متعدد الوسائط فهم العلاقة الدلالية بين وسائط البيانات المختلفة - مثل مطابقة استعلام نصي لصورة ذات صلة، أو العثور على مقطع صوتي بناءً على وصف نصي.
في بيئة البيانات الغنية اليوم، نادرًا ما تقتصر المعلومات على تنسيق واحد. يتفاعل المستخدمون مع أنظمة الذكاء الاصطناعي باستخدام مدخلات متنوعة - فقد يقومون بتحميل صورة ويسألون: "ما هذا؟" أو يكتبون سؤالاً ويتوقعون مخططًا بيانيًا ذا صلة. يعمل الاسترجاع متعدد الوسائط على سد هذه الفجوة، مما يمكّن الذكاء الاصطناعي من تقديم إجابات شاملة ومدركة للسياق تحاكي الإدراك والفهم البشري.
تتضمن الآلية الأساسية التضمين (embedding). يتم تمرير كل قطعة من البيانات (نص، صورة، إطار فيديو) عبر مُشفِّر خاص بالوسيط (على سبيل المثال، نموذج BERT للنص، ومحوّل الرؤية Vision Transformer للصور). تقوم هذه المُشفِّرات بتعيين البيانات الأولية إلى فضاء متجهي مشترك وعالي الأبعاد، يُعرف باسم فضاء التضمين. ثم يقوم المسترجع بإجراء بحث التشابه (مثل تشابه جيب التمام) ضمن هذا الفضاء الموحد. ويتم ترميز الاستعلام، بغض النظر عن نوع مدخله، أيضًا في هذا الفضاء نفسه، مما يسمح للنظام بالعثور على المتجهات الأقرب تطابقًا من مجموعة البيانات المتنوعة المفهرسة.
تشمل المفاهيم ذات الصلة التعلم التبايني (Contrastive Learning)، وقواعد بيانات المتجهات (Vector Databases)، والتعلم الصفري (Zero-Shot Learning). غالبًا ما تشكل هذه التقنيات العمود الفقري أو منهجية التدريب لأنظمة الاسترجاع متعدد الوسائط الفعالة.