البحث متعدد الوسائط
يشير البحث متعدد الوسائط (Multimodal Search) إلى قدرة بحث متطورة تسمح للمستخدمين بإدخال والاستعلام عن المعلومات باستخدام أنواع متعددة من البيانات في وقت واحد. فبدلاً من الاقتصار على السلاسل النصية، يمكن لهذه الأنظمة معالجة وفهم المدخلات مثل الصور والمقاطع الصوتية وإطارات الفيديو والنصوص بشكل متزامن لتقديم نتائج ذات صلة عالية.
في المشهد الرقمي الحديث، نادراً ما تكون نية المستخدم أحادية. غالباً ما يتصفح المستخدمون بصرياً أو يصفون المفاهيم شفهياً. يعمل البحث متعدد الوسائط على سد هذه الفجوة، متجاوزاً مطابقة الكلمات المفتاحية إلى الفهم الدلالي الحقيقي. هذه القدرة حاسمة لتحسين تفاعل المستخدم، وتقليل الاحتكاك في عملية الاكتشاف، وإطلاق رؤى أعمق من مجموعات البيانات المعقدة والمتنوعة.
في جوهره، يعتمد البحث متعدد الوسائط على نماذج تعلم آلي متقدمة، وغالباً ما تكون نماذج أساسية كبيرة. يتم تدريب هذه النماذج على مجموعات بيانات ضخمة تقرن بين الوسائط المختلفة (على سبيل المثال، صورة مقترنة بتسميتها الوصفية). يتعلم النظام مساحة تضمين مشتركة وعالية الأبعاد حيث يتم وضع المفاهيم من تنسيقات مختلفة - صورة كلب وكلمة "كلبي" - بالقرب من بعضها البعض. عندما يصل استعلام، يقوم النظام بتحويل المدخل (سواء كان صورة أو نصاً) إلى هذا التمثيل المتجه المشترك ويبحث في قاعدة البيانات عن أقرب التطابقات.
البحث الدلالي، قواعد البيانات المتجهة، الذكاء الاصطناعي التوليدي، الرؤية الحاسوبية، معالجة اللغة الطبيعية (NLP)