محرك متعدد الوسائط
المحرك متعدد الوسائط (Multimodal Engine) هو نظام ذكاء اصطناعي متقدم مصمم لمعالجة وفهم وتوليد المعلومات من أنواع بيانات متميزة متعددة - أو "وسائط" - في وقت واحد. على عكس الذكاء الاصطناعي التقليدي الذي يتخصص في مدخل واحد (مثل معالجة اللغة الطبيعية للنصوص فقط)، يدمج المحرك متعدد الوسائط بسلاسة المدخلات مثل النصوص والصور والصوت والفيديو والبيانات المهيكلة لإنشاء فهم شامل لاستفسار أو مجموعة بيانات معقدة.
في بيئة البيانات الغنية اليوم، نادرًا ما توجد المعلومات في تنسيق واحد. يتفاعل العملاء مع العلامات التجارية من خلال الصور والأوامر الصوتية والاستفسارات المكتوبة. تُعد المحركات متعددة الوسائط حاسمة لأنها تسد هذه الفجوات، مما يسمح للتطبيقات بتقديم استجابات واعية بالسياق وشبيهة بالبشر. هذه القدرة تدفع نحو رؤى أعمق، وتحسن تجربة المستخدم، وتفتح مستويات جديدة من الأتمتة.
تتضمن الآلية الأساسية مُشفِّرات متخصصة لكل وسيط. على سبيل المثال، يقوم مُشفِّر الرؤية بمعالجة وحدات البكسل إلى تمثيل رقمي (تضمين)، بينما يقوم مُشفِّر اللغة بمعالجة الكلمات إلى تضمين خاص به. بعد ذلك، يستخدم المحرك بنية المحوِّل (transformer architecture) أو طبقة دمج مماثلة لتعيين هذه التضمينات المتباينة إلى فضاء كامن مشترك وعالي الأبعاد. يسمح هذا الفضاء الموحد للنموذج بالاستدلال عبر الوسائط - على سبيل المثال، فهم أن النص "كلب منفوش" يتوافق مع السمات البصرية لكلب.
تشمل المفاهيم ذات الصلة محولات الرؤية (Vision Transformers - ViT)، ونماذج اللغة الكبيرة (Large Language Models - LLMs)، ومساحات التضمين. غالبًا ما يكون المحرك متعدد الوسائط هو الإطار المعماري الذي يسمح لهذه المكونات الفردية بالتواصل بفعالية.