خدمة متعددة الوسائط
تشير الخدمة متعددة الوسائط (Multimodal Service) إلى نظام ذكاء اصطناعي أو برنامج قادر على معالجة وفهم وتوليد المعلومات من أنواع متعددة من مدخلات البيانات في وقت واحد. على عكس الأنظمة التقليدية أحادية الوسائط التي تتعامل مع النص فقط أو الصور فقط، تقوم الخدمة متعددة الوسائط بدمج تيارات البيانات المختلفة هذه - مثل النص والصور والصوت والفيديو وبيانات المستشعرات - لإنشاء فهم أكثر ثراءً وشمولية للمهمة أو الاستعلام.
في المشهد الرقمي المعقد اليوم، يكون التواصل البشري متعدد الوسائط بطبيعته. نادرًا ما نعالج المعلومات عبر قناة واحدة. تسمح الخدمات متعددة الوسائط للآلات بمحاكاة هذا الفهم البشري، مما يؤدي إلى تطبيقات أكثر سهولة وبنية وأكثر وعيًا بالسياق. هذه القدرة حاسمة لتجارب المستخدم من الجيل التالي والأتمتة المتقدمة.
تتضمن الآلية الأساسية مُشفِّرات متخصصة لكل وسيط بيانات. على سبيل المثال، يقوم مُشفِّر الصور بمعالجة وحدات البكسل إلى متجه رقمي، بينما يقوم مُشفِّر النص بتحويل الكلمات إلى تضمينات (embeddings). ثم تستخدم الخدمة طبقة دمج - غالبًا باستخدام معماريات المحولات (transformer architectures) - لمواءمة ودمج هذه المتجهات المتباينة في تمثيل موحد. يتم بعد ذلك تمرير هذا المتجه الموحد إلى مُفكِّك (decoder) لتوليد مخرج ذي صلة، قد يكون نصًا أو صورة أخرى أو إجراءً.
يتداخل هذا المفهوم بشكل كبير مع الذكاء الاصطناعي التوليدي (Generative AI)، الذي يركز على إنشاء محتوى جديد، ونماذج الأساس (Foundation Models)، وهي نماذج كبيرة مُدرَّبة مسبقًا وقادرة على التكيف مع مهام مختلفة عبر وسائط متعددة.