مركز متعدد الوسائط
المحور متعدد الوسائط (Multimodal Hub) هو مكون معماري أو منصة مركزية مصممة لاستيعاب ومعالجة وربط البيانات من وسائط متعددة ومتميزة - مثل النصوص والصور والصوت والفيديو وبيانات المستشعرات - ضمن إطار عمل موحد. فبدلاً من التعامل مع أنواع البيانات هذه بمعزل عن بعضها البعض، يسهل المحور فهمها بشكل تآزري، مما يسمح لنماذج الذكاء الاصطناعي بالاستدلال عبر أشكال الإدخال المختلفة.
غالبًا ما تكون أنظمة الذكاء الاصطناعي التقليدية منعزلة، وتتفوق فقط في مجال واحد (مثل معالجة اللغة الطبيعية أو الرؤية الحاسوبية). يتطلب ظهور المشكلات المعقدة في العالم الحقيقي أنظمة يمكنها تفسير السياق بشكل شامل. يعمل المحور متعدد الوسائط على سد هذه الفجوة، مما يمكّن التطبيقات من فهم طلب المستخدم الذي قد يتضمن صورة واستعلامًا صوتيًا وبيانات وصفية مصاحبة في وقت واحد. وهذا يؤدي إلى تفاعلات أكثر ثراءً ودقة وتشبه التفاعلات البشرية بشكل ملحوظ.
تعتمد الوظيفة الأساسية على تقنيات التضمين (embedding). يتم تحويل كل وسيط (نص، صورة، إلخ) أولاً إلى تمثيل متجهي عالي الأبعاد، أو "تضمين". ثم يستخدم المحور متعدد الوسائط طبقات دمج متخصصة - مثل آليات الانتباه المتقاطع (cross-attention mechanisms) - لمواءمة هذه التضمينات المتباينة ودمجها في تمثيل واحد متماسك. هذا المتجه الموحد هو ما يستخدمه نموذج الذكاء الاصطناعي اللاحق لاتخاذ القرارات أو التوليد.