المكدس متعدد الوسائط
يشير المكدس متعدد الوسائط (Multimodal Stack) إلى بنية متكاملة ضمن نظام الذكاء الاصطناعي مصممة لمعالجة وفهم وتوليد المعلومات عبر أنواع بيانات متعددة في وقت واحد. فبدلاً من الاعتماد فقط على النصوص (كما هو الحال في نماذج اللغة الكبيرة التقليدية)، يدمج هذا المكدس مدخلات مثل الصور والصوت والفيديو والبيانات المهيكلة.
التفاعلات الرقمية الحديثة متعددة الوسائط بطبيعتها. فالأشخاص لا يكتفون بكتابة استفسارات؛ بل يقومون بتحميل لقطات شاشة، ويتحدثون بأوامر، ويشاهدون عروضًا توضيحية. يتيح المكدس متعدد الوسائط لحلول الذكاء الاصطناعي محاكاة الإدراك البشري، مما يؤدي إلى تطبيقات أكثر دقة وفهمًا للسياق وأكثر دقة بكثير. إنه ينقل الذكاء الاصطناعي من كونه أداة نصية فقط إلى مساعد رقمي شامل.
تتضمن الآلية الأساسية مُشفِّرات متخصصة لكل نوع من البيانات (على سبيل المثال، مُحوِّل رؤية للصور، ونموذج Whisper للصوت). تقوم هذه المُشفِّرات بترجمة البيانات المتباينة إلى مساحة تضمين (embedding space) مشتركة وعالية الأبعاد. يتيح هذا التمثيل الموحد لنموذج مركزي - غالبًا ما يكون مُحوِّلًا كبيرًا - الاستدلال عبر الوسائط، وربط المفاهيم المرئية بالأوصاف النصية أو الإشارات السمعية.
تشمل المفاهيم ذات الصلة نماذج الأساس (Foundation Models)، وقواعد بيانات المتجهات (Vector Databases)، والاسترجاع متعدد الوسائط (Cross-Modal Retrieval). غالبًا ما تشكل هذه التقنيات البنية التحتية الأساسية التي تمكّن المكدس متعدد الوسائط الوظيفي.