إشارة متعددة الوسائط
يشير الإشارة متعددة الوسائط إلى البيانات التي تنشأ من، أو تتم معالجتها عبر، وسائط حسية أو بيانات متعددة ومتميزة. فبدلاً من تحليل النص بمعزل عن الصور أو تحليل الصور بشكل منفصل، تستوعب الأنظمة متعددة الوسائط وتربط المعلومات من أنواع مختلفة من المدخلات - مثل دمج صورة مع التسمية التوضيحية الوصفية المقابلة لها، أو دمج مدخل صوتي مع حركات الشفاه المرئية.
في العالم الحقيقي، نادرًا ما يتم تقديم المعلومات بتنسيق واحد. يقوم البشر بشكل طبيعي بمعالجة اللغة والبصر والصوت في وقت واحد. يهدف الذكاء الاصطناعي متعدد الوسائط إلى محاكاة هذا الإدراك البشري الشمولي. تتيح هذه القدرة لنماذج الذكاء الاصطناعي تحقيق فهم أعمق وأكثر سياقية للسيناريوهات المعقدة، مما يؤدي إلى اتخاذ قرارات أكثر قوة ودقة.
تتضمن الآلية الأساسية مُشفِّرات متخصصة لكل وسيط (على سبيل المثال، شبكات CNN للصور، والمُحوِّلات (Transformers) للنصوص، وشبكات RNN للصوت). تقوم هذه المُشفِّرات الفردية بتحويل البيانات الأولية إلى مساحة تضمين مشتركة وعالية الأبعاد. ثم يستخدم النظام تقنيات الدمج - مثل الدمج المبكر أو المتأخر أو الوسيط - لدمج هذه التضمينات. يتيح هذا التمثيل الموحد للنموذج تعلم الارتباطات عبر الوسائط، مما يعني أنه يتعلم كيف ترتبط سمة بصرية معينة بمفهوم لغوي معين.
تعد الإشارات متعددة الوسائط بالغة الأهمية في العديد من التطبيقات المتقدمة:
الفائدة الأساسية هي زيادة الثراء السياقي. من خلال المرجعية المتبادلة لأنواع البيانات، تقل النماذج الغموض وتحسن التعميم. بالنسبة للشركات، يترجم هذا إلى عمليات نشر ذكاء اصطناعي أكثر موثوقية، وتفاعل أفضل للمستخدم، ودقة أعلى في العمليات المؤتمتة.
يمثل دمج أنواع البيانات المتنوعة عقبات تقنية كبيرة. تشمل التحديات ضمان محاذاة الوسائط (التأكد من أن النص يشير إلى الجزء الصحيح من الصورة)، وإدارة التعقيد الحسابي بسبب البيانات عالية الأبعاد، وتطوير معماريات دمج موحدة تعمل بأفضل شكل عبر مجموعات البيانات المختلفة.
تشمل المفاهيم ذات الصلة الاسترجاع عبر الوسائط (العثور على عناصر ذات صلة عبر أنواع بيانات مختلفة)، والتعلم بدون إشراف (أداء المهام على بيانات غير مرئية باستخدام السياق متعدد الوسائط)، والتعلم التمثيلي الموحد.