الملاحظة متعددة الوسائط
يشير الرصد متعدد الوسائط (Multimodal Observation) إلى قدرة نظام الذكاء الاصطناعي على معالجة وتفسير واستخلاص المعنى من أنواع متعددة ومتميزة من مدخلات البيانات في وقت واحد. فبدلاً من الاعتماد فقط على النص أو الصور فقط، يدمج النظام متعدد الوسائط تدفقات البيانات مثل المعلومات البصرية (الصور، الفيديو)، والسمعية (الكلام، المناظر الصوتية)، والنصية لبناء فهم شامل للمشهد أو الحدث.
في التطبيقات الواقعية، نادرًا ما يتم تقديم المعلومات بتنسيق واحد. يستخدم المراقب البشري البصر والصوت والسياق معًا لتكوين صورة كاملة. يسمح الرصد متعدد الوسائط للذكاء الاصطناعي بمحاكاة هذا الإدراك البشري الشمولي، مما يؤدي إلى قدرات اتخاذ قرار أكثر قوة ودقة وتفصيلاً بكثير مما يمكن أن تحققه الأنظمة أحادية النمط.
تتضمن الآلية الأساسية مُشفِّرات متخصصة لكل نوع من البيانات (على سبيل المثال، شبكة عصبونية تلافيفية (CNN) للصور، ومُحوِّل (Transformer) للنص، ومحلل طيف زمني (spectrogram analyzer) للصوت). يتم بعد ذلك تعيين هذه التمثيلات الفردية في مساحة تضمين مشتركة وعالية الأبعاد. ضمن هذه المساحة المشتركة، يتعلم النظام الارتباطات والعلاقات بين الوسائط المختلفة، مما يسمح له بالاستدلال عبرها.
يرتبط هذا المفهوم ارتباطًا وثيقًا بالاسترجاع عبر الوسائط (Cross-Modal Retrieval)، والتعلم بدون إشراف (Zero-Shot Learning)، ودمج المستشعرات (Sensor Fusion)، وكلها تعتمد على دمج مصادر البيانات المتباينة لتعزيز الذكاء.