الحلقة متعددة الوسائط
يصف "الحلقة متعددة الوسائط" (Multimodal Loop) عملية تكرارية يقوم فيها نظام الذكاء الاصطناعي باستيعاب ومعالجة ومقارنة المعلومات باستمرار من وسائط بيانات متميزة ومتعددة - مثل النصوص والصور والصوت والفيديو وبيانات المستشعرات. على عكس الذكاء الاصطناعي أحادي الوسائط، تتيح هذه الحلقة للنظام بناء فهم أكثر ثراءً وشمولية للمدخلات أو البيئة المعقدة.
في البيئات الرقمية الحديثة، نادرًا ما تصل البيانات بتنسيق واحد. قد يقدم المستخدم صورة لجهاز معطل (صورة)، ويصف المشكلة نصيًا (نص)، وقد يسمع النظام صوت نقر (صوت). تُعد الحلقة متعددة الوسائط أمرًا بالغ الأهمية لأنها تسمح للذكاء الاصطناعي بتجاوز مجرد مطابقة الأنماط لتحقيق فهم سياقي حقيقي، مما يؤدي إلى مخرجات أكثر دقة ودقة في التعبير.
تتبع العملية عمومًا هذه الخطوات: