مُقيِّم متعدد الوسائط
المُقيِّم متعدد الوسائط (Multimodal Evaluator) هو نظام أو إطار عمل متطور مصمم لتقييم أداء ودقة وتماسك نماذج الذكاء الاصطناعي (AI) التي تعالج وتُنشئ المعلومات عبر وسائط بيانات متعددة في وقت واحد. على عكس المقيمات التقليدية التي قد تتحقق فقط من المخرجات النصية، يمكن للمُقيِّم متعدد الوسائط أن يحكم على مدى جودة دمج النموذج واستنتاجه عبر مدخلات مثل النصوص والصور والصوت والفيديو.
مع تزايد قدرة أنظمة الذكاء الاصطناعي على التفاعل مع العالم الحقيقي - فهم صورة أثناء قراءة تعليق عليها، أو الاستجابة لاستفسار صوتي حول رسم بياني - يجب أن تتطور طرق التقييم. يضمن المُقيِّم متعدد الوسائط أن أداء الذكاء الاصطناعي لا يقتصر على نوع واحد من البيانات. إنه يثبت الفهم الحقيقي للنموذج وقدرته على أداء مهام معقدة في العالم الحقيقي تتطلب استدلالاً عبر الوسائط.
تتضمن عملية التقييم عادةً تزويد النموذج بمطالبة أو سيناريو معقد يحتوي على مدخلات مختلطة (على سبيل المثال، صورة رسم بياني مقترنة بسؤال حول البيانات). ثم يقارن المُقيِّم مخرجات النموذج بمجموعة من مقاييس الحقيقة الأساسية المحددة مسبقًا. يمكن أن تتراوح هذه المقاييس من الصحة الدلالية (هل أجاب على السؤال بدقة؟) إلى الجودة الإدراكية (هل الصورة المولدة متسقة مع المطالبة النصية؟).
غالبًا ما يستخدم النظام مُقيِّمات فرعية متخصصة لكل وسيط، والتي تقوم بعد ذلك بتجميع درجاتها في درجة شاملة وموزونة للأداء متعدد الوسائط العام.
يرتبط هذا المفهوم ارتباطًا وثيقًا بالتعلم بدون إشراف (Zero-Shot Learning)، والتعلم بلقطات قليلة (Few-Shot Learning)، وآليات الانتباه المتقاطع (Cross-Attention Mechanisms)، وهي المكونات المعمارية الأساسية التي تسمح للنماذج بالتعامل مع تدفقات البيانات المتعددة بفعالية.