مُقيّم واسع النطاق
المُقيِّم واسع النطاق هو نظام أو إطار عمل متطور مصمم لتقييم أداء ونُضج وجودة نماذج الذكاء الاصطناعي (AI) المعقدة عبر مجموعات بيانات ضخمة وبيئات تشغيل متنوعة. على عكس الاختبارات واسعة النطاق، يتعامل هؤلاء المُقيِّمون مع ملايين المدخلات، مما يضمن أن النموذج يعمل بشكل موثوق به في ظل ظروف العالم الحقيقي وذات الحجم الكبير.
في النشر الحديث للذكاء الاصطناعي، يجب أن تحافظ النماذج على دقة واتساق عاليين عند مواجهة أحمال الإنتاج. يعمل المُقيِّم واسع النطاق على تخفيف مخاطر الأعطال الكارثية من خلال تحديد التدهورات الدقيقة في الأداء، أو التحيزات، أو اختناقات الكفاءة التي قد تظهر فقط تحت نطاق شديد. وهو أمر بالغ الأهمية لضمان موثوقية النموذج واستقراره التشغيلي.
تتضمن هذه الأنظمة عادةً مسارات عمل مؤتمتة تغذي بيانات تحاكي بيئة الإنتاج إلى نموذج الذكاء الاصطناعي المستهدف. يقوم المُقيِّم بعد ذلك بتطبيق مجموعة من المقاييس المحددة مسبقًا - مثل زمن الوصول (latency)، ومعدل الإنتاجية (throughput)، ومقياس F1، أو معدل الهلوسة (hallucination rate) - ويقوم بتجميع النتائج. غالبًا ما تدمج المُقيِّمات المتقدمة الاختبارات العدائية (adversarial testing)، حيث تحاول بنشاط كسر النموذج لاختبار حدوده.
إن تطبيق هذه الأنظمة معقد. تشمل التحديات الرئيسية إدارة الموارد الحاسوبية المطلوبة لمعالجة البيانات الضخمة، وتحديد مقاييس تقييم شاملة وغير متحيزة، وضمان أن بيئة التقييم تعكس بدقة ظروف الإنتاج.
يرتبط هذا المفهوم ارتباطًا وثيقًا بعمليات تعلم الآلة (MLOps)، واكتشاف انحراف النموذج (Model Drift Detection)، وأطر عمل الاختبار الآلي (Automated Testing Frameworks).