معيار الذكاء الاصطناعي
المعيار القياسي للذكاء الاصطناعي هو مجموعة موحدة من الاختبارات ومجموعات البيانات والمقاييس المستخدمة لقياس أداء وقدرات وقيود نماذج أو أنظمة الذكاء الاصطناعي بموضوعية. توفر هذه المعايير مقياسًا مشتركًا، مما يسمح للباحثين والشركات بمقارنة النماذج المختلفة (مثل النماذج اللغوية الكبيرة، ونماذج رؤية الحاسوب) بشكل عادل فيما بينها.
في مجال الذكاء الاصطناعي سريع التطور، لا يكفي مجرد الادعاء بأن نموذجًا ما "جيد". توفر المعايير أدلة تجريبية. إنها تسمح لأصحاب المصلحة - من علماء البيانات إلى صناع القرار التنفيذيين - بتحديد المقايضات بين النماذج المختلفة فيما يتعلق بالدقة والكفاءة والمتانة وقدرة التعميم. هذا التوحيد القياسي حيوي للنشر المسؤول للذكاء الاصطناعي.
عادةً ما تتضمن المعايير تزويد النموذج بمجموعة بيانات محددة ومُنسقة مصممة لاختبار مهارة معينة (على سبيل المثال، تحليل المشاعر، أو توليد الشفرات البرمجية، أو الاستدلال). يتم بعد ذلك تقييم مخرجات النموذج تلقائيًا مقابل حقيقة أساسية محددة مسبقًا باستخدام مقاييس راسخة مثل الدقة، أو درجة F1، أو درجة BLEU، أو التعقيد (perplexity). النتيجة الناتجة هي نتيجة المعيار.
تشمل المفاهيم ذات الصلة "مقاييس التقييم" (الدرجات الرياضية المحددة)، و"التعلم النقلي" (تطبيق المعرفة من معيار إلى مهمة أخرى)، و"الاختبار العدائي" (محاولة كسر النموذج عن قصد).