معيار قابل للتفسير
المعيار المفسَّر (Explainable Benchmark) هو مجموعة موحدة من الاختبارات مصممة ليس فقط لقياس الأداء الخام (الدقة، درجة F1) لنموذج الذكاء الاصطناعي، ولكن أيضًا لتحديد كيف ولماذا يصل إلى قراراته. على عكس المعايير التقليدية التي تركز فقط على مقاييس المخرجات، تدمج هذه المعايير مقاييس تتعلق بالقابلية للتفسير والمتانة والإنصاف.
في التطبيقات الحساسة - مثل التشخيص الطبي، أو الموافقة على القروض، أو القيادة الذاتية - لا تكون درجة الدقة العالية كافية. يتطلب أصحاب المصلحة ضمان أن النموذج يعمل بشكل منطقي وأخلاقي. تعمل المعايير المفسَّرة على سد الفجوة بين الأداء العالي والثقة العالية، مما يسمح للمطورين والجهات التنظيمية بتدقيق عملية استدلال الذكاء الاصطناعي.
تدمج هذه المعايير طبقات تقييم مختلفة. فبالإضافة إلى المقاييس القياسية، غالبًا ما تتطلب من النموذج إنتاج تفسيرات (مثل درجات أهمية الميزات، أو الأمثلة المضادة للواقع) جنبًا إلى جنب مع تنبؤه. ثم يقوم المعيار بتقييم جودة هذه التفسيرات واستقرارها ومدى وفائها للحقيقة الأساسية أو التوقعات البشرية.
إن تطوير معايير مفسَّرة قوية أمر معقد لأن التفسير "الجيد" هو أمر ذاتي. لا يوجد معيار عالمي لما يشكل تفسيرًا واضحًا أو صادقًا بما فيه الكفاية عبر جميع المجالات.
يرتبط هذا المفهوم ارتباطًا وثيقًا بالذكاء الاصطناعي القابل للتفسير (XAI)، وقابلية تفسير النماذج، واختبار المتانة العدائية.