معيار المعرفة
معيار المعرفة (Knowledge Benchmark) هو مجموعة موحدة من المهام أو مجموعات البيانات أو الأسئلة المصممة لاختبار وقياس قدرات ودقة وعمق المعرفة في نموذج الذكاء الاصطناعي (AI) أو نظام المعرفة بشكل صارم. وهو بمثابة مقياس ثابت يمكن من خلاله مقارنة النماذج المختلفة أو التكرارات المختلفة لنفس النموذج بموضوعية.
في مجال الذكاء الاصطناعي سريع التطور، لم يعد مجرد الادعاء بأن النموذج "ذكي" كافياً. توفر معايير المعرفة أدلة تجريبية على الأداء. وهي ضرورية لأصحاب المصلحة - من الباحثين إلى مديري المنتجات - لتحديد ما إذا كان النموذج يلبي المعايير التشغيلية المحددة مسبقاً، وما إذا كان جاهزاً للنشر، أو أين تكمن نقاط الضعف المحددة.
تتضمن العملية عادةً تحديد مجال معين (على سبيل المثال، التشخيص الطبي، الاستدلال القانوني). بعد ذلك، يتم استخدام مجموعة بيانات منسقة، تمثل الحقيقة الأساسية، للاستعلام من نموذج الذكاء الاصطناعي. يقيس المعيار مخرجات النموذج مقابل هذه الحقيقة الأساسية عبر مقاييس مختلفة، مثل الدقة (precision)، والاستدعاء (recall)، ومقياس F1، أو التشابه الدلالي. النتيجة الناتجة هي نتيجة المعيار.
تعد معايير المعرفة حيوية في العديد من المجالات التشغيلية:
إن تصميم معيار شامل حقاً أمر صعب. يمكن أن تعاني المعايير من تحيز المجال (اختبار ما يعرفه المنشئ فقط) أو الافتقار إلى التعقيد الواقعي، مما يؤدي إلى درجات أداء مبالغ فيها لا تترجم إلى فائدة عملية.
تشمل المفاهيم ذات الصلة التحقق من صحة مجموعة البيانات (Dataset Validation)، والاختبار العدائي (Adversarial Testing)، ومقاييس الأداء (Performance Metrics). فبينما تحدد المقاييس مدى جودة أداء النموذج، يحدد المعيار ماذا يعني الأداء في سياق معين.