المُقيِّم التوليدي
المُقيِّم التوليدي (Generative Evaluator) هو نظام ذكاء اصطناعي مصمم ليس فقط لتسجيل أو تصنيف المخرجات، بل لتوليد بيانات مقارنة أو نقدية أو تركيبية بشكل نشط لتقييم جودة وتماسك وأداء نموذج توليدي آخر. على عكس المقاييس التقليدية التي تعتمد على قواعد محددة مسبقًا أو مطابقة الكلمات المفتاحية البسيطة، يستخدم المُقيِّم التوليدي قدراته التوليدية الخاصة لمحاكاة الحكم البشري أو تنفيذ المهام المعقدة.
مع تزايد تعقيد نماذج الذكاء الاصطناعي، لم يعد الاعتماد فقط على المقاييس الثابتة مثل BLEU أو ROUGE كافياً. يعالج المُقيِّم التوليدي قيود هذه المقاييس من خلال تقديم تقييم أكثر دقة ووعيًا بالسياق. وهي ضرورية لضمان تلبية النماذج اللغوية الكبيرة (LLMs) لمعايير الأداء في العالم الحقيقي، خاصة في المهام الذاتية مثل الكتابة الإبداعية، أو الاستدلال المعقد، أو مطابقة النبرة.
تتضمن العملية عادةً عدة مراحل. أولاً، ينتج النموذج المستهدف مخرجًا. ثانيًا، يُطرح على المُقيِّم التوليدي المدخل الأصلي، والمخرج المستهدف، ومجموعة من معايير التقييم. ثالثًا، يولد المُقيِّم نقدًا، أو ترتيبًا مقارنًا، أو نسخة مُحسّنة من المخرج، والتي تُستخدم بعد ذلك لاستخلاص درجة كمية أو نوعية. وهذا يسمح بالتحسين الذاتي والتنقيح التكراري.
يتم نشر المُقيِّمات التوليدية عبر مسارات عمل مختلفة للذكاء الاصطناعي:
يرتبط هذا المفهوم ارتباطًا وثيقًا بالتعلم المعزز من التغذية الراجعة البشرية (RLHF)، حيث يعمل المُقيِّم التوليدي كوكيل آلي ومتطور لتفضيلات البشر.