التعلم المعزز من التغذية الراجعة البشرية
التعلم المعزز من التغذية الراجعة البشرية (RLHF) هو تقنية تُستخدم لضبط النماذج اللغوية الكبيرة (LLMs) وعملاء الذكاء الاصطناعي الآخرين. وهي تسد الفجوة بين التنبؤ الخام للنموذج والتفضيلات البشرية المرجوة من خلال دمج التقييمات الصريحة من المقيمين البشريين في حلقة التدريب.
يُحسّن التعلم الآلي التقليدي دالة هدف رياضية. ومع ذلك، فإن الأهداف البشرية - مثل المساعدة، وعدم الضرر، والالتزام بالتعليمات المعقدة - غالبًا ما تكون ذاتية ويصعب تحديدها كميًا بشكل مباشر. يسمح RLHF للمطورين بمواءمة سلوك الذكاء الاصطناعي مع القيم الإنسانية الدقيقة، مما يجعل النموذج الناتج أكثر أمانًا وفائدة في التطبيقات الواقعية.
يتضمن RLHF عادةً عملية من ثلاث خطوات:
يُعد RLHF أمرًا بالغ الأهمية لنشر الذكاء الاصطناعي التوليدي المتقدم. تشمل التطبيقات الشائعة ما يلي:
الميزة الأساسية لـ RLHF هي تحسين المواءمة. فهو ينقل النماذج إلى ما هو أبعد من مجرد الدقة الإحصائية نحو المنفعة الوظيفية. ويؤدي هذا إلى: زيادة رضا المستخدم، وتقليل توليد المحتوى السام، وسلوك نموذج أكثر قابلية للتنبؤ عبر الموجهات المتنوعة.
يُعد تطبيق RLHF مكثفًا حسابيًا ومعقدًا. تشمل التحديات الرئيسية ما يلي:
يرتبط RLHF ارتباطًا وثيقًا بتعلم التفضيلات (Preference Learning)، والذكاء الاصطناعي الدستوري (Constitutional AI) (الذي يستخدم مجموعة من القواعد الصريحة بدلاً من المقارنة البشرية البحتة)، وتقنيات التعلم المعزز القياسية مثل طرق تدرج السياسة (Policy Gradient methods).