السياسة العصبية
تشير السياسة العصبية (Neural Policy) إلى دالة، يتم تنفيذها عادةً باستخدام شبكة عصبية، تقوم برسم خرائط للحالات الملحوظة في بيئة ما إلى توزيع احتمالي على الإجراءات الممكنة. في سياق التعلم المعزز (RL)، تمثل هذه الشبكة السياسة ($\pi$). فبدلاً من استخدام جدول بحث، تتعلم السياسة خرائط معقدة ومستمرة أو عالية الأبعاد مباشرةً من المدخلات الحسية الأولية.
غالباً ما تعتمد أنظمة التحكم التقليدية على قواعد مبرمجة مسبقاً أو خرائط بسيطة للحالة-الإجراء. تسمح السياسات العصبية لوكلاء الذكاء الاصطناعي بالتعامل مع البيئات ذات فضاءات الحالة الشاسعة والمستمرة أو غير القابلة للملاحظة جزئياً - وهي مواقف يكون فيها إنشاء القواعد يدوياً مستحيلاً أو غير قابل للتنفيذ حسابياً. إنها تمكّن الوكلاء من تعلم سلوكيات متطورة وقابلة للتكيف تتسم بالتعميم الجيد على السيناريوهات غير المرئية.
تتضمن العملية تدريب الشبكة العصبية باستخدام خوارزميات التعلم المعزز، مثل تدرجات السياسة (Policy Gradients) (على سبيل المثال، REINFORCE، A2C) أو طرق الممثل-الناقد (Actor-Critic). يتفاعل الوكيل مع البيئة، ويتلقى مكافآت أو عقوبات، ويستخدم هذه الإشارات لتعديل أوزان الشبكة العصبية. يحدد ناتج الشبكة احتمالية اتخاذ كل إجراء في حالة معينة، مما يحدد فعلياً استراتيجية سلوك الوكيل.
تعد السياسات العصبية أساسية في العديد من التطبيقات المتقدمة:
يرتبط هذا المفهوم ارتباطاً وثيقاً بدوال القيمة (Value Functions) (التي تقدر المكافآت المستقبلية المتوقعة)، والتعلم Q (Q-Learning) (الذي يتعلم قيم الإجراءات المثلى)، وهياكل الممثل-الناقد (Actor-Critic architectures) (التي تجمع بين تعلم السياسة وتقدير القيمة).