السياسة القائمة على النماذج
تشير السياسة القائمة على النموذج (Model-Based Policy) إلى مجموعة من القواعد أو دالة مُتعلَّمة ضمن نظام ذكاء اصطناعي تحدد كيفية تصرف النظام أو اتخاذ القرارات بناءً على تمثيل داخلي (يُسمى "النموذج") لبيئته. فبدلاً من الاعتماد فقط على القواعد التفاعلية أو المنطق المبرمج مسبقًا، يستخدم النظام نموذجه المُتعلَّم للتنبؤ بالنتائج المستقبلية واختيار الإجراء الأمثل.
في البيئات المعقدة والديناميكية - مثل الروبوتات، أو التداول الآلي، أو إدارة الموارد على نطاق واسع - تفشل السياسات التفاعلية البسيطة لأنها لا تستطيع استباق العواقب. تسمح السياسات القائمة على النموذج لوكلاء الذكاء الاصطناعي بمحاكاة السيناريوهات المحتملة داخليًا قبل الالتزام بإجراء ما، مما يؤدي إلى سلوك أكثر قوة واستباقية وكفاءة بشكل ملحوظ.
تتضمن العملية عمومًا ثلاث مراحل:
يرتبط هذا المفهوم ارتباطًا وثيقًا بالتعلم المعزز (RL)، وتحديداً التعلم المعزز القائم على النموذج (Model-Based RL). كما يتقاطع مع خوارزميات التخطيط وتقنيات تقدير الحالة.