Chính sách dựa trên mô hình
Chính sách Dựa trên Mô hình (Model-Based Policy) đề cập đến một tập hợp các quy tắc hoặc một hàm đã học trong hệ thống trí tuệ nhân tạo, quy định cách hệ thống nên hành động hoặc đưa ra quyết định dựa trên một biểu diễn nội bộ (một 'mô hình') về môi trường của nó. Thay vì chỉ dựa vào các quy tắc phản ứng hoặc logic được lập trình sẵn, hệ thống sử dụng mô hình đã học của mình để dự đoán các kết quả trong tương lai và chọn hành động tối ưu.
Trong các môi trường phức tạp, năng động—như robot học, giao dịch tự động, hoặc quản lý tài nguyên quy mô lớn—các chính sách phản ứng đơn giản sẽ thất bại vì chúng không thể lường trước được hậu quả. Các Chính sách Dựa trên Mô hình cho phép các tác nhân AI mô phỏng các kịch bản tiềm năng bên trong trước khi cam kết thực hiện hành động, dẫn đến hành vi chủ động, mạnh mẽ và hiệu quả hơn đáng kể.
Quá trình này thường bao gồm ba giai đoạn:
Khái niệm này có liên quan chặt chẽ đến Học tăng cường (Reinforcement Learning - RL), đặc biệt là RL Dựa trên Mô hình (Model-Based RL). Nó cũng giao thoa với các Thuật toán Lập kế hoạch và các kỹ thuật Ước tính Trạng thái.