Chính sách thần kinh
Chính sách Thần kinh (Neural Policy) đề cập đến một hàm, thường được triển khai bằng mạng nơ-ron, ánh xạ các trạng thái quan sát được của một môi trường tới một phân phối xác suất trên các hành động khả thi. Trong bối cảnh Học tăng cường (RL), mạng này chính là chính sách ($\pi$). Thay vì sử dụng bảng tra cứu, chính sách học các ánh xạ phức tạp, liên tục hoặc nhiều chiều trực tiếp từ dữ liệu cảm biến thô.
Các hệ thống điều khiển truyền thống thường dựa vào các quy tắc được lập trình sẵn hoặc các ánh xạ trạng thái-hành động đơn giản. Chính sách Thần kinh cho phép các tác nhân AI xử lý các môi trường có không gian trạng thái rộng lớn, liên tục hoặc quan sát một phần—những tình huống mà việc tạo quy tắc thủ công là không thể hoặc không khả thi về mặt tính toán. Chúng cho phép các tác nhân học các hành vi tinh vi, thích ứng và tổng quát hóa tốt cho các kịch bản chưa từng thấy.
Quá trình này bao gồm việc huấn luyện mạng nơ-ron bằng các thuật toán RL, chẳng hạn như Gradient Chính sách (Policy Gradients) (ví dụ: REINFORCE, A2C) hoặc các phương pháp Actor-Critic. Tác nhân tương tác với môi trường, nhận phần thưởng hoặc hình phạt, và sử dụng các tín hiệu này để điều chỉnh trọng số của mạng nơ-ron. Đầu ra của mạng quyết định xác suất thực hiện mỗi hành động trong một trạng thái nhất định, về cơ bản xác định chiến lược hành vi của tác nhân.
Chính sách Thần kinh là nền tảng trong một số ứng dụng tiên tiến:
Khái niệm này có liên quan chặt chẽ đến Hàm Giá trị (Value Functions) (ước tính phần thưởng tương lai kỳ vọng), Q-Learning (học các giá trị hành động tối ưu), và kiến trúc Actor-Critic (kết hợp học chính sách với ước tính giá trị).