Đánh giá viên tạo sinh
Trình đánh giá tạo sinh (Generative Evaluator) là một hệ thống AI được thiết kế không chỉ để chấm điểm hoặc phân loại các kết quả đầu ra, mà còn để chủ động tạo ra dữ liệu so sánh, phê bình hoặc tổng hợp nhằm đánh giá chất lượng, tính mạch lạc và hiệu suất của một mô hình tạo sinh khác. Không giống như các chỉ số truyền thống dựa trên các quy tắc được xác định trước hoặc đối sánh từ khóa đơn giản, trình đánh giá tạo sinh sử dụng khả năng tạo sinh của chính nó để mô phỏng sự phán đoán của con người hoặc việc thực hiện các tác vụ phức tạp.
Khi các mô hình AI trở nên phức tạp hơn, việc chỉ dựa vào các chỉ số tĩnh như BLEU hay ROUGE là không đủ. Các Trình đánh giá tạo sinh giải quyết những hạn chế của các chỉ số này bằng cách cung cấp một đánh giá tinh tế hơn, nhận thức được ngữ cảnh. Chúng rất quan trọng để đảm bảo rằng các mô hình ngôn ngữ lớn (LLM) đáp ứng các tiêu chuẩn hiệu suất trong thế giới thực, đặc biệt trong các tác vụ mang tính chủ quan như viết sáng tạo, suy luận phức tạp hoặc phù hợp về giọng điệu.
Quy trình này thường bao gồm nhiều giai đoạn. Đầu tiên, mô hình mục tiêu tạo ra một kết quả đầu ra. Thứ hai, trình đánh giá tạo sinh được cung cấp lời nhắc (prompt) với đầu vào gốc, kết quả đầu ra mục tiêu và một bộ tiêu chí đánh giá. Thứ ba, trình đánh giá tạo ra một bài phê bình, một bảng xếp hạng so sánh, hoặc một phiên bản tinh chỉnh của kết quả đầu ra, sau đó được sử dụng để suy ra một điểm số định lượng hoặc định tính. Điều này cho phép tự cải tiến và tinh chỉnh lặp đi lặp lại.
Các Trình đánh giá tạo sinh được triển khai trong nhiều quy trình AI khác nhau:
Khái niệm này có liên quan chặt chẽ đến Học tăng cường từ Phản hồi của Con người (RLHF), trong đó trình đánh giá tạo sinh đóng vai trò là một đại diện tự động, tinh vi cho dữ liệu sở thích của con người.