Người đánh giá ngôn ngữ tự nhiên
Bộ đánh giá ngôn ngữ tự nhiên (NLE) là một hệ thống hoặc phương pháp được thiết kế để đánh giá chất lượng, tính chính xác, tính mạch lạc và mức độ liên quan của văn bản được tạo ra bởi các mô hình Xử lý Ngôn ngữ Tự nhiên (NLP), chẳng hạn như các Mô hình Ngôn ngữ Lớn (LLM). Không giống như việc đối sánh từ khóa đơn giản, NLE cố gắng đánh giá chất lượng ngữ nghĩa của đầu ra dựa trên một tập hợp các tiêu chí được xác định trước hoặc một sự thật cơ bản.
Trong quá trình triển khai nhanh chóng của AI tạo sinh, việc đảm bảo chất lượng tự động là vô cùng quan trọng. NLE vượt ra ngoài các kiểm tra cú pháp cơ bản để đánh giá ý nghĩa của đầu ra. Điều này đảm bảo rằng các hệ thống AI không chỉ đúng ngữ pháp mà còn hữu ích, chính xác và phù hợp với ý định của người dùng, điều này rất quan trọng đối với việc áp dụng trong doanh nghiệp.
Các NLE hoạt động thông qua nhiều cơ chế khác nhau. Một số sử dụng các chỉ số tự động như BLEU, ROUGE hoặc METEOR để so sánh văn bản được tạo ra với các câu trả lời tham chiếu. Các NLE tiên tiến hơn sử dụng các mô hình AI phụ, thường nhỏ hơn, hoặc các hệ thống có sự tham gia của con người để chấm điểm đầu ra dựa trên các tiêu chí phức tạp như độ chính xác thực tế, giọng điệu và tính trôi chảy. Quá trình này bao gồm việc xác định một thang đánh giá và sau đó áp dụng logic đánh giá cho các phản hồi của mô hình.
Các khái niệm liên quan bao gồm Kỹ thuật nhắc lệnh (Prompt Engineering - thiết kế đầu vào để có đầu ra tối ưu), Học tăng cường từ phản hồi của con người (RLHF - sử dụng điểm số của con người để huấn luyện mô hình) và Tìm kiếm ngữ nghĩa (Semantic Search - hiểu ý nghĩa đằng sau truy vấn và phản hồi).