Người đánh giá kiến thức
Bộ đánh giá tri thức (Knowledge Evaluator) là một hệ thống, quy trình hoặc chỉ số được thiết kế để đánh giá một cách có hệ thống tính chính xác, tính đầy đủ, tính liên quan và độ sâu của tri thức chứa trong một mô hình AI, đồ thị tri thức hoặc dữ liệu huấn luyện của mô hình ngôn ngữ lớn (LLM). Chức năng chính của nó là vượt ra ngoài các chỉ số hiệu suất đơn giản (như độ chính xác trong một tác vụ cụ thể) để đánh giá chất lượng và độ tin cậy của thông tin cơ bản.
Trong các ứng dụng AI hiện đại, chất lượng của đầu ra tỷ lệ thuận với chất lượng của tri thức đầu vào. Một Bộ đánh giá tri thức tinh vi đảm bảo rằng AI không chỉ trôi chảy mà còn chính xác về mặt sự kiện. Điều này rất quan trọng đối với việc áp dụng trong doanh nghiệp, nơi các lỗi trong việc truy xuất tri thức hoặc ghi nhớ sự kiện có thể dẫn đến rủi ro hoạt động, tài chính hoặc uy tín đáng kể.
Quy trình đánh giá thường bao gồm nhiều giai đoạn:
Khái niệm này có liên quan chặt chẽ đến Xác thực Mô hình (Model Validation), Đảm bảo Chất lượng Dữ liệu (Data Quality Assurance) và Phát hiện Ảo giác (Hallucination Detection), tất cả đều dựa trên các phương pháp thử nghiệm nghiêm ngặt.