Tiêu chuẩn đánh giá có thể giải thích
Một Bộ tiêu chuẩn có khả năng giải thích (Explainable Benchmark) là một bộ bài kiểm tra tiêu chuẩn hóa không chỉ nhằm đo lường hiệu suất thô (độ chính xác, điểm F1) của một mô hình Trí tuệ Nhân tạo mà còn định lượng cách thức và lý do nó đưa ra các quyết định. Không giống như các bộ tiêu chuẩn truyền thống chỉ tập trung vào các chỉ số đầu ra, các bộ tiêu chuẩn này còn tích hợp các chỉ số liên quan đến khả năng diễn giải, tính mạnh mẽ và tính công bằng.
Trong các ứng dụng quan trọng—chẳng hạn như chẩn đoán y tế, phê duyệt khoản vay hoặc lái xe tự hành—một điểm độ chính xác cao là không đủ. Các bên liên quan yêu cầu sự đảm bảo rằng mô hình hoạt động một cách logic và có đạo đức. Các Bộ tiêu chuẩn có khả năng giải thích thu hẹp khoảng cách giữa hiệu suất cao và sự tin cậy cao, cho phép các nhà phát triển và cơ quan quản lý kiểm tra quy trình suy luận của AI.
Các bộ tiêu chuẩn này tích hợp nhiều lớp đánh giá khác nhau. Ngoài các chỉ số tiêu chuẩn, chúng thường yêu cầu mô hình phải đưa ra các lời giải thích (ví dụ: điểm quan trọng của đặc trưng, các ví dụ phản thực tế) cùng với dự đoán của nó. Sau đó, bộ tiêu chuẩn sẽ đánh giá chất lượng, tính ổn định và độ trung thực của các lời giải thích này so với sự thật cơ bản hoặc kỳ vọng của con người.
Việc phát triển các Bộ tiêu chuẩn có khả năng giải thích mạnh mẽ là một vấn đề phức tạp vì lời giải thích 'tốt' mang tính chủ quan. Không có tiêu chuẩn phổ quát nào về việc điều gì cấu thành một lời giải thích đủ rõ ràng hoặc trung thực trên tất cả các lĩnh vực.
Khái niệm này có liên quan chặt chẽ đến AI có khả năng giải thích (XAI), Khả năng diễn giải mô hình và Kiểm tra tính mạnh mẽ đối nghịch.