Kiểm thử có thể giải thích
Kiểm thử có thể giải thích (XET) là một lĩnh vực chuyên biệt trong đảm bảo chất lượng phần mềm, tập trung vào việc xác minh không chỉ liệu một hệ thống có hoạt động hay không, mà còn tại sao nó lại đưa ra một kết quả cụ thể. Khi áp dụng cho các hệ thống phức tạp, đặc biệt là những hệ thống được điều khiển bởi Học máy (ML) hoặc Trí tuệ Nhân tạo (AI), XET đảm bảo rằng quy trình ra quyết định của mô hình là minh bạch, dễ hiểu và có thể được các bên liên quan của con người kiểm toán.
Trong phần mềm truyền thống, các lỗi thường có thể truy ngược về các dòng mã cụ thể. Trong các hệ thống AI, một câu trả lời sai có thể bắt nguồn từ dữ liệu huấn luyện bị thiên vị, sự tương tác của các đặc trưng, hoặc độ phức tạp của mô hình. XET giải quyết vấn đề 'hộp đen' này. Nó rất quan trọng để tuân thủ các quy định (ví dụ: GDPR, các quy định tài chính), xây dựng lòng tin của người dùng và gỡ lỗi các lỗi hệ thống tinh vi mà kiểm thử chức năng tiêu chuẩn bỏ sót.
XET tích hợp các kỹ thuật khả năng diễn giải trực tiếp vào vòng đời kiểm thử. Thay vì chỉ kiểm tra đầu vào A cho ra đầu ra B, người kiểm thử sử dụng các công cụ XAI để thăm dò mô hình. Điều này bao gồm các kỹ thuật như LIME (Giải thích mô hình cục bộ độc lập với mô hình) hoặc SHAP (Giải thích cộng gộp Shapley) để xác định đặc trưng đầu vào nào đóng góp đáng kể nhất vào một dự đoán nhất định. Sau đó, việc kiểm thử sẽ xác nhận rằng mô hình dựa trên các đặc trưng chính xác cho các quyết định của nó.
Thách thức chính là sự đánh đổi giữa hiệu suất mô hình và khả năng diễn giải. Các mô hình có hiệu suất cao và độ phức tạp cao (như mạng nơ-ron sâu) thường là những mô hình kém minh bạch nhất. Hơn nữa, việc tạo ra các lời giải thích đáng tin cậy tự nó đòi hỏi chuyên môn và tài nguyên tính toán chuyên biệt.
Lĩnh vực này chồng lấn đáng kể với Giám sát mô hình, Phát hiện thiên vị và Kiểm thử đối nghịch. Trong khi Phát hiện thiên vị tìm kiếm các kết quả không công bằng, XET tìm cách giải thích cơ chế dẫn đến những kết quả đó.