Chưng cất mô hình
Chưng cất mô hình (Model Distillation) là một kỹ thuật nén mô hình, trong đó một mô hình lớn, có hiệu suất cao (mô hình 'Giáo viên') được sử dụng để huấn luyện một mô hình nhỏ hơn, đơn giản hơn (mô hình 'Học sinh'). Thay vì chỉ huấn luyện mô hình Học sinh dựa trên các nhãn sự thật (ground-truth labels), nó còn được huấn luyện để bắt chước các xác suất đầu ra (các 'mục tiêu mềm' - soft targets) do mô hình Giáo viên tạo ra.
Trong trí tuệ nhân tạo hiện đại, các mô hình tiên tiến thường rất lớn, đòi hỏi tài nguyên tính toán đáng kể (độ trễ cao, bộ nhớ lớn). Điều này gây khó khăn cho việc triển khai trên các thiết bị có tài nguyên hạn chế như điện thoại di động, cảm biến IoT, hoặc trong các môi trường điện toán biên thời gian thực. Chưng cất cho phép các tổ chức giữ lại phần lớn kiến thức phức tạp của mô hình Giáo viên trong khi giảm đáng kể kích thước và thời gian suy luận của mô hình Học sinh.
Cơ chế cốt lõi liên quan đến việc truyền tải 'kiến thức ẩn' (dark knowledge). Mô hình Giáo viên không chỉ đưa ra một dự đoán cứng (ví dụ: 'Mèo'), mà còn đưa ra một phân phối xác suất trên tất cả các lớp có thể có (ví dụ: 90% Mèo, 8% Chó, 2% Chim). Phân phối này chứa thông tin tinh tế về sự không chắc chắn và mối quan hệ giữa các lớp của mô hình. Sau đó, mô hình Học sinh được huấn luyện bằng một hàm mất mát kết hợp: một thành phần giảm thiểu sự khác biệt giữa dự đoán của nó và các nhãn thực (mục tiêu cứng), và thành phần thứ hai giảm thiểu sự khác biệt giữa dự đoán của nó và các mục tiêu mềm của mô hình Giáo viên.