Mô hình liên kết
Mô hình Liên kết (Federated Model), thường được triển khai thông qua Học Liên kết (Federated Learning - FL), là một mô hình học máy huấn luyện một mô hình toàn cục chung trên mạng lưới các thiết bị biên hoặc máy chủ phi tập trung đang lưu giữ các mẫu dữ liệu cục bộ, mà không cần trao đổi dữ liệu thô. Thay vì tập hợp dữ liệu nhạy cảm vào một vị trí trung tâm, mô hình sẽ di chuyển đến dữ liệu.
Trong thời đại các quy định nghiêm ngặt về dữ liệu như GDPR và CCPA, việc tập trung hóa dữ liệu người dùng nhạy cảm ngày càng rủi ro và thường không tuân thủ. Các Mô hình Liên kết giải quyết vấn đề này bằng cách cho phép các tổ chức tận dụng các tập dữ liệu phân tán khổng lồ—chẳng hạn như những dữ liệu nằm trên điện thoại di động, bệnh viện hoặc máy chủ chi nhánh cục bộ—để xây dựng các mô hình AI mạnh mẽ trong khi vẫn giữ dữ liệu được cục bộ hóa và riêng tư.
Quá trình này bao gồm nhiều bước lặp đi lặp lại. Đầu tiên, một máy chủ trung tâm gửi phiên bản hiện tại của mô hình toàn cục đến các máy khách tham gia được chọn. Sau đó, mỗi máy khách huấn luyện mô hình này cục bộ bằng cách sử dụng tập dữ liệu độc quyền của mình. Sau khi huấn luyện cục bộ, các máy khách chỉ gửi các cập nhật mô hình (ví dụ: cập nhật gradient hoặc thay đổi trọng số) trở lại máy chủ trung tâm, chứ không phải dữ liệu thô. Máy chủ sau đó tổng hợp các cập nhật này—thường sử dụng các kỹ thuật như Trung bình Liên kết (Federated Averaging - FedAvg)—để tạo ra một mô hình toàn cục được cải tiến, sau đó được phân phối lại cho vòng huấn luyện tiếp theo.
Các Mô hình Liên kết có tính ứng dụng cao trong các kịch bản mà dữ liệu không thể rời khỏi nguồn gốc của nó. Các ví dụ bao gồm: huấn luyện các mô hình văn bản dự đoán trên điện thoại thông minh của người dùng, phát triển AI chẩn đoán trong các mạng lưới đa bệnh viện mà không cần chia sẻ hồ sơ bệnh nhân, hoặc cải thiện phát hiện gian lận trên nhiều tổ chức tài chính.
Những ưu điểm chính là tăng cường quyền riêng tư và tuân thủ dữ liệu, giảm chi phí truyền tải dữ liệu, và khả năng huấn luyện trên dữ liệu thực tế, đa dạng cao mà nếu không sẽ bị cô lập do các hạn chế về quản trị. Điều này dẫn đến các mô hình mạnh mẽ và có khả năng tổng quát hóa hơn.
Việc triển khai FL đưa ra những rào cản kỹ thuật. Những thách thức này bao gồm quản lý tính không đồng nhất của hệ thống (các thiết bị có sức mạnh tính toán khác nhau), xử lý dữ liệu không IID (không độc lập và đồng nhất) trên các máy khách, và đảm bảo tính bảo mật của các cập nhật mô hình được truyền đi trước các cuộc tấn công suy luận.
Khái niệm này có liên quan chặt chẽ đến Quyền riêng tư Vi phân (Differential Privacy - thêm nhiễu vào các cập nhật để ngăn chặn việc tái tạo ngược các điểm dữ liệu riêng lẻ) và Tổng hợp An toàn (Secure Aggregation - đảm bảo máy chủ trung tâm không thể nhìn thấy các cập nhật của từng máy khách).