Suy luận biên
Suy luận biên (Edge Inference) đề cập đến quá trình thực thi các mô hình học máy—thực hiện suy luận—trên các thiết bị phần cứng cục bộ (ở 'biên') thay vì gửi dữ liệu đến máy chủ đám mây tập trung để xử lý. Điều này chuyển việc tính toán ra khỏi đám mây và lên chính thiết bị, chẳng hạn như điện thoại thông minh, cảm biến hoặc cổng cục bộ.
Việc chuyển sang suy luận biên giải quyết những hạn chế nghiêm trọng của AI chỉ dựa trên đám mây. Độ trễ được giảm đáng kể vì dữ liệu không cần phải truyền qua internet đến trung tâm dữ liệu từ xa. Hơn nữa, việc xử lý dữ liệu cục bộ giúp tăng cường quyền riêng tư của người dùng bằng cách giữ thông tin nhạy cảm trên thiết bị và giảm mức tiêu thụ băng thông, làm cho các ứng dụng đáng tin cậy hơn ngay cả khi kết nối không liên tục.
Việc triển khai suy luận biên đòi hỏi phải tối ưu hóa mô hình đã được huấn luyện cho các môi trường bị hạn chế tài nguyên. Điều này thường bao gồm lượng tử hóa mô hình, cắt tỉa và biên dịch bằng cách sử dụng các framework chuyên dụng (như TensorFlow Lite hoặc ONNX Runtime). Mô hình, được huấn luyện trước trên đám mây, sau đó được triển khai trên thiết bị biên, nơi nó sử dụng CPU, GPU hoặc các Đơn vị Xử lý Thần kinh (NPU) chuyên dụng cục bộ để đưa ra các dự đoán theo thời gian thực.
Suy luận biên cung cấp năng lượng cho vô số ứng dụng trong thế giới thực. Các ví dụ bao gồm phát hiện đối tượng theo thời gian thực trên camera an ninh, xử lý lệnh giọng nói trên loa thông minh, cảnh báo bảo trì dự đoán từ các cảm biến công nghiệp và lọc hình ảnh tức thời trên điện thoại di động. Xe tự hành phụ thuộc rất nhiều vào khả năng này để đưa ra quyết định ngay lập tức.
Những lợi thế chính là độ trễ thấp, tăng cường quyền riêng tư dữ liệu và khả năng phục hồi hoạt động. Bằng cách xử lý dữ liệu cục bộ, các hệ thống trở nên ít phụ thuộc hơn vào kết nối đám mây tốc độ cao liên tục, dẫn đến trải nghiệm người dùng mạnh mẽ và nhanh hơn.
Các thách thức chính bao gồm giới hạn kích thước mô hình, quản lý mức tiêu thụ điện năng trên các thiết bị chạy bằng pin và sự phức tạp của việc triển khai và quản lý các môi trường phần cứng đa dạng. Tối ưu hóa các mô hình để chạy hiệu quả trên các loại silicon công suất thấp khác nhau là một rào cản kỹ thuật đáng kể.
Khái niệm này có liên quan chặt chẽ đến TinyML (Học máy trên vi điều khiển), Học liên kết (Federated Learning - nơi các mô hình được huấn luyện cục bộ nhưng chia sẻ các bản cập nhật) và MLOps (các phương pháp được sử dụng để triển khai và duy trì các mô hình này trên các môi trường phân tán).