Bộ xử lý thần kinh
Bộ xử lý thần kinh (Neural Engine) là một đơn vị xử lý chuyên dụng, thường được tích hợp vào Hệ thống trên Chip (SoC), được thiết kế đặc biệt để xử lý các phép toán toán học chuyên sâu mà các mô hình Trí tuệ Nhân tạo (AI) và Học máy (ML) yêu cầu. Không giống như CPU đa dụng hay thậm chí là GPU tiêu chuẩn, Bộ xử lý thần kinh được tối ưu hóa cho các phép nhân ma trận và phép tích chập song song, vốn là nền tảng của học sâu.
Sự trỗi dậy của các ứng dụng AI phức tạp—chẳng hạn như nhận dạng hình ảnh thời gian thực, xử lý ngôn ngữ tự nhiên và phân tích dự đoán—đòi hỏi sức mạnh tính toán khổng lồ. Các bộ xử lý truyền thống có thể hoạt động kém hiệu quả khi chạy các mô hình này, dẫn đến độ trễ cao và mức tiêu thụ điện năng đáng kể. Bộ xử lý thần kinh giải quyết vấn đề này bằng cách cung cấp khả năng tăng tốc phần cứng chuyên dụng, hiệu suất cao, cho phép các tác vụ AI phức tạp chạy cục bộ, nhanh hơn và với mức tiêu thụ năng lượng thấp hơn.
Về cốt lõi, Bộ xử lý thần kinh được thiết kế kiến trúc để thực hiện các phép tính mạng nơ-ron với khả năng song song cực cao. Nó được chế tạo để thực hiện suy luận—quá trình sử dụng một mô hình đã được huấn luyện để đưa ra dự đoán—rất nhanh. Nó đạt được điều này thông qua các mảng systolic chuyên dụng hoặc các cấu trúc tương tự, cho phép hàng nghìn phép toán nhân-cộng (MACs) xảy ra đồng thời. Sự chuyên biệt hóa này giúp bỏ qua chi phí liên quan đến các tập lệnh đa dụng, làm cho nó lý tưởng cho các phép tính có cấu trúc và lặp đi lặp lại vốn có trong mạng nơ-ron.
Bộ xử lý thần kinh là các thành phần quan trọng trong nhiều công nghệ hiện đại:
Các lợi ích chính của việc sử dụng Bộ xử lý thần kinh có ba khía cạnh: hiệu năng, hiệu suất và độ trễ.
Mặc dù mạnh mẽ, việc triển khai và tối ưu hóa cho Bộ xử lý thần kinh đặt ra những thách thức. Lượng tử hóa mô hình (giảm độ chính xác của trọng số và kích hoạt) thường là cần thiết để đưa các mô hình vào giới hạn của bộ xử lý một cách hiệu quả. Hơn nữa, các nhà phát triển phải sử dụng các framework và trình biên dịch được tối ưu hóa đặc biệt để ánh xạ đồ thị ML của họ một cách hiệu quả lên kiến trúc độc đáo của bộ xử lý.