Bộ công cụ đa phương thức
Bộ công cụ Đa phương thức (Multimodal Toolkit) đề cập đến một bộ thư viện phần mềm, khuôn khổ và mô hình được huấn luyện trước toàn diện, được thiết kế để cho phép các hệ thống Trí tuệ Nhân tạo xử lý, hiểu và tạo thông tin từ nhiều loại dữ liệu cùng một lúc. Không giống như các hệ thống đơn phương thức (unimodal) chỉ xử lý văn bản hoặc chỉ xử lý hình ảnh, các công cụ đa phương thức cho phép AI liên kết thông tin giữa các đầu vào cảm giác khác nhau.
Nhận thức của con người vốn dĩ là đa phương thức; chúng ta hiểu thế giới bằng cách tích hợp thị giác, âm thanh và ngôn ngữ. Để AI đạt được khả năng hiểu ngang tầm con người, nó phải mô phỏng khả năng này. Các bộ công cụ đa phương thức rất quan trọng vì chúng mở ra khả năng hiểu ngữ cảnh sâu sắc hơn, dẫn đến các ứng dụng AI mạnh mẽ hơn, tinh tế hơn và chính xác hơn trên nhiều ngành công nghiệp.
Cơ chế cốt lõi bao gồm các bộ mã hóa chuyên biệt cho từng phương thức dữ liệu (ví dụ: CNN cho hình ảnh, Transformer cho văn bản, phân tích phổ âm thanh cho âm thanh). Các bộ mã hóa này chuyển đổi các đầu vào đa dạng thành một không gian nhúng (embedding space) chung, nhiều chiều. Sau đó, bộ công cụ sử dụng các cơ chế chú ý đa phương thức (cross-modal attention) để cho phép mô hình học các mối quan hệ giữa các nhúng này, từ đó cho phép suy luận thống nhất.
Các khái niệm liên quan bao gồm Học đa phương thức (Cross-Modal Learning), Học không cần mẫu (Zero-Shot Learning) và Các mô hình nền tảng (Foundation Models), những khái niệm này thường đóng vai trò là kiến trúc cơ bản cho các bộ công cụ đa phương thức tiên tiến.