Ngăn xếp Đa phương thức
Ngăn xếp Đa phương thức (Multimodal Stack) đề cập đến một kiến trúc tích hợp trong hệ thống AI được thiết kế để xử lý, hiểu và tạo ra thông tin trên nhiều loại dữ liệu cùng một lúc. Thay vì chỉ dựa vào văn bản (như các Mô hình Ngôn ngữ Lớn truyền thống), ngăn xếp này kết hợp các đầu vào như hình ảnh, âm thanh, video và dữ liệu có cấu trúc.
Các tương tác kỹ thuật số hiện đại vốn dĩ là đa phương thức. Người dùng không chỉ nhập truy vấn bằng văn bản; họ tải lên ảnh chụp màn hình, nói lệnh và xem các bản trình diễn. Ngăn xếp đa phương thức cho phép các giải pháp AI mô phỏng nhận thức của con người, dẫn đến các ứng dụng tinh tế, chính xác và nhận biết ngữ cảnh hơn rất nhiều. Nó đưa AI từ một công cụ chỉ xử lý văn bản trở thành một trợ lý kỹ thuật số toàn diện.
Cơ chế cốt lõi bao gồm các bộ mã hóa chuyên biệt cho từng loại dữ liệu (ví dụ: Vision Transformer cho hình ảnh, mô hình Whisper cho âm thanh). Các bộ mã hóa này dịch các dữ liệu khác biệt thành một không gian nhúng (embedding space) chung, nhiều chiều. Biểu diễn thống nhất này cho phép một mô hình trung tâm—thường là một bộ biến đổi (transformer) lớn—lý luận xuyên suốt các phương thức, kết nối các khái niệm thị giác với mô tả văn bản hoặc các tín hiệu âm thanh.
Các khái niệm liên quan bao gồm Mô hình Nền tảng (Foundation Models), Cơ sở dữ liệu Vector (Vector Databases) và Truy xuất Đa phương thức (Cross-Modal Retrieval). Các công nghệ này thường tạo thành cơ sở hạ tầng cơ bản cho phép một ngăn xếp đa phương thức hoạt động.